{
  "id": 16268,
  "url": "https://arxiv.org/abs/2608.03745v1",
  "title": "Risky Business: Measuring The Faithfulness-Safety Tension",
  "summary": "Chain-of-Thought (CoT) reasoning offers a promising window into model monitoring. However, monitoring relies on faithfulness, i.e., the model output strictly derives from its reasoning trace. We identify an alignment tension where a model must be faithful enough to be monitored, yet robust enough to reject unsafe reasoning. We demonstrate that this counterbalance exists in current Large Reasoning Models (LRMs), and show ways in which it can be addressed. We introduce HazMart, a human-written dat",
  "authors": "Dominik Meier, Luca Joshua Francis, Marco Bernhard Kaiser, Terry Ruas, Jan Philip Wahle, Bela Gipp",
  "category": "research",
  "topics": "safety-alignment",
  "orgs": null,
  "regions": null,
  "published_at": "2026-08-04T14:38:06.000Z",
  "fetched_at": "2026-08-05T05:10:44.550Z",
  "source_slug": "arxiv-ethics",
  "source_name": "arXiv",
  "source_homepage": "https://arxiv.org",
  "ethics_ai_record_url": "https://ethics.ai/record/16268",
  "original_url": "https://arxiv.org/abs/2608.03745v1",
  "evidence_status": "source-only",
  "attribution": "via ethics.ai"
}