{
  "id": 18007,
  "url": "https://arxiv.org/abs/2608.09542v1",
  "title": "Dual-Adversarial Safety Alignment: Cultivating Intrinsic Threat Comprehension in LRMs",
  "summary": "Large reasoning models (LRMs) achieve remarkable success on complex tasks but remain vulnerable to harmful prompts that induce unsafe outputs. Recent methods align LRMs using direct refusals or safety rationales, yet often focus on prompt patterns rather than intrinsic attack mechanisms. As a result, these pattern-centric alignments struggle to generalize across diverse jailbreaks, compromising adversarial robustness and reasoning utility. We propose AdvSafe, a dual-adversarial framework that en",
  "authors": "Hongli Shen, Shaopeng Fu, Qinbo Zhang, Jian Li, Di Wang",
  "category": "research",
  "topics": "safety-alignment",
  "orgs": null,
  "regions": null,
  "published_at": "2026-08-10T12:40:02.000Z",
  "fetched_at": "2026-08-11T05:10:37.351Z",
  "source_slug": "arxiv-ethics",
  "source_name": "arXiv",
  "source_homepage": "https://arxiv.org",
  "ethics_ai_record_url": "https://ethics.ai/record/18007",
  "original_url": "https://arxiv.org/abs/2608.09542v1",
  "evidence_status": "source-only",
  "attribution": "via ethics.ai"
}