{
  "id": 4149,
  "url": "https://arxiv.org/abs/2605.17971v1",
  "title": "Babel: Jailbreaking Safety Attention via Obfuscation Distribution Optimized Sampling",
  "summary": "Despite rigorous safety alignment, Large Language Models (LLMs) remain vulnerable to jailbreak attacks. Existing black-box methods often rely on heuristic templates or exhaustive trials, lacking mechanistic interpretability and query efficiency. In this study, we investigate an intrinsic vulnerability in the safety mechanisms of LLMs, where safety alignment relies on a small set of sparsely distributed attention heads, leaving much of the representational space weakly monitored. We formalize thi",
  "authors": "Ziwei Wang, Jing Chen, Ruichao Liang, Zhi Wang, Yebo Feng, Ju Jia et al.",
  "category": "research",
  "topics": "safety-alignment,finance-investment",
  "orgs": null,
  "regions": null,
  "published_at": "2026-05-18T07:27:59.000Z",
  "fetched_at": "2026-07-14T16:30:45.941Z",
  "source_slug": "arxiv-ethics",
  "source_name": "arXiv",
  "source_homepage": "https://arxiv.org",
  "ethics_ai_record_url": "https://ethics.ai/record/4149",
  "original_url": "https://arxiv.org/abs/2605.17971v1",
  "evidence_status": "source-only",
  "attribution": "via ethics.ai"
}