{
  "id": 7549,
  "url": "https://arxiv.org/abs/2603.07427v2",
  "title": "AutoControl Arena: Synthesizing Executable Test Environments for Frontier AI Risk Evaluation",
  "summary": "As Large Language Models (LLMs) evolve into autonomous agents, existing safety evaluations face a fundamental trade-off: manual benchmarks are costly, while LLM-based simulators are scalable but suffer from logic hallucination. We present AutoControl Arena, an automated framework for frontier AI risk evaluation built on the principle of logic-narrative decoupling. By grounding deterministic state in executable code while delegating generative dynamics to LLMs, we mitigate hallucination while mai",
  "authors": "Changyi Li, Pengfei Lu, Xudong Pan, Fazl Barez, Min Yang",
  "category": "research",
  "topics": "agents-autonomy,environment",
  "orgs": null,
  "regions": null,
  "published_at": "2026-03-08T02:49:45.000Z",
  "fetched_at": "2026-07-14T16:33:16.670Z",
  "source_slug": "arxiv-ethics",
  "source_name": "arXiv",
  "source_homepage": "https://arxiv.org",
  "ethics_ai_record_url": "https://ethics.ai/record/7549",
  "original_url": "https://arxiv.org/abs/2603.07427v2",
  "evidence_status": "source-only",
  "attribution": "via ethics.ai"
}