{
  "id": 5939,
  "url": "https://arxiv.org/abs/2604.11477v1",
  "title": "OOM-RL: Out-of-Money Reinforcement Learning Market-Driven Alignment for LLM-Based Multi-Agent Systems",
  "summary": "The alignment of Multi-Agent Systems (MAS) for autonomous software engineering is constrained by evaluator epistemic uncertainty. Current paradigms, such as Reinforcement Learning from Human Feedback (RLHF) and AI Feedback (RLAIF), frequently induce model sycophancy, while execution-based environments suffer from adversarial \"Test Evasion\" by unconstrained agents. In this paper, we introduce an objective alignment paradigm: \\textbf{Out-of-Money Reinforcement Learning (OOM-RL)}. By deploying agen",
  "authors": "Kun Liu, Liqun Chen",
  "category": "research",
  "topics": "safety-alignment,agents-autonomy,environment",
  "orgs": null,
  "regions": null,
  "published_at": "2026-04-13T13:45:42.000Z",
  "fetched_at": "2026-07-14T16:32:06.470Z",
  "source_slug": "arxiv-ethics",
  "source_name": "arXiv",
  "source_homepage": "https://arxiv.org",
  "ethics_ai_record_url": "https://ethics.ai/record/5939",
  "original_url": "https://arxiv.org/abs/2604.11477v1",
  "evidence_status": "source-only",
  "attribution": "via ethics.ai"
}