{
  "id": 4401,
  "url": "https://arxiv.org/abs/2605.13217v1",
  "title": "GAGPO: Generalized Advantage Grouped Policy Optimization",
  "summary": "Reinforcement learning has become a powerful paradigm for post-training large language model agents, yet credit assignment in multi-turn environments remains a challenge. Agents often receive sparse, trajectory-level rewards only at the end of an episode, making it difficult to determine which intermediate actions contributed to success or failure. As a result, propagating delayed outcomes back to individual decision steps without relying on costly auxiliary value models remains an open problem.",
  "authors": "Siyuan Zhu, Chao Yu, Rongxin Yang, Zongkai Liu, Jinjun Hu, Qiwen Chen et al.",
  "category": "research",
  "topics": "regulation,agents-autonomy,environment",
  "orgs": null,
  "regions": null,
  "published_at": "2026-05-13T09:10:03.000Z",
  "fetched_at": "2026-07-14T16:30:59.236Z",
  "source_slug": "arxiv-ethics",
  "source_name": "arXiv",
  "source_homepage": "https://arxiv.org",
  "ethics_ai_record_url": "https://ethics.ai/record/4401",
  "original_url": "https://arxiv.org/abs/2605.13217v1",
  "evidence_status": "source-only",
  "attribution": "via ethics.ai"
}