{
  "id": 7360,
  "url": "https://arxiv.org/abs/2603.11321v2",
  "title": "Hindsight-Anchored Policy Optimization: Turning Failure into Feedback in Sparse Reward Settings",
  "summary": "Reinforcement Learning with Verifiable Rewards (RLVR) has emerged as a promising paradigm for post-training reasoning models. However, group-based methods such as Group Relative Policy Optimization (GRPO) face a critical dilemma in sparse-reward settings: pure Reinforcement Learning (RL) suffers from advantage collapse and high-variance gradient estimation, while mixed-policy optimization introduces persistent distributional bias. To resolve this dilemma, we introduce Hindsight-Anchored Policy O",
  "authors": "Yuning Wu, Ke Wang, Devin Chen, Kai Wei",
  "category": "research",
  "topics": "bias-fairness,regulation",
  "orgs": null,
  "regions": null,
  "published_at": "2026-03-11T21:33:41.000Z",
  "fetched_at": "2026-07-14T16:33:08.016Z",
  "source_slug": "arxiv-ethics",
  "source_name": "arXiv",
  "source_homepage": "https://arxiv.org",
  "ethics_ai_record_url": "https://ethics.ai/record/7360",
  "original_url": "https://arxiv.org/abs/2603.11321v2",
  "evidence_status": "source-only",
  "attribution": "via ethics.ai"
}