{
  "id": 18792,
  "url": "https://arxiv.org/abs/2608.11698v1",
  "title": "REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation",
  "summary": "On-policy distillation (OPD) trains a student on its own trajectories under dense token-level supervision from a teacher. Reward-extrapolation methods such as ExOPD amplify the teacher-reference log-likelihood ratio to move beyond direct imitation, but apply a single global coefficient $λ$ to every token. This can drive the student to fit extreme peaks in the implicit reward, causing reward hacking and unstable training, and the optimal $λ$ varies across domains, requiring costly sweeps. We prop",
  "authors": "Yang Sun, Lichao Ma, Houyuan Qin, Yuxin Liu, Hanyang Lu, Yao Zhu et al.",
  "category": "research",
  "topics": "regulation,children-education",
  "orgs": null,
  "regions": null,
  "published_at": "2026-08-12T06:15:33.000Z",
  "fetched_at": "2026-08-13T05:10:37.786Z",
  "source_slug": "arxiv-ethics",
  "source_name": "arXiv",
  "source_homepage": "https://arxiv.org",
  "ethics_ai_record_url": "https://ethics.ai/record/18792",
  "original_url": "https://arxiv.org/abs/2608.11698v1",
  "evidence_status": "source-only",
  "attribution": "via ethics.ai"
}