{
  "id": 12272,
  "url": "https://arxiv.org/abs/2607.16872v1",
  "title": "Trace-Based On-Policy Distillation for Masked Diffusion Language Models",
  "summary": "Diffusion large language models (dLLMs) are a promising alternative to autoregressive generation. However, reasoning-oriented post-training for dLLMs remains challenging. Supervised fine-tuning (SFT) for dLLMs requires dense but often off-policy masked states, while reinforcement learning (RL) relies on sparse rewards or value modeling. This paper proposes \\textbf{trace-based on-policy distillation (TOPD)}, a teacher-supervised framework that transfers reasoning ability to a target dLLM without",
  "authors": "Haolin Ren, Ziyang Huang, Chenhao Yuan, Jun Zhao, Kang Liu",
  "category": "research",
  "topics": "regulation",
  "orgs": null,
  "regions": null,
  "published_at": "2026-07-18T16:25:17.000Z",
  "fetched_at": "2026-07-21T05:10:12.656Z",
  "source_slug": "arxiv-cslg",
  "source_name": "arXiv cs.LG",
  "source_homepage": "https://arxiv.org/list/cs.LG/recent",
  "ethics_ai_record_url": "https://ethics.ai/record/12272",
  "original_url": "https://arxiv.org/abs/2607.16872v1",
  "evidence_status": "source-only",
  "attribution": "via ethics.ai"
}