{
  "id": 678,
  "url": "https://arxiv.org/abs/2606.23937v1",
  "title": "When Retrieval Metrics Mislead: Measuring Policy Signal in Long-Horizon Tool-Use Agents",
  "summary": "Exact-match retrieval recall is often used as a proxy for whether a retriever supplies useful policy context to a downstream decision model. We test this proxy for pre-action policy classification in tau-bench using Qwen2.5-3B/7B classifiers. Under gold-policy conditioning, a compact structured state improves macro-F1 over raw trajectories by 0.13-0.17 after tuning. We then replace the benchmark-designated policy clause with the top-ranked clause retrieved from decision-time context. Although th",
  "authors": "Tianyu Ding, Juan Pablo De la Cruz Weinstein",
  "category": "research",
  "topics": "regulation,agents-autonomy",
  "orgs": null,
  "regions": null,
  "published_at": "2026-06-22T20:57:11.000Z",
  "fetched_at": "2026-07-14T14:14:41.553Z",
  "source_slug": "arxiv-ethics",
  "source_name": "arXiv",
  "source_homepage": "https://arxiv.org",
  "ethics_ai_record_url": "https://ethics.ai/record/678",
  "original_url": "https://arxiv.org/abs/2606.23937v1",
  "evidence_status": "source-only",
  "attribution": "via ethics.ai"
}