{
  "id": 433,
  "url": "https://arxiv.org/abs/2606.30851v1",
  "title": "Test-Time Verification for Text-to-SQL via Outcome Reward Models",
  "summary": "Improving the reliability of large language models (LLMs) at inference time is a central challenge in structured reasoning tasks such as Text-to-SQL. Common test-time inference strategies, including Best-of-N sampling and Majority Voting, rely on heuristic signals such as execution success or output frequency, which provide limited semantic discrimination across candidate outputs. In this work, we study Outcome Reward Models (ORMs) as learned semantic scoring functions for test-time verification",
  "authors": "Mattia Tritto, Giuseppe Farano, Dario Di Palma, Gaetano Rossiello, Fedelucio Narducci, Dharmashankar Subramanian et al.",
  "category": "research",
  "topics": "bias-fairness",
  "orgs": null,
  "regions": null,
  "published_at": "2026-06-29T19:31:39.000Z",
  "fetched_at": "2026-07-14T14:14:32.646Z",
  "source_slug": "arxiv-ethics",
  "source_name": "arXiv",
  "source_homepage": "https://arxiv.org",
  "ethics_ai_record_url": "https://ethics.ai/record/433",
  "original_url": "https://arxiv.org/abs/2606.30851v1",
  "evidence_status": "source-only",
  "attribution": "via ethics.ai"
}