{
  "id": 3763,
  "url": "https://arxiv.org/abs/2605.25273v1",
  "title": "LLM-as-a-Judge in Healthcare: A Scoping Analysis of Applications, Methods, and Human Alignment",
  "summary": "Large language models (LLMs) are increasingly deployed across healthcare applications, including clinical documentation, diagnostic reasoning, medicine recommendation, and medical education. Their outputs are largely unstructured clinical text, which is difficult to reliably evaluate at scale. LLM-as-a-Judge, in which an LLM evaluates another system's output against task-specific criteria, offers a scalable alternative and is increasingly used in clinical evaluation, yet its validity in healthca",
  "authors": "Lingyao Li, Deyi Li, Chen Chen, Renkai Ma, Runlong Yu, Mingquan Lin et al.",
  "category": "research",
  "topics": "safety-alignment,healthcare,children-education",
  "orgs": null,
  "regions": null,
  "published_at": "2026-05-24T21:59:32.000Z",
  "fetched_at": "2026-07-14T16:30:31.919Z",
  "source_slug": "arxiv-ethics",
  "source_name": "arXiv",
  "source_homepage": "https://arxiv.org",
  "ethics_ai_record_url": "https://ethics.ai/record/3763",
  "original_url": "https://arxiv.org/abs/2605.25273v1",
  "evidence_status": "source-only",
  "attribution": "via ethics.ai"
}