{
  "id": 70,
  "url": "https://arxiv.org/abs/2607.09142v1",
  "title": "MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation",
  "summary": "Large language models (LLMs) are increasingly deployed in online medical consultation, yet existing benchmarks remain poorly aligned with real clinical practice. Many rely on synthetic conversations or patient simulators, omit patient-uploaded medical images, or evaluate open-ended clinical responses using multiple-choice or lexical-overlap metrics that poorly reflect clinical quality. We introduce \\textbf{MedRealMM}, a large-scale benchmark for multimodal online medical consultation built from ",
  "authors": "Runhan Shi, Quan Zhou, Yuqian Xu, Shuai Yang, Xin Wu, Zitong Zhou et al.",
  "category": "research",
  "topics": "healthcare",
  "orgs": null,
  "regions": "china",
  "published_at": "2026-07-10T06:52:05.000Z",
  "fetched_at": "2026-07-14T14:14:15.666Z",
  "source_slug": "arxiv-ethics",
  "source_name": "arXiv",
  "source_homepage": "https://arxiv.org",
  "ethics_ai_record_url": "https://ethics.ai/record/70",
  "original_url": "https://arxiv.org/abs/2607.09142v1",
  "evidence_status": "source-only",
  "attribution": "via ethics.ai"
}