{
  "id": 5822,
  "url": "https://arxiv.org/abs/2606.00027v1",
  "title": "A Multi-Domain Red Teaming Framework for Safety, Robustness, and Fairness Evaluation of Medical Large Language Models",
  "summary": "Large language models (LLMs) are increasingly deployed across healthcare, yet existing benchmarks fail to capture model behavior under adversarial or ethically complex conditions common in clinical practice. We developed a multi-domain red teaming framework evaluating eleven contemporary LLMs across 690 clinically grounded scenarios spanning nine domains and over 150 subcategories. Scenarios incorporated adversarial transformations, and responses were assessed using a seven-dimension rubric with",
  "authors": "Andrei Marian Feier, Veysel Kocaman, Yigit Gul, Ahmet Korkmaz, Alexander Thomas, Aleksei Zakharov et al.",
  "category": "research",
  "topics": "bias-fairness,safety-alignment,healthcare",
  "orgs": null,
  "regions": null,
  "published_at": "2026-04-15T14:57:55.000Z",
  "fetched_at": "2026-07-14T16:32:02.060Z",
  "source_slug": "arxiv-ethics",
  "source_name": "arXiv",
  "source_homepage": "https://arxiv.org",
  "ethics_ai_record_url": "https://ethics.ai/record/5822",
  "original_url": "https://arxiv.org/abs/2606.00027v1",
  "evidence_status": "source-only",
  "attribution": "via ethics.ai"
}