{
  "id": 4497,
  "url": "https://arxiv.org/abs/2605.11693v1",
  "title": "Measuring What Matters Beyond Text: Evaluating Multimodal Summaries by Quality, Alignment, and Diversity",
  "summary": "Multimodal Large Language Models (MLLMs) have facilitated Multimodal Summarization with Multimodal Output (MSMO), wherein systems generate concise textual summaries accompanied by salient visuals from multimodal sources. However, current MSMO evaluation remains fragmented: text quality, image-text alignment, and visual diversity are typically assessed in isolation using unimodal metrics, making it difficult to capture whether the modalities jointly support a faithful and useful summary. To addre",
  "authors": "Abid Ali, Diego Molla-Aliod, Usman Naseem",
  "category": "research",
  "topics": "safety-alignment",
  "orgs": null,
  "regions": null,
  "published_at": "2026-05-12T07:50:55.000Z",
  "fetched_at": "2026-07-14T16:31:03.578Z",
  "source_slug": "arxiv-ethics",
  "source_name": "arXiv",
  "source_homepage": "https://arxiv.org",
  "ethics_ai_record_url": "https://ethics.ai/record/4497",
  "original_url": "https://arxiv.org/abs/2605.11693v1",
  "evidence_status": "source-only",
  "attribution": "via ethics.ai"
}