UniMod: Enhancing Multi-Modal Medical Diagnosis through Cross-Modality and Within-Modality Alignment
Multi-modal learning combining medical images and clinical text is promising for disease diagnosis. However, standard multi-modal training leads to shortcut learning: models exploit the easier modality (e.g., diagnostic cues in text) while neglecting harder-to-learn features (e.g., subtle visual patterns). We propose UniMod, a framework that mitigates shortcut learning by requiring each modality to predict the diagnosis on its own. It supervises image-only, text-only, and multi-modal classificat
Record details
Published: 10 August 2026
Source: arXiv cs.LG
Category: Research
Topics: Safety & alignment · Healthcare
Retrieved: 12 August 2026
Related evidence
These records share source-supplied organisations, an exact publisher byline, automatic topics or regions. The reason is shown on every link; related does not mean supporting, agreeing with or verifying this record.
MedUP: Awakening Unified Understanding and Perception in Medical Vision-Language Models
arXiv · 11 August 2026
Dual-Domain Cross-Modal Decoding for Clinical Text-Guided Medical Image Segmentation
arXiv · 11 August 2026
Charting Public Health: A Taxonomic Study of Visualization Practices in the Public Health Field
arXiv cs.HC · 9 August 2026
Mr3D-VL: A generalist vision language foundation model for Multiparametric 3D Magnetic Resonance Imaging
arXiv · 13 August 2026
Why Do AI Agents Break Rules? How Framing, Context, and Social Signals Shape Compliance
arXiv cs.CY · 14 August 2026
Representation-driven Endoscopic Visual Embedding Alignment for Latent Generation
arXiv · 7 August 2026
How to cite this record
ethics.ai (10 August 2026), “UniMod: Enhancing Multi-Modal Medical Diagnosis through Cross-Modality and Within-Modality Alignment,” evidence record 18699, https://ethics.ai/record/18699 (originally published by arXiv cs.LG).
Use and limitations
This page is a stable index and citation surface for a source record. ethics.ai did not author the underlying report and has not independently verified every claim. Automatic topics may be imperfect. For consequential use, quote and cite the original publisher.