{
  "id": 13736,
  "url": "https://arxiv.org/abs/2607.22264v1",
  "title": "Autoregressive EHR Foundation Models with Multimodal Inputs",
  "summary": "Autoregressive foundation models trained on tokenized electronic health records (EHRs) can support zero-shot clinical prediction, yet most operate on structured event codes alone, and do not incorporate multiple modalities in a principled way. We present a framework for conditioning such models on auxiliary clinical modalities, including ECG waveforms, chest X-ray images, and clinical notes, using modality-specific latent compression and gated cross-attention with temporal alignment. We investig",
  "authors": "Yuxuan Liu, Joshua Placidi, Jinpei Han, Alfred John Balston, Marek Rei, A. Aldo Faisal",
  "category": "research",
  "topics": "safety-alignment,healthcare,finance-investment",
  "orgs": null,
  "regions": null,
  "published_at": "2026-07-24T12:59:20.000Z",
  "fetched_at": "2026-07-27T05:10:06.638Z",
  "source_slug": "arxiv-cslg",
  "source_name": "arXiv cs.LG",
  "source_homepage": "https://arxiv.org/list/cs.LG/recent",
  "ethics_ai_record_url": "https://ethics.ai/record/13736",
  "original_url": "https://arxiv.org/abs/2607.22264v1",
  "evidence_status": "source-only",
  "attribution": "via ethics.ai"
}