{
  "id": 6518,
  "url": "https://arxiv.org/abs/2604.00279v1",
  "title": "The Geometry of Compromise: Unlocking Generative Capabilities via Controllable Modality Alignment",
  "summary": "Vision-Language Models (VLMs) such as CLIP learn a shared embedding space for images and text, yet their representations remain geometrically separated, a phenomenon known as the modality gap. This gap limits tasks requiring cross-modal interchangeability, such as captioning and joint clustering. Existing post-processing approaches can partially improve cross-modal compatibility; however, we show through geometric analysis that they primarily reduce the global centroid offset while leaving the u",
  "authors": "Hongyuan Liu, Qinli Yang, Wen Li, Zhong Zhang, Jiaming Liu, Wei Han et al.",
  "category": "research",
  "topics": "safety-alignment",
  "orgs": null,
  "regions": null,
  "published_at": "2026-03-31T22:11:49.000Z",
  "fetched_at": "2026-07-14T16:32:33.101Z",
  "source_slug": "arxiv-ethics",
  "source_name": "arXiv",
  "source_homepage": "https://arxiv.org",
  "ethics_ai_record_url": "https://ethics.ai/record/6518",
  "original_url": "https://arxiv.org/abs/2604.00279v1",
  "evidence_status": "source-only",
  "attribution": "via ethics.ai"
}