{
  "id": 18811,
  "url": "https://arxiv.org/abs/2608.11343v1",
  "title": "Can Frontier LLMs Match Natively Multimodal Embeddings? A Comparison on Hard-Negative Text-to-Image Retrieval",
  "summary": "Multimodal retrieval and classification across different types of media, spanning text, images,video and audio, has traditionally relied on dual-encoder models that align visual and textual representations through contrastive learning. The March 2026 release of Gemini Embedding 2, Google's first natively multimodal embedding model to map text, images, video, audio, and documents into a single shared space, raises competition among multimodal retrieval systems. Simultaneously, frontier Large lang",
  "authors": "Archan Dutta, Vyanktesh Kanungo",
  "category": "research",
  "topics": null,
  "orgs": "google",
  "regions": null,
  "published_at": "2026-08-11T18:49:08.000Z",
  "fetched_at": "2026-08-13T05:10:37.786Z",
  "source_slug": "arxiv-ethics",
  "source_name": "arXiv",
  "source_homepage": "https://arxiv.org",
  "ethics_ai_record_url": "https://ethics.ai/record/18811",
  "original_url": "https://arxiv.org/abs/2608.11343v1",
  "evidence_status": "source-only",
  "attribution": "via ethics.ai"
}