{
  "id": 17036,
  "url": "https://arxiv.org/abs/2608.06060",
  "title": "Learning from Failures: Retrieval-Centric CoT via Hard Negatives for Unified Multimodal Retrieval",
  "summary": "Unified multimodal retrieval aims to identify candidates that satisfy complex user intent expressed through heterogeneous inputs. Although Large Vision-Language Model (LVLM)-based retrievers are efficient and scalable, directly encoding raw multimodal inputs often misses fine-grained discriminative cues, leading to confusion among semantically similar candidates. Recent methods mitigate this limitation by generating Chain-of-Thought (CoT) rationales to enrich the query representation. However, s",
  "authors": "Zelong Sun, Jun Wang, Kaicheng Yang, Tiancheng Gu, Ziyong Feng, Zhiwu Lu",
  "category": "research",
  "topics": "bias-fairness",
  "orgs": null,
  "regions": null,
  "published_at": "2026-08-05T20:00:00.000Z",
  "fetched_at": "2026-08-07T05:10:58.501Z",
  "source_slug": "hf-daily",
  "source_name": "HuggingFace Daily Papers",
  "source_homepage": "https://huggingface.co/papers",
  "ethics_ai_record_url": "https://ethics.ai/record/17036",
  "original_url": "https://arxiv.org/abs/2608.06060",
  "evidence_status": "source-only",
  "attribution": "via ethics.ai"
}