{
  "id": 17977,
  "url": "https://arxiv.org/abs/2608.08021",
  "title": "Evidence-RL: Towards Evidence-intensive Visual Reasoning",
  "summary": "Vision-Language Models (VLMs) should answer from concrete image evidence rather than language priors, dataset shortcuts, or irrelevant visual context. Existing perception-aware post-training methods encourage image use through global perturbations or attention proxies, but they do not test whether a sampled answer causally depends on the local evidence that supports it. We propose Counterfactual Evidence Disentanglement (CED), a training-time evidence audit for VLM grounding. For each response,",
  "authors": "Haojie Huang, Xinlei Yu, Chengming Xu, Zhangquan Chen, Cheng Yang, Qingdong He",
  "category": "research",
  "topics": "transparency",
  "orgs": null,
  "regions": null,
  "published_at": "2026-08-07T20:00:00.000Z",
  "fetched_at": "2026-08-11T05:10:37.351Z",
  "source_slug": "hf-daily",
  "source_name": "HuggingFace Daily Papers",
  "source_homepage": "https://huggingface.co/papers",
  "ethics_ai_record_url": "https://ethics.ai/record/17977",
  "original_url": "https://arxiv.org/abs/2608.08021",
  "evidence_status": "source-only",
  "attribution": "via ethics.ai"
}