{
  "id": 4959,
  "url": "https://arxiv.org/abs/2605.03782v1",
  "title": "What You Think is What You See: Driving Exploration in VLM Agents via Visual-Linguistic Curiosity",
  "summary": "To navigate partially observable visual environments, recent VLM agents increasingly internalize world modeling capabilities into their policies via explicit CoT reasoning, enabling them to mentally simulate futures before acting. However, relying solely on passive reasoning over visited states is insufficient for sparse-reward tasks, as it lacks the epistemic drive to actively uncover the ``known unknown'' required for robust generalization. We ask: Can VLM agents actively find signals that cha",
  "authors": "Haoxi Li, Qinglin Hou, Jianfei Ma, Jinxiang Lai, Tao Han, Sikai Bai et al.",
  "category": "research",
  "topics": "agents-autonomy,environment",
  "orgs": null,
  "regions": null,
  "published_at": "2026-05-05T14:08:54.000Z",
  "fetched_at": "2026-07-14T16:31:21.936Z",
  "source_slug": "arxiv-ethics",
  "source_name": "arXiv",
  "source_homepage": "https://arxiv.org",
  "ethics_ai_record_url": "https://ethics.ai/record/4959",
  "original_url": "https://arxiv.org/abs/2605.03782v1",
  "evidence_status": "source-only",
  "attribution": "via ethics.ai"
}