{
  "id": 18793,
  "url": "https://arxiv.org/abs/2608.11692v1",
  "title": "HUGIN: Enhancing Vision-Language Planning for Autonomous Logistics Sorting",
  "summary": "Autonomous logistics sorting systems (ALSS) are an important industrial application of embodied AI, which requires joint planning over spatially disjoint camera views. We formulate this setting as Joint Multi-Scene Understanding (JMSU). With open-world visual understanding and task-planning capabilities, vision-language models (VLMs) are promising candidates for JMSU. However, directly applying existing VLMs to JMSU is non-trivial due to scarce cross-scene supervision and attention dispersion ca",
  "authors": "Xikai Sun, Cangtian Zhou, Kebin Liu, Ke Ma, Xu Wang, Zaishu Chen et al.",
  "category": "research",
  "topics": null,
  "orgs": null,
  "regions": null,
  "published_at": "2026-08-12T06:04:27.000Z",
  "fetched_at": "2026-08-13T05:10:37.786Z",
  "source_slug": "arxiv-ethics",
  "source_name": "arXiv",
  "source_homepage": "https://arxiv.org",
  "ethics_ai_record_url": "https://ethics.ai/record/18793",
  "original_url": "https://arxiv.org/abs/2608.11692v1",
  "evidence_status": "source-only",
  "attribution": "via ethics.ai"
}