{
  "id": 6626,
  "url": "https://arxiv.org/abs/2603.27533v1",
  "title": "Demo-Pose: Depth-Monocular Modality Fusion For Object Pose Estimation",
  "summary": "Object pose estimation is a fundamental task in 3D vision with applications in robotics, AR/VR, and scene understanding. We address the challenge of category-level 9-DoF pose estimation (6D pose + 3Dsize) from RGB-D input, without relying on CAD models during inference. Existing depth-only methods achieve strong results but ignore semantic cues from RGB, while many RGB-D fusion models underperform due to suboptimal cross-modal fusion that fails to align semantic RGB cues with 3D geometric repres",
  "authors": "Rachit Agarwal, Abhishek Joshi, Sathish Chalasani, Woo Jin Kim",
  "category": "research",
  "topics": "agents-autonomy",
  "orgs": null,
  "regions": null,
  "published_at": "2026-03-29T05:58:04.000Z",
  "fetched_at": "2026-07-14T16:32:37.310Z",
  "source_slug": "arxiv-ethics",
  "source_name": "arXiv",
  "source_homepage": "https://arxiv.org",
  "ethics_ai_record_url": "https://ethics.ai/record/6626",
  "original_url": "https://arxiv.org/abs/2603.27533v1",
  "evidence_status": "source-only",
  "attribution": "via ethics.ai"
}