{
  "id": 12652,
  "url": "https://arxiv.org/abs/2607.13429",
  "title": "Generalizable VLA Finetuning via Representation Anchoring and Language-Action Alignment",
  "summary": "Finetuning a pretrained vision-language model (VLM) on robot demonstrations via behavior cloning (BC) has become the standard recipe for vision-language-action (VLA) policies. However, BC finetuning progressively overwrites the pretrained representations that support visual and semantic generalization. Co-training on web image-text data, a common remedy, does not prevent this; it applies language and action losses to separate observations, leaving VLAs with language-action misalignment that stan",
  "authors": "Dwip Dalal, Shivansh Patel, Chahit Jain, Jeonghwan Kim, Utkarsh Mishra, Alex Baratian",
  "category": "research",
  "topics": "safety-alignment,agents-autonomy",
  "orgs": null,
  "regions": null,
  "published_at": "2026-07-14T20:00:00.000Z",
  "fetched_at": "2026-07-23T05:10:49.458Z",
  "source_slug": "hf-daily",
  "source_name": "HuggingFace Daily Papers",
  "source_homepage": "https://huggingface.co/papers",
  "ethics_ai_record_url": "https://ethics.ai/record/12652",
  "original_url": "https://arxiv.org/abs/2607.13429",
  "evidence_status": "source-only",
  "attribution": "via ethics.ai"
}