{
  "id": 267,
  "url": "https://arxiv.org/abs/2607.03478v1",
  "title": "Demonstrating Generalization Failures via Mixtures of Conditional Policies",
  "summary": "Post-training of frontier language models is conducted on curated task suites, and inevitably leaves a distribution shift between training and deployment environments. This exposes developers to generalization failures, which are relatively poorly understood. To better understand such generalization failures, we believe the community should construct clean demonstrations under simplified conditions. To facilitate this, we propose a simple and flexible way to construct language models which fail ",
  "authors": "Jou Barzdukas, Jack Peck, Julian Schulz, Paulius Rauba, Steven Basart, Lennie Wells",
  "category": "research",
  "topics": "environment",
  "orgs": null,
  "regions": null,
  "published_at": "2026-07-03T16:43:59.000Z",
  "fetched_at": "2026-07-14T14:14:24.248Z",
  "source_slug": "arxiv-ethics",
  "source_name": "arXiv",
  "source_homepage": "https://arxiv.org",
  "ethics_ai_record_url": "https://ethics.ai/record/267",
  "original_url": "https://arxiv.org/abs/2607.03478v1",
  "evidence_status": "source-only",
  "attribution": "via ethics.ai"
}