{
  "id": 19167,
  "url": "https://arxiv.org/abs/2608.13345v1",
  "title": "Rules or Character? Scaling Laws for AI Safety Design",
  "summary": "Artificial Intelligence (AI) safety systems combine character shaping (e.g., Reinforcement Learning from Human Feedback [RLHF], Constitutional AI), which modifies behavioral distributions at training time, with rule enforcement (e.g., output filters, safety classifiers), which blocks harmful outputs at inference time, yet little formal analysis exists on how their optimal balance should change as deployment scales increase. We introduce a stylized comparative-statics model that parameterizes saf",
  "authors": "Satoshi Takahashi, Nobuji Kouno, Masaaki Komatsu, Ryuji Hamamoto",
  "category": "research",
  "topics": "safety-alignment",
  "orgs": null,
  "regions": null,
  "published_at": "2026-08-13T15:15:09.000Z",
  "fetched_at": "2026-08-14T05:10:49.168Z",
  "source_slug": "arxiv-ethics",
  "source_name": "arXiv",
  "source_homepage": "https://arxiv.org",
  "ethics_ai_record_url": "https://ethics.ai/record/19167",
  "original_url": "https://arxiv.org/abs/2608.13345v1",
  "evidence_status": "source-only",
  "attribution": "via ethics.ai"
}