{
  "id": 1448,
  "url": "https://arxiv.org/abs/2606.05748v1",
  "title": "UNIVID: Unified Vision-Language Model for Video Moderation",
  "summary": "Global-scale video moderation faces a dual challenge: the need for fine-grained multi-modal reasoning and the demand for interpretable outputs to support downstream enforcement. Traditional moderation systems often rely on fragmented black-box classifiers that are difficult to maintain and lack transparency. In this paper, we present UNIVID, a UNIfied VIsion-language model for video moDeration. Unlike standard classification models, UNIVID generates policy-aware captions that serve as an interpr",
  "authors": "Kejuan Yang, Yizhuo Zhang, Mingyuan Du, Yue Zhang, Dixin Zheng, Kaili Zhao et al.",
  "category": "research",
  "topics": "regulation,transparency",
  "orgs": null,
  "regions": null,
  "published_at": "2026-06-04T06:20:23.000Z",
  "fetched_at": "2026-07-14T14:15:17.101Z",
  "source_slug": "arxiv-ethics",
  "source_name": "arXiv",
  "source_homepage": "https://arxiv.org",
  "ethics_ai_record_url": "https://ethics.ai/record/1448",
  "original_url": "https://arxiv.org/abs/2606.05748v1",
  "evidence_status": "source-only",
  "attribution": "via ethics.ai"
}