VARM-Bench: Benchmarking Verifiable Structured Reasoning in Chinese Abusive Speech Moderation
VARM-Bench:中文辱骂内容审核中可验证的结构化推理基准测试
机构 * NUAA(南京航空航天大学)
专题命中 规划推理 :reasoning(title);chain-of-thought(abstract);CoT(abstract);分类 cs.AI
AI总结 针对中文辱骂内容审核缺乏可验证决策依据的问题,提出VARM-Bench基准,通过确定性协议评估模型,发现标签级性能可能掩盖记录错误,提供可审计的评估基准。