FlexGuard: Continuous Risk Scoring for Strictness-Adaptive LLM Content Moderation
FlexGuard: 严格度自适应的连续风险评分用于LLM内容审核
机构 * The Hong Kong Polytechnic University(香港理工大学) ; ByteDance(字节跳动)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出FlexGuard,一种基于LLM的连续风险评分系统,通过风险对齐优化提升审核准确性和在不同严格度下的鲁棒性。
Comments Accepted at ACL 2026