QwenSafe: Multimodal Content Rating Description Identification via Preference-Aligned VLMs
QwenSafe: 通过偏好对齐的视觉语言模型实现多模态内容评级描述识别
机构 * University of Sydney(悉尼大学) ; University of New South Wales(新南威尔士大学)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);LLaVA(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV
AI总结 本文提出QwenSafe,一种通过联合推理应用元数据和截图来自动识别苹果定义的内容评级描述(CRDs)的视觉语言模型,通过引入metadata2CRD数据构建管道和直接偏好优化(DPO)提升模型预测准确性,实验结果显示QwenSafe在二元CRD分类中显著优于现有模型。