MuPHI: Learning Implicit Multimodal Harm Reasoning via Semantically Grounded Reward Optimization
MuPHI: 通过语义基础奖励优化学习隐式多模态有害推理
机构 * Max Planck Institute for Informatics(马克斯·普朗克院信息研究所) ; Saarland Informatics Campus(萨尔兰州信息校园) ; Saarland University(萨尔兰州大学) ; The University of Edinburgh(爱丁堡大学) ; Samsung AI Center, Cambridge(三星AI中心,剑桥)
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CL、cs.AI、cs.MM
AI总结 针对视觉语言模型在隐式跨模态有害语义推理上的不足,提出MuPHI数据集和MuPHIRM训练框架,通过多视角奖励优化联合语义学习,提升有害检测与推理质量及分布外鲁棒性。