PEA-DPO: Perception-Enhanced Alignment Direct Preference Optimization for MLLMs Alignment
PEA-DPO:用于多模态大语言模型对齐的感知增强型直接偏好优化
机构 * University of Science and Technology of China(中国科学技术大学) ; National University of Singapore(新加坡国立大学)
专题命中 偏好对齐 :DPO(title,title_cn);alignment(title,abstract);分类 cs.CL、cs.AI
AI总结 针对多模态大语言模型偏好优化存在的视觉不敏感性问题,提出PEA-DPO框架,利用视觉偏好信号缓解该问题,提升多模态对齐效果并减少幻觉。