Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization
机构 * AiLECS Lab, Monash University Melbourne, Australia(墨尔本大学AiLECS实验室,澳大利亚) ; AiLECS Lab, Monash University, Australia ICMEC Australia, Sydney, Australia(墨尔本大学AiLECS实验室,澳大利亚 ICMEC澳大利亚,悉尼,澳大利亚)
专题命中 偏好对齐 :DPO(abstract);safety(abstract);分类 cs.AI、cs.LG
Comments Accepted for publication in the Proceedings of the 8th International Conference on Algorithms, Computing and Artificial Intelligence (ACAI 2025)