SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning
SIVA-RL:用于多模态强化学习的灵敏度不变视觉对齐
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Sichuan University(四川大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; University of Macau(澳门大学)
专题命中 数学推理 :reasoning(abstract)
AI总结 研究多模态强化学习中视觉语言模型预测与视觉证据结合问题,提出SIVA-RL框架,通过特定方法构建局部干预并以奖励下降为权重驱动对齐,在多基准测试中相比基线改进了模型。
Comments 27 pages, 11 figures