When Does a Video-Language Model Stop Watching? Reward Strength Controls the Formation and Reversal of Visual Shortcuts in Multimodal RLVR
视频语言模型何时停止观看?多模态RLVR中视觉捷径的形成与逆转受奖励强度控制
机构 * Zekun Xu(徐泽坤)
专题命中 长视频与时序推理 :video-language(title);分类 cs.CV
AI总结 研究多模态强化学习中视觉捷径的形成与逆转机制,发现惩罚强度可控制其出现和消除,且存在关键干预窗口。
Comments 11 pages, 4 figures