Resolving Spatio-Temporal Entanglement in Video Prediction via Multi-Modal Attention
通过多模态注意力解决视频预测中的时空纠缠
Shreyam Gupta, P. Agrawal, Priyam Gupta
机构
*
Indian Institute of Technology (BHU), Varanasi(印度理工学院(巴纳拉斯印度教大学),瓦拉纳西)
;
University of Colorado, Boulder(科罗拉多大学博尔德分校)
;
Erasmus+, Intelligent Field Robotic Systems (IFRoS), University of Girona(伊拉斯谟+,智能现场机器人系统(IFRoS),赫罗纳大学)
From Exploration to Exploitation: A Two-Stage Entropy RLVR Approach for Noise-Tolerant MLLM Training
从探索到利用:一种两阶段熵RLVR方法用于噪声容忍的多模态大语言模型训练
Donglai Xu, Hongzheng Yang, Yuzhi Zhao, Pingping Zhang, Jinpeng Chen, Wenao Ma, Zhijian Hou, Mengyang Wu, Xiaolei Li, Senkang Hu, Ziyi Guan, Jason Chun Lok Li, Lai Man Po
机构
*
Independent Researcher(独立研究者)
;
The Chinese University of Hong Kong(香港中文大学)
;
City University of Hong Kong(香港城市大学)
;
Hong Kong University of Science and Technology(香港科技大学)
;
University of Hong Kong(香港大学)
机构
*
Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学李嘉诚医学院)
;
Department of Diagnostic Radiology, Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学李嘉诚医学院诊断放射学系)
;
Department of Chemistry, The University of Hong Kong(香港大学化学系)
CommentsPublished as a conference paper at the 14th International Conference on Learning Representations (ICLR 2026), Rio de Janeiro, Brazil, April 23-27, 2026