FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs
FutureOmni:从全模态上下文中评估多模态大语言模型的未来预测能力
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校) ; National University of Singapore(新加坡国立大学)
专题命中 音频语音多模态 :multimodal(title,abstract);omni-modal(title,abstract);cross-modal(abstract);audio-visual(abstract)
AI总结 提出FutureOmni基准,评估多模态大模型从音视频线索预测未来的能力,发现现有模型在语音密集场景下表现差,并设计OFF训练策略提升性能。
Comments Accepted by ICML 2026