Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs
无训练不确定性引导的复杂视觉任务多模态大语言模型
机构 * Technical University of Munich(慕尼黑技术大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; Helmholtz Munich(海德堡-慕尼黑亥姆霍兹研究中心) ; Google(谷歌) ; LTCI, Télécom Paris, Institut Polytechnique de Paris(巴黎理工大学 LTCI 实验室)
专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV
AI总结 提出无需训练的框架,利用MLLM内在不确定性主动引导,通过响应不确定性评分候选视觉输入,使模型自主聚焦关键信息,在视觉搜索、长视频理解等任务中达到与微调系统相当的性能。