arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-06-29 至 2026-06-29 共收录 5 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 5 篇

2510.00705 2026-06-29 cs.CV 版本更新 70%

Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs

无训练不确定性引导的复杂视觉任务多模态大语言模型

Sanghwan Kim, Rui Xiao, Stephan Alaniz, Yongqin Xian, Zeynep Akata

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Helmholtz Munich(海德堡-慕尼黑亥姆霍兹研究中心) Google(谷歌) LTCI, Télécom Paris, Institut Polytechnique de Paris(巴黎理工大学 LTCI 实验室)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 提出无需训练的框架,利用MLLM内在不确定性主动引导,通过响应不确定性评分候选视觉输入,使模型自主聚焦关键信息,在视觉搜索、长视频理解等任务中达到与微调系统相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27999 2026-06-29 cs.CV 新提交 57%

HumanMoveVQA: Can Video MLLMs reason about human movement in videos?

HumanMoveVQA:视频多模态大语言模型能否推理视频中的人类运动?

Pulkit Gera, Faegheh Sardari, Asmar Nadeem, Valentina Bono, Padraig Boulton, Adrian Hilton, Armin Mustafa

机构 * CVSSP, University of Surrey, Guildford, UK(萨里大学视觉、语音与信号处理中心,英国吉尔福德) Tesco, UK(乐购,英国)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 提出HumanMoveVQA基准,通过世界坐标系下的3D运动轨迹生成问答对,评估视频MLLM在全局轨迹和方向推理上的能力,发现现有模型存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27777 2026-06-29 cs.CV 新提交 57%

TRUST: Efficient Abdominal Trauma Recognition via Image-to-Ultrasound-Video Transfer Learning

TRUST:通过图像到超声视频迁移学习实现高效腹部创伤识别

Enguang Wang, Hao Zhou, Shuo Gao, Tuo Liu, Guangquan Zhou

机构 * School of Biological Science and Medical Engineering, Southeast University(东南大学生物科学与医学工程学院) Nanjing Medical University First Affiliated Hospital(南京医科大学第一附属医院) Jiangsu Key Laboratory of Biomaterials and Devices, Southeast University(江苏省生物材料与器件重点实验室,东南大学) State Key Laboratory of Digital Medical Engineering, Southeast University(数字医学工程国家重点实验室,东南大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 提出TRUST框架,通过跨频协作适配器、多粒度运动感知模块和视觉查询语义聚合,解决超声视频中时空变化和语义差异问题,在腹部创伤数据集上性能提升9.63%。

Comments Accepted to MICCAI 2026, 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00784 2026-06-29 cs.CV 版本更新 57%

An Approach to Enriching Surgical Video Datasets for Fine-Grained Spatial-Temporal Understanding of Vision-Language Models

一种丰富手术视频数据集的方法,用于视觉-语言模型的细粒度时空理解

Lennart Maack, Alexander Schlaefer

机构 * Hamburg University of Technology(汉堡理工大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 提出SurgSTU-Pipeline生成管道,通过时空连续性过滤创建细粒度时空问答数据集SurgSTU,提升视觉-语言模型在手术视频中的时空理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00757 2026-06-29 cs.CV cs.AI 版本更新 57%

IWP: Token Pruning as Implicit Weight Pruning in Large Vision Language Models

IWP:大型视觉语言模型中的隐式权重剪枝与令牌剪枝

Dong-Jae Lee, Sunghyun Baek, Junmo Kim

机构 * KAIST(韩国科学技术院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 提出基于注意力对偶形式的无训练令牌剪枝框架,通过度量令牌的信息量和冗余度,结合渐进式分块最大边际相关性选择子集,在保持性能的同时提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏