arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-21 至 2026-04-21 共收录 9 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 9 篇

2604.17422 2026-04-21 cs.CV cs.MM 90%

Where to Focus: Query-Modulated Multimodal Keyframe Selection for Long Video Understanding

聚焦何处:用于长视频理解的查询调节多模态关键帧选择

Shaoguang Wang, Weiyu Guo, Ziyang Chen, Xuming Hu, Hui Xiong

机构 * Department of CSE, HKUST(香港科技大学计算机科学与工程系)

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);video reasoning(abstract);分类 cs.CV、cs.MM

AI总结 本文提出Q-Gate框架,通过动态模态路由解决长视频理解中关键帧选择问题,有效抑制模态噪声,提升多模态大语言模型的推理能力。

Comments 9 pages, 7 figures, 9 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23724 2026-04-21 cs.CV cs.AI 89%

Video Panels for Long Video Understanding

用于长视频理解的视频面板

Lars Doorenbos, Federico Spurio, Juergen Gall

机构 * University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所)

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);video-language(abstract);分类 cs.CV

AI总结 本文提出一种无需训练的视觉提示策略,通过将多帧组合成图像以换取时间分辨率,提升了长视频理解模型的性能,实验表明在多个基准上效果显著。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11113 2026-04-21 cs.CV cs.AI cs.LG 83%

VIDEOP2R: Video Understanding from Perception to Reasoning

VIDEOP2R:从感知到推理的视频理解

Yifan Jiang, Yueying Wang, Rui Zhao, Toufiq Parag, Zhimin Chen, Zhenyu Liao, Jayakrishnan Unnikrishnan

机构 * USC(USC大学) Amazon(亚马逊) Keystone AI

专题命中 视频理解 :video understanding(title);video language model(abstract);video reasoning(abstract);分类 cs.CV

AI总结 VIDEOP2R提出一种过程感知的视频RFT框架,通过三步流程生成高质量CoT数据集,并引入PA-GRPO算法提升视频推理性能,实现在七个基准中的六个达到SotA水平。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05067 2026-04-21 cs.CV cs.AI 83%

LLaVA-Octopus: Unlocking Instruction-Driven Adaptive Projector Fusion for Video Understanding

LLaVA-Octopus:解锁指令驱动的自适应投影器融合用于视频理解

Boyuan Sun, Jiaxing Zhao, Xiang Chen, Xihan Wei, Qibin Hou

机构 * VCIP, CS, Nankai University(南开大学计算机科学与技术学院) Tongyi Group, Alibaba(阿里巴巴通义集团)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 LLaVA-Octopus通过根据用户指令动态调整不同视觉投影器的特征权重,提升视频理解任务的性能,实验表明其在多个基准测试中表现优异。

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18459 2026-04-21 cs.CV cs.AI 79%

Progressive Online Video Understanding with Evidence-Aligned Timing and Transparent Decisions

渐进式在线视频理解与证据对齐的透明决策

Kecheng Zhang, Zongxin Yang, Mingfei Han, Haihong Hao, Yunzhi Zhuge, Changlin Li, Junhan Zhao, Zhihui Li, Xiaojun Chang

机构 * University of Science and Technology of China(中国科学技术大学) Harvard University(哈佛大学) Department of CV, MBZUAI(MBZUAI计算机视觉部门) Dalian University of Technology(大连理工大学) Stanford University(斯坦福大学) Chicago University(芝加哥大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出一种新型框架,通过分离推理控制与记忆整合,解决在线视频理解中的决策透明、时间对齐和计算预算限制问题,显著提升了性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16893 2026-04-21 cs.CV cs.LG 79%

EasyVideoR1: Easier RL for Video Understanding

EasyVideoR1: 更容易的视频理解强化学习

Chuanyu Qin, Chenxu Yang, Qingyi Si, Naibin Gu, Dingyu Yao, Zheng Lin, Peng Fu, Nan Duan, Jiaqi Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出EasyVideoR1框架,通过高效预处理、统一奖励系统和混合训练策略,提升视频理解任务的训练效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15724 2026-04-21 cs.CV cs.AI 70%

VideoThinker: Building Agentic VideoLLMs with LLM-Guided Tool Reasoning

VideoThinker:构建具有LLM引导工具推理的智能视频大语言模型

Chenglin Li, Qianglong Chen, Feng Han, Yikun Wang, Xingxi Yin, Yan Gong, Ruilin Li, Yin Zhang, Jiaqi Wang

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Wuhan University(武汉大学) Shanghai AI Lab(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 视频理解 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 VideoThinker通过合成工具交互轨迹构建大规模视频与工具推理数据集,提升长视频理解能力,优于传统语言模型和视频模型基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17873 2026-04-21 cs.CV 57%

Spatiotemporal Sycophancy: Negation-Based Gaslighting in Video Large Language Models

时空趋炎附势:基于否定的欺骗性在视频大语言模型中的表现

Ziyao Tang, Pengkun Jiao, Bin Zhu, Huiyan Qi, Jingjing Chen, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University Shanghai Key Laboratory of Multimodal Embodied AI(可信具身人工智能研究所,复旦大学上海多模态具身人工智能重点实验室)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文研究视频大语言模型在面对否定性欺骗时的脆弱性,揭示其在时空推理中的错误修正机制,并提出GasVideo-1000基准测试集以评估模型的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14582 2026-04-21 cs.CV 57%

OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models

OmniZip:面向快速多模态大语言模型的音频引导动态令牌压缩

Keda Tao, Kele Shao, Bohan Yu, Weiqiang Wang, Jian liu, Huan Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Ant Group(蚂蚁集团) Shanghai Innovation Institute(上海创新研究院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出OmniZip,一种无需训练的音频引导多模态令牌压缩框架,通过动态压缩音频视频令牌提升推理速度和内存效率,保持模型性能。

Comments [CVPR 2026] Code Link: https://github.com/KD-TAO/OmniZip

详情

展开后加载摘要…

URL PDF HTML 收藏