arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-04-03 至 2026-04-03 共收录 21 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 6 篇

2604.02317 2026-04-03 cs.CV 83%

A Simple Baseline for Streaming Video Understanding

流媒体视频理解的简单基线

Yujiao Shen, Shulin Tian, Jingkang Yang, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 本文提出SimpleStream基线,通过滑动窗口仅使用最近N帧输入现成的VLM,在OVO-Bench和StreamingBench上表现优异,揭示了长上下文对性能的非线性影响及感知与记忆的权衡。

Comments Project page: https://simple-stream.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10611 2026-04-03 cs.CV cs.AI 83%

Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding

Molmo2:具有视频理解和 grounding 的开放权重和数据的视觉语言模型

Christopher Clark, Jieyu Zhang, Zixian Ma, Jae Sung Park, Mohammadreza Salehi, Rohun Tripathi, Sangho Lee, Zhongzheng Ren, Chris Dongjoo Kim, Yinuo Yang, Vincent Shao, Yue Yang, Weikai Huang, Ziqi Gao, Taira Anderson, Jianrui Zhang, Jitesh Jain, George Stoica, Winson Han, Ali Farhadi, Ranjay Krishna

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

专题命中 视频理解 :video understanding(title,abstract);video-language(abstract);分类 cs.CV

AI总结 Molmo2 是一种开放源代码的视频语言模型,通过7个新视频数据集和2个多图像数据集,实现了单图像、多图像和视频任务中的点驱动 grounding 能力,其8B模型在短视频计数和描述任务中表现优异,在视频 grounding 任务中超越了现有开源和专有模型。

Comments Updated first authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13714 2026-04-03 eess.IV cs.AI cs.CV cs.LG 62%

DeDelayed: Deleting Remote Inference Delay via On-Device Correction

DeDelayed:通过设备端校正删除远程推断延迟

Dan Jacobellis, Mateen Ulhaq, Fabien Racapé, Hyomin Choi, Neeraja J. Yadwadkar

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) InterDigital

专题命中 视频理解 :video understanding(abstract);分类 cs.CV、eess.IV

AI总结 本文提出DeDelayed系统,通过设备端与远程模型协同推断,降低视频处理延迟,提升实时视频分割性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02093 2026-04-03 cs.CV 57%

GroundVTS: Visual Token Sampling in Multimodal Large Language Models for Video Temporal Grounding

GroundVTS:多模态大语言模型中的视频时间定位视觉标记采样

Rong Fan, Kaiyan Xiao, Minghao Zhu, Liuyi Wang, Kai Dai, Zhao Yang

机构 * Newcapec AI Research(新开普人工智能研究院) Fudan University(复旦大学) Tongji University(同济大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出GroundVTS,通过细粒度查询引导机制筛选视觉标记,提升视频时间定位的时空信息保留与时间连贯性,实验表明其在三个标准基准上优于现有方法。

Comments Published as a conference paper at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29966 2026-04-03 cs.CV 57%

Scaling Video Pretraining for Surgical Foundation Models

为手术基础模型扩展视频预训练

Sicheng Lu, Zikai Xiao, Jianhui Wei, Danyu Sun, Qi Lu, Keli Hu, Yang Feng, Jian Wu, Zongxin Yang, Zuozhu Liu

机构 * The Johns Hopkins University(约翰霍普金斯大学) Zhejiang University(浙江大学) Zhejiang University-University of Illinois Urbana-Champaign Institute(浙江大学伊利诺伊大学厄巴纳-香槟分校联合学院) Zhejiang Lab(之江实验室) Shaoxing University(绍兴大学) Angelalign(时代天使) Harvard Medical School(哈佛医学院)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 本文提出SurgRec,通过大规模数据和统一预训练流程提升手术视频理解能力,对比SSL基线和视觉语言模型,展示SurgRec在多个下游任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01881 2026-04-03 cs.CV cs.CL 57%

HieraVid: Hierarchical Token Pruning for Fast Video Large Language Models

HieraVid:用于快速视频大语言模型的分层令牌修剪

Yansong Guo, Chaoyang Zhu, Jiayi Ji, Jianghang Lin, Liujuan Cao

机构 * Xiamen University(厦门大学)

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 HieraVid通过分层修剪框架减少视频令牌冗余,提升视频大语言模型的效率,在保留性能的同时实现30%的令牌保留率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 4 篇

2411.16804 2026-04-03 cs.CV 83%

InTraGen: Trajectory-controlled Video Generation for Object Interactions

InTraGen:基于轨迹的视频生成用于物体交互

Zuhao Liu, Aleksandar Yanev, Ahmad Mahmood, Ivan Nikolov, Saman Motamed, Wei-Shi Zheng, Xi Wang, Lei Sun, Luc Van Gool, Danda Pani Paudel

机构 * ETH Zurich(苏黎世联邦理工学院) Sun Yat-sen University(中山大学) Aalborg University(奥尔堡大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出InTraGen,通过引入四个新数据集和轨迹质量度量指标,改进多物体交互场景的轨迹引导视频生成,提升视觉真实性和定量性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24458 2026-04-03 cs.CV 79%

OmniWeaving: Towards Unified Video Generation with Free-form Composition and Reasoning

OmniWeaving:迈向统一视频生成的自由组合与推理

Kaihang Pan, Qi Tian, Jianwei Zhang, Weijie Kong, Jiangfeng Xiong, Yanxin Long, Shixue Zhang, Haiyi Qiu, Tan Wang, Zheqi Lv, Yue Wu, Liefeng Bo, Siliang Tang, Zhao Zhong

机构 * Zhejiang University(浙江大学) Tencent Hunyuan(腾讯混元) Nanyang Technological University(南洋理工大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出OmniWeaving模型,通过大规模预训练数据学习多模态组合与推理能力,引入IntelligentVBench基准测试,展示其在开放源码统一视频生成中的领先性能。

Comments 32 pages, 22 figures. Project Page: https://omniweaving.github.io. Github: https://github.com/Tencent-Hunyuan/OmniWeaving. Model: https://huggingface.co/tencent/HY-OmniWeaving

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22193 2026-04-03 cs.CV 79%

PAM: A Pose-Appearance-Motion Engine for Sim-to-Real HOI Video Generation

PAM:一种用于仿真到现实手-物体互动视频生成的姿态-外观-运动引擎

Mingju Gao, Kaisen Yang, Huan-ang Gao, Bohan Li, Ao Ding, Wenyi Li, Yangcheng Yu, Jinkun Liu, Shaocong Xu, Yike Niu, Haohan Chi, Hao Chen, Hao Tang, Yu Zhang, Li Yi, Hao Zhao

机构 * Peking University(北京大学) Tsinghua University(清华大学) BAAI(北京智源人工智能研究院) SJTU(上海交通大学) Eastern Institute of Technology(东方理工高等研究院) University of Cambridge(剑桥大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出PAM引擎,整合姿态、外观和运动生成可控的HOI视频,通过实验验证其在DexYCB和OAKINK2数据集上的性能优势。

Comments Accepted to CVPR 2026 Code: https://github.com/GasaiYU/PAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14674 2026-04-03 cs.CV cs.LG 57%

LaVR: Scene Latent Conditioned Generative Video Trajectory Re-Rendering using Large 4D Reconstruction Models

LaVR:基于大规模4D重建模型的场景潜在条件生成视频轨迹重绘

Mingyang Xie, Numair Khan, Tianfu Wang, Naina Dhingra, Seonghyeon Nam, Haitao Yang, Zhuo Hui, Christopher Metzler, Andrea Vedaldi, Hamed Pirsiavash, Lei Luo

机构 * Meta University of Maryland(马里兰大学) University of Oxford(牛津大学) UC Davis(加州大学戴维斯分校)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出LaVR模型,通过利用大规模4D重建模型的潜在空间中的隐式几何知识,解决视频重绘中几何未条件化模型的空间感知不足和几何条件化模型对深度不准确的依赖问题,实现状态-of-the-art结果。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 4 篇

2603.24270 2026-04-03 cs.CV 79%

ScrollScape: Unlocking 32K Image Generation With Video Diffusion Priors

ScrollScape: 通过视频扩散先验解锁32K图像生成

Haodong Yu, Yabo Zhang, Donglin Di, Ruyi Zhang, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Li Auto, Beijing, China(理想汽车(中国北京))

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 ScrollScape通过将超大比例图像生成转化为连续视频生成过程,利用视频模型的时序一致性确保结构完整性,实现32K分辨率的高质量图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16515 2026-04-03 cs.CV 79%

SALAD: Achieve High-Sparsity Attention via Efficient Linear Attention Tuning for Video Diffusion Transformer

SALAD: 通过高效的线性注意微调实现高稀疏性注意

Tongcheng Fang, Hanling Zhang, Ruiqi Xie, Zhuo Han, Xin Tao, Tianchen Zhao, Pengfei Wan, Wenbo Ding, Wanli Ouyang, Xuefei Ning, Yu Wang

机构 * Tsinghua University(清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 本文提出SALAD,通过并行的稀疏注意与轻量线性注意分支,结合多级静态-动态缩放策略,实现高达90%的稀疏性和1.52-2.03倍的推理加速,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02296 2026-04-03 cs.CV cs.AI 57%

VOID: Video Object and Interaction Deletion

VOID:视频对象和交互删除

Saman Motamed, William Harvey, Benjamin Klein, Luc Van Gool, Zhuoning Yuan, Ta-Ying Cheng

机构 * Netflix

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 VOID通过物理合理填充解决复杂场景下的视频对象删除问题,结合视觉语言模型和视频扩散模型,提升场景动态一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01552 2026-04-03 cs.LG 50%

ZEUS: Accelerating Diffusion Models with Only Second-Order Predictor

ZEUS:仅使用二阶预测器加速扩散模型

Yixiao Wang, Ting Jiang, Zishan Shao, Hancheng Ye, Jingwei Sun, Mingyuan Ma, Jianyi Zhang, Yiran Chen, Hai Li

机构 * Department of Electrical and Computer Engineering, Duke University(杜克大学电气与计算机工程系) Department of Computer Science, Duke University(杜克大学计算机科学系) Department of Statistical Science, Duke University(杜克大学统计科学系)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 本文提出ZEUS方法,通过二阶预测器减少去噪器调用,结合交错方案稳定连续跳过,实现高效加速,提升速度-保真度性能,达到3.2倍端到端提速。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频问答 2 篇

2604.01569 2026-04-03 cs.CV cs.MM 73%

VideoZeroBench: Probing the Limits of Video MLLMs with Spatio-Temporal Evidence Verification

VideoZeroBench: 通过时空证据验证探测视频多模态大语言模型的极限

Jiahao Meng, Tan Yue, Qi Xu, Haochen Wang, Zhongwei Ren, Weisong Liu, Yuhao Wang, Renrui Zhang, Yunhai Tong, Haodong Duan

机构 * PKU(北京大学) WHU(武汉大学) CASIA(中国科学院自动化研究所) BJTU(北京交通大学) CUHK(香港中文大学)

专题命中 视频问答 :video understanding(abstract);video reasoning(abstract);分类 cs.CV、cs.MM

AI总结 VideoZeroBench通过严格验证时空证据,揭示视频多模态大语言模型在长视频问答中的不足,发现即使在标准设置下,模型正确率也低于17%,且在严格约束下性能显著下降,凸显了基于证据的视频理解仍是瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14870 2026-04-03 cs.CV eess.IV 62%

HERBench: A Benchmark for Multi-Evidence Integration in Video Question Answering

HERBench:视频问答中多证据整合的基准

Dan Ben-Ami, Gabriele Serussi, Kobi Cohen, Chaim Baskin

机构 * INSIGHT Lab, Ben-Gurion University of the Negev(本-古里安大学 INSIGHT 实验室) Ben-Gurion University of the Negev(本-古里安大学)

专题命中 视频问答 :video understanding(abstract);分类 cs.CV、eess.IV

AI总结 HERBench通过要求至少三个非重叠视频片段线索,推动视频问答中多证据整合的研究,评估13种最新视频大语言模型,发现其准确率仅31-42%,揭示检索与融合两大瓶颈。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 动作与事件理解 2 篇

2604.01994 2026-04-03 cs.CV 57%

Resonance4D: Frequency-Domain Motion Supervision for Preset-Free Physical Parameter Learning in 4D Dynamic Physical Scene Simulation

Resonance4D: 频域运动监督用于预设-free 物理参数学习的4D动态物理场景模拟

Changshe Zhang, Jie Feng, Siyu Chen, Guanbin Li, Ronghua Shang, Junpeng Zhang

机构 * Xidian University(西安电子科技大学) Jimei University(集美大学) Sun Yat-sen University(中山大学)

专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV

AI总结 Resonance4D通过结合3D高斯散射与物质点方法,提出轻量且物理表达的监督策略,解决动态一致性问题,减少训练成本和内存开销,实现高保真的4D物理模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01666 2026-04-03 cs.CV 57%

DynaVid: Learning to Generate Highly Dynamic Videos using Synthetic Motion Data

DynaVid: 通过合成运动数据学习生成高度动态视频

Wonjoon Jin, Jiyun Won, Janghyeok Han, Qi Dai, Chong Luo, Seung-Hwan Baek, Sunghyun Cho

机构 * POSTECH(浦项科技大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 动作与事件理解 :video diffusion(abstract);分类 cs.CV

AI总结 DynaVid通过合成运动数据训练视频合成框架,解决动态视频生成中真实数据不足的问题,采用两阶段生成方法提升动态运动和摄像机运动的现实感与可控性。

Comments Accepted to CVPR 2026. Website: https://jinwonjoon.github.io/DynaVid/

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 长视频与时序推理 1 篇

2604.01966 2026-04-03 cs.CV cs.AI cs.RO 57%

Ego-Grounding for Personalized Question-Answering in Egocentric Videos

面向第一视角视频的个性化问答中的自我定位

Junbin Xiao, Shenglang Zhang, Pengxiang Zhu, Angela Yao

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 本文提出MyEgo数据集,用于评估多模态大语言模型在需要自我定位的个性化问答中的能力,发现现有模型在自我记忆和推理方面存在显著不足。

Comments To appear at CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 视频数据与评测 1 篇

2604.02329 2026-04-03 cs.CV 57%

Generative World Renderer

生成世界渲染器

Zheng-Hui Huang, Zhixiang Wang, Jiaming Tan, Ruihan Yu, Yidan Zhang, Bo Zheng, Yu-Lun Liu, Yung-Yu Chuang, Kaipeng Zhang

机构 * Alaya Studio, Shanda AI Research Tokyo(Alaya工作室,盛大人工智能研究院东京) National Taiwan University(国立台湾大学) The University of Tokyo(东京大学) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 本文提出一个大规模动态数据集,用于解决生成逆向和正向渲染在现实场景中的限制,通过双屏拼接方法提取400万帧数据,提升渲染真实性和时间一致性,并提出新的评估协议。

Comments Project page: https://alaya-studio.github.io/renderer/

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 其他视频模型 1 篇

2603.11147 2026-04-03 cs.MM cs.CV cs.LG 62%

Catalogue Grounded Multimodal Attribution for Museum Video under Resource and Regulatory Constraints

博物馆视频下的资源与监管约束下的目录引导多模态归因

Minsak Nanang, Adrian Hilton, Armin Mustafa

机构 * University of Surrey(萨里大学)

专题命中 其他视频模型 :video language model(abstract);分类 cs.CV、cs.MM

AI总结 本文提出一种目录引导的多模态归因方法,用于博物馆视频内容的自动化元数据生成,以提高档案馆发现性并满足资源和监管要求。

Comments Demo video url: https://jn00767.pages.surrey.ac.uk/catalogue-grounded-multimodal-attribution-for-museum-video/

详情

展开后加载摘要…

URL PDF HTML 收藏