arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-05-11 至 2026-05-11 共收录 20 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 6 篇

2605.07872 2026-05-11 cs.CV cs.AI 87%

Video Understanding Reward Modeling: A Robust Benchmark and Performant Reward Models

视频理解奖励建模:一个稳健的基准和高效的奖励模型

Yuancheng Wei, Linli Yao, Lei Li, Haojie Zhang, Hao Zhou, Fandong Meng, Xu Sun

机构 * South China University of Technology(华南理工大学) Peking University(北京大学) The University of Hong Kong(香港大学) Tencent(腾讯)

专题命中 视频理解 :video understanding(title,summary_cn);分类 cs.CV

AI总结 本文提出Video Understanding Reward Bench基准和VideoDRM/VideoGRM模型,通过大规模高质量数据提升视频理解奖励建模性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07355 2026-05-11 cs.CV cs.AI 83%

TTF: Temporal Token Fusion for Efficient Video-Language Model

TTF: 时空融合用于高效的视频-语言模型

Simin Huo, Ning LI

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视频理解 :video-language(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 本文提出TTF方法,通过利用视频中的时间冗余性,减少视频语言模型的推理成本,保留高精度的同时显著降低视觉token数量。

Comments 14 pages; manuscript submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07897 2026-05-11 cs.CV cs.AI 79%

Semantic-Aware Adaptive Visual Memory for Streaming Video Understanding

具有语义意识的自适应视觉记忆用于流媒体视频理解

Hang Wu, Sherin Mary Mathews, Yujun Cai, Ming-Hsuan Yang, Yiwei Wang

机构 * University of California, Merced(加州大学梅尔德分校) US Bank(美国银行) University of Queensland(昆士兰大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出SAVEMem框架,通过语义意识增强内存生成并根据查询调整检索范围,提升流媒体视频理解的性能和内存效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07859 2026-05-11 cs.CV 79%

EyeCue: Driver Cognitive Distraction Detection via Gaze-Empowered Egocentric Video Understanding

EyeCue:通过眼动增强的视点视频理解进行驾驶员认知分心检测

Lang Zhang, JinYi Yoon, Matthew Corbett, Abhijit Sarkar, Bo Ji

机构 * Virginia Tech(弗吉尼亚理工大学) Inha University(inha大学) Army Cyber Institute at West Point(西点军营陆军网络学院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出EyeCue框架,通过眼动与视觉上下文的交互建模,实现驾驶员认知分心检测,利用CogDrive数据集验证其在多种驾驶场景下的高准确率和泛化能力。

Comments Accepted to the 35th International Joint Conference on Artificial Intelligence (IJCAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05848 2026-05-11 cs.CV cs.AI 79%

VideoRouter: Query-Adaptive Dual Routing for Efficient Long-Video Understanding

VideoRouter: 为高效长视频理解的查询适应双路由

Kuanwei Lin, Wenhao Zhang, Ge Li

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

专题命中 视频理解 :video understanding(title);long video(abstract);分类 cs.CV

AI总结 VideoRouter通过双路由框架实现高效长视频理解,通过语义路由和图像路由动态分配证据,减少冗余token,提升压缩效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08077 2026-05-11 cs.CV 74%

AdaSpark: Adaptive Sparsity for Efficient Long-Video Understanding

AdaSpark: 为高效长视频理解设计的自适应稀疏性

Handong Li, Zikang Liu, Longteng Guo, Tongtian Yue, Yepeng Tang, Xinxin Zhu, Chuanyang Zheng, Ziming Wang, Zhibin Wang, Jun Song, Cheng Yu, Bo Zheng, Jing Liu

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Future Living Lab of Alibaba(阿里巴巴未来生活实验室)

专题命中 视频理解 :video understanding(title);分类 cs.CV

AI总结 AdaSpark通过自适应稀疏框架减少计算负载达57% FLOPs,保持性能并保留细粒度长程依赖,适用于小时级视频基准测试。

Comments 8 pages, CVPR2026 Accept (Highlight)

Journal ref Proceedings of the IEEE/CVF Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 4 篇

2605.06892 2026-05-11 cs.CV 83%

Not All Tokens Need 40 Steps: Heterogeneous Step Allocation in Diffusion Transformers for Efficient Video Generation

并非所有标记都需要40步:扩散变换器中的异质步分配用于高效视频生成

Ernie Chu, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出HSA算法,通过根据速度动态分配不同时间空间标记的步数预算,提升视频生成效率,实验表明在加速运行时表现优于现有方法。

Comments Project page: https://ernestchu.github.io/hsa

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18636 2026-05-11 cs.CV 79%

Attention Sparsity is Input-Stable: Training-Free Sparse Attention for Video Generation via Offline Sparsity Profiling and Online QK Co-Clustering

注意力稀疏性是输入稳定的:通过离线稀疏性分析和在线QK共聚类实现训练自由的视频生成稀疏注意力

Jiayi Luo, Jiayu Chen, Jiankun Wang, Cong Wang, Hanxin Zhu, Qingyun Sun, Chen Gao, Zhibo Chen, Jianxin Li

机构 * SKLCCSE, School of Computer Science and Engineering, Beihang University(软件学院,北京航空航天大学) Beihang University(北京航空航天大学) School of Computer Science, Peking University(北京大学计算机学院) the State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,中国科学院自动化研究所) School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) BNRist, Tsinghua University(北京理工大学,清华大学) Zhongguancun Academy(中关村学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出SVOO框架,通过离线层间稀疏性分析和在线双向共聚类实现训练自由的视频生成稀疏注意力,解决传统方法中层异质性和查询-键耦合问题,提升生成质量与速度的平衡。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16748 2026-05-11 cs.CV 79%

Multimodal Diffusion Transformer with Memory Bank for Scalable Long-Duration Talking Video Generation

具有内存库的多模态扩散变换器用于可扩展的长时谈话视频生成

Haojie Zhang, Zhihao Liang, Ruibo Fu, Bingyan Liu, Zhengqi Wen, Xuefei Liu, Jianhua Tao, Yaling Liang

机构 * South China University of Technology(南方科技大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing National Research Center for Information Science and Technology, Tsinghua University(北京信息科学研究中心,清华大学) Department of Automation, BNRist, Tsinghua University(清华大学自动化系,北京信息科学研究中心)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出 LetsTalk 框架,通过多模态指导和内存库机制解决长时谈话视频生成中的质量、一致性、时间连贯性和计算效率问题,实验表明其在生成质量和效率上达到新水平。

Comments 16 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07695 2026-05-11 cs.CV 57%

OphEdit: Training-Free Text-Guided Editing of Ophthalmic Surgical Videos

OphEdit: 无需训练的文本引导眼科手术视频编辑

Ritul Jangir, Arkya Jyoti Bagchi, Aiman Farooq, Mangalton Okram, Saurabh Seetaram Korgaonkar, Deepak Mishra

机构 * Indian Institute of Technology Jodhpur(印度理工学院贾布尔分校) All India Institute of Medical Sciences Delhi(全国医学科学研究所德里)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出OphEdit框架,通过确定性二阶ODE反向管道和条件分类器自由引导分支,实现无需训练的文本引导眼科手术视频编辑,保持眼部解剖结构并实现语义修改。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 6 篇

2508.02129 2026-05-11 cs.CV 79%

VDEGaussian: Video Diffusion Enhanced 4D Gaussian Splatting for Dynamic Urban Scenes Modeling

VDEGaussian:基于视频扩散的4D高斯点云用于动态城市场景建模

Yuru Xiao, Zihan Lin, Chao Lu, Deming Zhai, Kui Jiang, Wenbo Zhao, Wei Zhang, Junjun Jiang, Huanran Wang, Xianming Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种结合视频扩散的4D高斯点云方法,解决动态场景建模中快速移动物体建模难题,通过时间一致性先验和不确定性蒸馏提升新型视角合成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07503 2026-05-11 cs.CV 79%

Diffusion-APO: Trajectory-Aware Direct Preference Alignment for Video Diffusion Transformers

Diffusion-APO:基于轨迹的直接偏好对齐用于视频扩散变换器

Jingyuan Zhu, Biaolong Chen, Le Zhang, Aixi Zhang, Hao Jiang, Pipei Huang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Diffusion-APO,通过同步训练噪声与推理时的去噪路径,解决视频扩散模型与人类意图对齐的问题,采用统一的RLHF框架实现灵活的多阶段偏好对齐,提升视觉质量和指令遵循性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02883 2026-05-11 cs.CV 79%

SemanticDialect: Semantic-Aware Mixed-Format Quantization for Video Diffusion Transformers

语义感知混合格式量化:用于视频扩散变换器的混合格式量化

Wonsuk Jang, Thierry Tambe

机构 * Stanford University(斯坦福大学)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 本文提出SemanticDialect,通过块级混合格式量化和语义感知方言分配,提升视频扩散变换器的量化效果,实验表明其在Open-Sora 2.0上接近FP16质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08050 2026-05-11 cs.CV 57%

MoCoTalk: Multi-Conditional Diffusion with Adaptive Router for Controllable Talking Head Generation

MoCoTalk: 多条件扩散与自适应路由的可控说话头生成

Xinyan Ye, Jiankang Deng, Abbas Edalat

机构 * Imperial College London(帝国理工学院伦敦分校)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 MoCoTalk通过统一身份、头部姿态、面部表情和嘴部动态四个控制信号,提出自适应多条件路由框架,解决异构条件干扰问题,提升可控说话头生成的性能与可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07079 2026-05-11 cs.CV cs.AI cs.LG cs.RO 57%

Learning Visual Feature-Based World Models via Residual Latent Action

通过残差潜在动作学习基于视觉特征的世界模型

Xinyu Zhang, Zhengtong Xu, Yutian Tao, Yeping Wang, Yu She, Abdeslam Boularias

机构 * Rutgers University(罗格斯大学) Purdue University(普渡大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出RLA-WM世界模型,通过流匹配预测残差潜在动作,优于现有特征和视频扩散模型,且在速度和效率上更优,同时开发了两项机器人学习技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13837 2026-05-11 cs.CV 57%

A Causal Diffusion Model for Video Reconstruction from Ultra-Low-Bitrate Representations

一种用于从超低比特率表示中重建视频的因果扩散模型

Cem Eteke, Batuhan Tosun, Martin Piccolrovazzi, Alexander Griessel, Wolfgang Kellerer, Eckehard Steinbach

机构 * Chair of Media Technology(媒体技术系) Chair of Communication Networks(通信网络系) Munich Institute of Robotics and Machine Intelligence(慕尼黑机器人与智能机械研究所) School of Computation Information and Technology, Technical University of Munich(计算信息与技术学院,慕尼黑技术大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出一种因果扩散模型,用于从超低比特率语义和高度压缩帧中重建视频,通过联合建模互补信息,提升重建质量,优于传统、神经、生成和语义基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 动作与事件理解 1 篇

2603.18856 2026-05-11 cs.CV cs.AI 83%

Motion-o: Trajectory-Grounded Video Reasoning

Motion-o:基于轨迹的视频推理

Bishoy Galoaa, Shayda Moezzi, Xiangyu Bai, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 动作与事件理解 :video reasoning(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 Motion-o通过引入运动链推理,使视频推理模型能够显式且可验证地表示物体运动轨迹,提升动态和轨迹依赖性推理的可监督性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 长视频与时序推理 2 篇

2605.07334 2026-05-11 cs.CV 79%

RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation

RCoT-Seg:强化链式推理用于视频推理与分割

Junwei Wen, Deshui Miao, Guangming Lu, Xin Li, Wenjie Pei

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室) Pazhou Lab (Huangpu)(琶洲实验室(黄埔))

专题命中 长视频与时序推理 :video reasoning(title,abstract);分类 cs.CV

AI总结 本文提出RCoT-Seg框架,通过分离时间推理与空间感知,改进视频分割中关键帧选择与定位,提升多目标场景下的鲁棒性与精度。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06924 2026-05-11 cs.CV cs.AI 79%

A$^2$RD: Agentic Autoregressive Diffusion for Long Video Consistency

A$^2$RD:基于代理的自回归扩散用于长视频一致性

Do Xuan Long, Yale Song, Min-Yen Kan, Tomas Pfister, Long T. Le

机构 * Google Cloud AI Research(谷歌云人工智能研究)

专题命中 长视频与时序推理 :long video(title,abstract);分类 cs.CV

AI总结 A$^2$RD通过Retrieve-Synthesize-Refine-Update循环实现长视频一致性合成,提升视频生成的连贯性和叙事一致性。

Comments Project page: http://dxlong2000.github.io/AARD

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 视频数据与评测 1 篇

2605.07593 2026-05-11 cs.CV 57%

TraceAV-Bench: Benchmarking Multi-Hop Trajectory Reasoning over Long Audio-Visual Videos

TraceAV-Bench: 多跳轨迹推理长音频视频基准测试

Hengyi Feng, Hao Liang, Mingrui Chen, Bohan Zeng, Meiyi Qiang, Zhengyang Zhao, Zimo Meng, Zeang Sheng, Wentao Zhang

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院)

专题命中 视频数据与评测 :long video(abstract);分类 cs.CV

AI总结 TraceAV-Bench首次评估多跳轨迹推理和多模态幻觉鲁棒性,包含2200道多选题,覆盖4个维度15个子任务,揭示多模态推理与幻觉鲁棒性脱节问题。

详情

展开后加载摘要…

URL PDF HTML 收藏