arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-06 至 2026-03-06 共收录 15 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 2 篇

2603.04977 2026-03-06 cs.CV 89%

Think, Then Verify: A Hypothesis-Verification Multi-Agent Framework for Long Video Understanding

思考,然后验证:一种用于长视频理解的假设-验证多智能体框架

Zheng Wang, Haoran Chen, Haoxuan Qin, Zhipeng Wei, Tianwen Qian, Cong Bai

机构 * College of Computer Science, Zhejiang University of Technology(浙江工业大学计算机科学学院) Zhejiang Key Laboratory of Visual Information Intelligent Processing(浙江视觉信息智能处理重点实验室) UC Berkeley(伯克利大学) College of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);video reasoning(abstract);分类 cs.CV

AI总结 VideoHV-Agent通过结构化假设-验证流程提升长视频理解的准确性、可解释性和效率。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00141 2026-03-06 cs.CV cs.AI 88%

FLoC: Facility Location-Based Efficient Visual Token Compression for Long Video Understanding

FLoC:基于设施定位的高效视觉令牌压缩用于长视频理解

Janghoon Cho, Jungsoo Lee, Munawar Hayat, Kyuwoong Hwang, Fatih Porikli, Sungha Choi

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 FLoC提出了一种基于设施定位函数的高效视觉令牌压缩方法,通过懒惰贪心算法实现紧凑且多样化的令牌选择,有效提升长视频理解的处理效率和性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 6 篇

2603.05503 2026-03-06 cs.CV 86%

Accelerating Text-to-Video Generation with Calibrated Sparse Attention

通过校准稀疏注意力加速文本到视频生成

Shai Yehezkel, Shahar Yadin, Noam Elata, Yaron Ostrovsky-Berman, Bahjat Kawar

机构 * Apple Tel Aviv University(苹果以色列大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title);分类 cs.CV

AI总结 CalibAtt通过校准稀疏注意力提升文本到视频生成的效率,实现1.58倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01266 2026-03-06 cs.CV cs.LG 85%

MotionStream: Real-Time Video Generation with Interactive Motion Controls

MotionStream: 通过交互式运动控制实现实时视频生成

Joonghyuk Shin, Zhengqi Li, Richard Zhang, Jun-Yan Zhu, Jaesik Park, Eli Shechtman, Xun Huang

机构 * Seoul National University(首尔国立大学) Adobe Research(Adobe研究) Carnegie Mellon University(卡内基梅隆大学) Morpheus AI

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);long video(abstract);分类 cs.CV

AI总结 MotionStream通过交互式运动控制实现实时视频生成,利用因果注意力机制和蒸馏技术,实现亚秒延迟和高效率的无限长视频流式生成。

Comments ICLR 2026, Project webpage: https://joonghyuk.com/motionstream-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18991 2026-03-06 cs.CV cs.CL cs.MM 84%

EasyAnimate: High-Performance Video Generation Framework with Hybrid Windows Attention and Reward Backpropagation

EasyAnimate:基于混合窗口注意力和奖励反向传播的高性能视频生成框架

Jiaqi Xu, Kunzhe Huang, Xinyi Zou, Yunkuo Chen, Bo Liu, MengLi Cheng, Jun Huang, Xing Shi

机构 * Alibaba Cloud(阿里云)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV、cs.MM

AI总结 EasyAnimate通过混合窗口注意力和奖励反向传播提升视频生成效率与质量,实现高性能视频生成。

Comments 10 pages, 8 figures, ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05449 2026-03-06 cs.CV cs.AI cs.GR 79%

RealWonder: Real-Time Physical Action-Conditioned Video Generation

RealWonder: 基于实时物理动作的视频生成

Wei Liu, Ziyu Chen, Zizhang Li, Yue Wang, Hong-Xing Yu, Jiajun Wu

机构 * Stanford University(斯坦福大学) University of Southern California(南加州大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 RealWonder通过物理模拟实现实时动作条件视频生成,利用3D重建、物理模拟和简化视频生成器,在单张图像基础上生成高质量视频,适用于多种物理场景。

Comments The first two authors contributed equally. The last two authors advised equally. Project website: https://liuwei283.github.io/RealWonder/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05506 2026-03-06 cs.CV 57%

FaceCam: Portrait Video Camera Control via Scale-Aware Conditioning

FaceCam: 通过尺度感知条件化实现人像视频相机控制

Weijie Lyu, Ming-Hsuan Yang, Zhixin Shu

机构 * University of California, Merced(加州大学梅尔塞德斯分校) Adobe Research(Adobe研究)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 FaceCam通过尺度感知条件化方法,提升单目人像视频的相机控制能力与视觉质量。

Comments Accepted by CVPR 2026. Project page: https://weijielyu.github.io/FaceCam

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13454 2026-03-06 cs.CV 57%

Text-to-3D by Stitching a Multi-view Reconstruction Network to a Video Generator

通过将多视角重建网络缝合到视频生成器中实现文本到3D

Hyojun Go, Dominik Narnhofer, Goutam Bhat, Prune Truong, Federico Tombari, Konrad Schindler

机构 * ETH Zurich(苏黎世联邦理工学院) Google(谷歌)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 VIST3A通过将多视角重建网络缝合到视频生成器中,实现文本到3D生成,提升3D场景生成质量。

Comments ICLR 2026 (Oral), Project page: https://gohyojun15.github.io/VIST3A/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 4 篇

2603.05315 2026-03-06 cs.CV 57%

Frequency-Aware Error-Bounded Caching for Accelerating Diffusion Transformers

面向频率的误差有界缓存用于加速扩散变换器

Guandong Li

机构 * iFLYTEK

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 SpectralCache通过统一缓存框架提升扩散变换器推理速度,实现2.46倍加速,质量与TeaCache相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19210 2026-03-06 cs.CV 57%

Track Anything Behind Everything: Zero-Shot Amodal Video Object Segmentation

在一切之后跟踪任何东西:零样本无遮挡视频对象分割

Finlay G. C. Hudson, William A. P. Smith

机构 * Department of Computer Science University of York(计算机科学系约克大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 TABE通过单个查询掩码实现零样本无遮挡视频对象分割,利用预训练视频扩散模型进行生成补全,无需重新训练模型即可处理完全遮挡场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05081 2026-03-06 cs.CV 57%

Orthogonal Spatial-temporal Distributional Transfer for 4D Generation

正交时空分布式转移用于4D生成

Wei Liu, Shengqiong Wu, Bobo Li, Haoyu Zhao, Hao Fei, Mong-Li Lee, Wynne Hsu

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出正交时空分布式转移机制,通过解耦空间和时间潜在变量提升4D生成的质量和一致性。

Comments 9 pages, 6 figures, 3 tables, AAAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05106 2026-03-06 cs.CV cs.GR cs.LG cs.RO 57%

NeuralRemaster: Phase-Preserving Diffusion for Structure-Aligned Generation

NeuralRemaster: 保留相位的扩散用于结构对齐生成

Yu Zeng, Charles Ochoa, Mingyuan Zhou, Vishal M. Patel, Vitor Guizilini, Rowan McAllister

机构 * Toyota Research Institute(丰田研究院) University of Texas, Austin(德克萨斯大学奥斯汀分校) Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 NeuralRemaster通过保留相位并随机化幅度,实现结构对齐的图像和视频生成,提升模拟到现实的转换性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 动作与事件理解 1 篇

2603.04899 2026-03-06 cs.CV 79%

FC-VFI: Faithful and Consistent Video Frame Interpolation for High-FPS Slow Motion Video Generation

FC-VFI: 用于高帧率慢动作视频生成的忠实且一致的视频帧插值

Ganggui Ding, Hao Chen, Xiaogang Xu

机构 * Zhejiang University Chinese University of Hong Kong(浙江大学香港中文大学)

专题命中 动作与事件理解 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 FC-VFI通过引入时间建模策略和语义匹配线,实现了高帧率慢动作视频生成中的忠实且一致的帧插值。

Comments ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视频数据与评测 2 篇

2603.05484 2026-03-06 cs.CV 57%

Towards Multimodal Lifelong Understanding: A Dataset and Agentic Baseline

迈向多模态终身理解:一个数据集和代理基准

Guo Chen, Lidong Lu, Yicheng Liu, Liangrui Dong, Lidong Zou, Jixin Lv, Zhenquan Li, Xinyi Mao, Baoqi Pei, Shihao Wang, Zhiqi Li, Karan Sapra, Fuxiao Liu, Yin-Dong Zheng, Yifei Huang, Limin Wang, Zhiding Yu, Andrew Tao, Guilin Liu, Tong Lu

专题命中 视频数据与评测 :video understanding(abstract);分类 cs.CV

AI总结 本文提出MM-Lifelong数据集和ReMA代理,解决多模态终身理解中的工作记忆瓶颈和全局定位崩溃问题,通过动态内存管理提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10689 2026-03-06 cs.AI 50%

OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs

OmniVideoBench: 向多模态大语言模型的音频-视觉理解评估迈进

Caorui Li, Yu Chen, Yiyan Ji, Jin Xu, Zhenyu Cui, Shihao Li, Yuanxing Zhang, Wentao Wang, Zhenghao Song, Dingling Zhang, Ying He, Haoxiang Liu, Yuxuan Wang, Qiufeng Wang, Jiafu Tang, Zhenhe Wu, Jiehui Luo, Zhiyu Pan, Weihao Xie, Chenchen Zhang, Zhaohui Wang, Jiayi Tian, Yanghai Wang, Zhe Cao, Minxin Dai, Ke Wang, Runzhe Wen, Yinghao Ma, Yaning Pan, Sungkyun Chang, Termeh Taheri, Haiwen Xia, Christos Plachouras, Emmanouil Benetos, Yizhi Li, Ge Zhang, Jian Yang, Tianhao Peng, Zili Wang, Minghao Liu, Junran Peng, Zhaoxiang Zhang, Jiaheng Liu

机构 * NJU-LINK Team(南京大学链接团队)

专题命中 视频数据与评测 :video understanding(abstract)

AI总结 OmniVideoBench通过大规模基准测试评估多模态大语言模型在音频-视觉理解中的协同推理能力,揭示模型与人类推理间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏