arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-26 至 2026-03-26 共收录 9 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 3 篇

2603.24558 2026-03-26 cs.CV cs.AI 83%

LensWalk: Agentic Video Understanding by Planning How You See in Videos

LensWalk: 通过规划如何在视频中观看实现代理视频理解

Keliang Li, Yansong Li, Hongze Shen, Mengdi Liu, Hong Chang, Shiguang Shan

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Peng Cheng Laboratory(鹏城实验室) College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视频理解 :video understanding(title,abstract);video reasoning(abstract);分类 cs.CV

AI总结 LensWalk通过建立紧密的推理-计划-观察循环,使大语言模型能够主动控制视觉观察,提升视频理解的准确性和鲁棒性。

Comments To be published in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24539 2026-03-26 cs.CV cs.AI 83%

CliPPER: Contextual Video-Language Pretraining on Long-form Intraoperative Surgical Procedures for Event Recognition

CliPPER:基于长形式术中手术程序的上下文视频-语言预训练用于事件识别

Florian Stilz, Vinkle Srivastav, Nassir Navab, Nicolas Padoy

机构 * University of Strasbourg, CNRS, INSERM, ICube, UMR7357, France(斯特拉斯堡大学,法国国家科学研究中心,法国国家医学研究院,ICube,UMR7357,法国) IHU Strasbourg, France(斯特拉斯堡IHU,法国) Technical University of Munich, Germany(慕尼黑技术大学,德国)

专题命中 视频理解 :video-language(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 本文提出CliPPER框架,通过手术讲座视频预训练,提升长形式手术视频的细粒度时间视频-文本识别,引入VTC_CTX和COP等预训练策略,改进多模态对齐,实现多个公开手术基准的新SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04000 2026-03-26 cs.CV cs.AI cs.LG 79%

Divide, then Ground: Adapting Frame Selection to Query Types for Long-Form Video Understanding

分割后再地面:为长视频理解适应帧选择以查询类型

Jialuo Li, Bin Li, Jiahao Li, Yan Lu

机构 * Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出DIG框架,根据查询类型调整帧选择策略,通过高效均匀采样处理全局查询,利用专用流程提取相关帧处理局部查询,提升长视频理解性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 4 篇

2512.16371 2026-03-26 cs.CV 91%

Anchored Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models

锚定视频生成:解耦场景构建与时间合成在文本到视频扩散模型中

Mariam Hassan, Bastien Van Delft, Wuyang Li, Alexandre Alahi

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院洛桑分校)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);video diffusion(title);分类 cs.CV

AI总结 本文提出锚定视频生成方法,通过解耦场景构建与时间合成任务,提升文本到视频扩散模型在复杂场景生成和时间逻辑遵循上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24570 2026-03-26 cs.CV cs.AI 83%

Anti-I2V: Safeguarding your photos from malicious image-to-video generation

Anti-I2V: 保护您的照片免受恶意图像到视频生成的威胁

Duc Vu, Anh Nguyen, Chi Tran, Anh Tran

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 针对图像到视频扩散模型的恶意生成问题,Anti-I2V在L*a*b*和频域中操作,提升鲁棒性并聚焦显著像素,通过优化训练目标提升时间一致性与生成保真度,展现先进防御性能。

Comments Accepted to CVPR 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27684 2026-03-26 cs.CV 70%

Phased DMD: Few-step Distribution Matching Distillation via Score Matching within Subintervals

相位DMD:通过在子区间内进行分数匹配实现少步分布匹配蒸馏

Xiangyu Fan, Zesong Qiu, Zhuguanyu Wu, Fanzhou Wang, Zhiqian Lin, Tianxiang Ren, Dahua Lin, Ruihao Gong, Lei Yang

机构 * SenseTime Research(商汤科技研究院) Beihang University(北航大学)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出Phased DMD,一种多步蒸馏框架,结合分步蒸馏与专家混合(MoE),提升模型容量并减少学习难度,通过分步分布匹配和子区间内分数匹配改进生成多样性与视觉保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23960 2026-03-26 cs.CV 57%

Leave No Stone Unturned: Uncovering Holistic Audio-Visual Intrinsic Coherence for Deepfake Detection

不留死角:揭示深度伪造检测中的整体音频视觉内在一致性

Jielun Peng, Yabin Wang, Yaqi Li, Long Kong, Xiaopeng Hong

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

AI总结 本文提出HAVIC方法,通过学习模态特定的结构一致性及跨模态微/宏观一致性,提升深度伪造检测的鲁棒性和泛化能力,实验表明其在跨数据集场景中性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 2 篇

2603.24260 2026-03-26 cs.CV cs.AI 57%

Accelerating Diffusion-based Video Editing via Heterogeneous Caching: Beyond Full Computing at Sampled Denoising Timestep

通过异构缓存加速基于扩散的视频编辑:超越采样去噪时间步的全计算

Tianyi Liu, Ye Lu, Linfeng Zhang, Chen Cai, Jianjun Gao, Yi Wang, Kim-Hui Yap, Lap-Pui Chau

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出HetCache框架,通过利用扩散基于掩码视频到视频生成中的异构性,减少冗余注意力运算,提升视频编辑效率与质量。

Comments 10 pages, 6 figures, accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22533 2026-03-26 cs.CV 57%

Fast3Dcache: Training-free 3D Geometry Synthesis Acceleration

Fast3Dcache: 无训练3D几何合成加速

Mengyu Yang, Yanming Yang, Chenyi Xu, Chenxi Song, Yufan Zuo, Tong Zhao, Ruibo Li, Chi Zhang

机构 * AGI Lab, Westlake University(西溪大学AGI实验室) University of Electronic Science and Technology of China(电子科学与技术大学) Nanyang Technological University(南洋理工大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 本文提出Fast3Dcache,一种无训练的几何感知缓存框架,通过动态缓存调度和时空稳定性准则,显著加速3D扩散模型推理,同时保持几何精度。

Comments Accepted by CVPR 2026; Project page: https://fast3dcache-agi.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏