arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-05-05 至 2026-05-05 共收录 7 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 4 篇

2602.02958 2026-05-05 cs.LG 88%

Quant VideoGen: Auto-Regressive Long Video Generation via 2-Bit KV-Cache Quantization

Quant VideoGen:通过2位KV缓存量化实现自回归长视频生成

Haocheng Xi, Shuo Yang, Yilong Zhao, Muyang Li, Han Cai, Xingyang Li, Yujun Lin, Zhuoyang Zhang, Jintao Zhang, Xiuyu Li, Zhiying Xu, Jun Wu, Chenfeng Xu, Ion Stoica, Song Han, Kurt Keutzer

机构 * University of California, Berkeley(加州大学伯克利分校) NVIDIA Massachusetts Institute of Technology(麻省理工学院) Amazon(亚马逊) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视频生成 :video generation(title,abstract);long video(title);video diffusion(abstract)

AI总结 本文提出Quant VideoGen,通过语义感知平滑和渐进残差量化技术,有效降低KV缓存内存消耗,提升长视频生成质量与效率。

Comments Accepted by ICML 2026. 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01477 2026-05-05 cs.RO 82%

Action Agent: Agentic Video Generation Meets Flow-Constrained Diffusion

动作代理:代理视频生成与流约束扩散的结合

Jeffrin Sam, Nguyen Khang, Yara Mahmoud, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Skoltech(斯克里普切尔技术大学智能空间机器人实验室)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract)

AI总结 本文提出Action Agent框架,结合代理导航视频生成与流约束扩散控制,通过两阶段方法提升多体机器人导航性能,实现从语言和图像输入生成物理合理的第一人称导航视频,并在真实和仿真环境中取得高成功率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00826 2026-05-05 cs.IR cs.CV cs.LG cs.MM 81%

Understanding the Performance Plateau in Text-to-Video Retrieval: A Comprehensive Empirical and Linguistic Analysis

理解文本到视频检索中的性能平台:全面的实证和语言分析

Maria-Eirini Pegia, Dimitrios Stefanopoulos, Björn Þór Jónsson, Anastasia Moumtzidou, Ilias Gialampoukidis, Stefanos Vrochidis, Ioannis Kompatsiaris

机构 * Information Technologies Institute(信息科技研究所) CERTH-ITI School of Computer Science(计算机科学学院) Reykjavík University(雷克雅未克大学)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV、cs.MM

AI总结 本文通过实证和语言分析,探讨文本到视频检索中模型性能瓶颈,揭示caption特性与模型表现的关系,指出简单清晰的caption提升召回率,而复杂事件仍具挑战性。

Comments Survey, 50 pages, 15 figures, 13 tables, 154 citations

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10571 2026-05-05 cs.CV 57%

AVI-Edit: Audio-sync Video Instance Editing with Granularity-Aware Mask Refiner

AVI-Edit: 基于粒度感知掩码细化的音频同步视频实例编辑

Haojie Zheng, Shuchen Weng, Jingqi Liu, Siqi Yang, Boxin Shi, Xinlong Wang

机构 * School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) State Key Lab of Multimedia Info. Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Nat’l Eng. Research Ctr. of Visual Tech., School of Computer Science, Peking University(北京大学计算机学院视觉技术工程研究中心) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出AVI-Edit框架,通过粒度感知掩码细化和自反馈音频代理,实现音频同步的高质量视频实例编辑,提升了空间和时间控制精度。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频问答 2 篇

2605.01662 2026-05-05 cs.CV 79%

Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models

视频主动感知:基于视觉-语言模型的高效推理时长视频理解

Martin Q. Ma, Willis Guo, Aditya Agrawal, Ankit Gupta, Paul Pu Liang, Ruslan Salakhutdinov, Louis-Philippe Morency

机构 * Carnegie Mellon University(卡内基梅隆大学) MIT(麻省理工学院)

专题命中 视频问答 :video understanding(title);video generation(abstract);分类 cs.CV

AI总结 本文提出视频主动感知方法,通过主动感知理论提升长视频问答性能,实现帧效率提升5.6倍,优于现有模型。

Comments ICCV 2025 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01496 2026-05-05 cs.CV 57%

SF20K Competition 2025: Summary and findings

SF20K竞赛2025:总结与发现

Ridouane Ghermi, Xi Wang, Vicky Kalogeiton, Ivan Laptev

机构 * SLoMO Workshop(SLoMO工作坊) Hugging Face

专题命中 视频问答 :video understanding(abstract);分类 cs.CV

AI总结 本文总结了首个SF20K竞赛的结果,探讨了视频问答任务中多模态理解的重要性,并指出信息选择和推理结构是长视频问答的主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长视频与时序推理 1 篇

2605.01657 2026-05-05 cs.CV 79%

Act2See: Emergent Active Visual Perception for Video Reasoning

Act2See:面向视频推理的涌现式主动视觉感知

Martin Q. Ma, Yuxiao Qu, Aditya Agrawal, Willis Guo, Paul Pu Liang, Ruslan Salakhutdinov, Louis-Philippe Morency

机构 * Carnegie Mellon University(卡内基梅隆大学) MIT(麻省理工学院)

专题命中 长视频与时序推理 :video reasoning(title,abstract);分类 cs.CV

AI总结 本文提出Act2See框架,通过使VLMs在文本推理中主动交错视频帧,实现视频推理中的主动视觉感知,提升了推理质量并优于现有方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏