arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-05-29 至 2026-05-29 共收录 24 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 1 篇

2605.30010 2026-05-29 cs.CV 79%

EarlyTom: Early Token Compression Completes Fast Video Understanding

EarlyTom: 早期令牌压缩实现快速视频理解

Hesong Wang, Xin Jin, Lu Lu, Chenhaowen Li, Jian Chen, Qiang Liu, Huan Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Alibaba Cloud Computing(阿里云计算)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 针对视频大语言模型中视觉编码阶段效率低下的问题,提出EarlyTom无训练令牌压缩框架,通过在视觉编码器内部进行早期压缩,显著降低首令牌延迟并提升吞吐量。

Comments Accepted by CVPR 2026. 16 pages, 8 figures, 8 tables. Project page: https://viridisgreen.github.io/EarlyTom

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 13 篇

2510.26412 2026-05-29 cs.CV cs.AI 89%

LoCoT2V-Bench: Benchmarking Long-Form and Complex Text-to-Video Generation

LoCoT2V-Bench: 长文本与复杂文本到视频生成的基准测试

Xiangqing Zheng, Chengyue Wu, Kehai Chen, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院) The University of Hong Kong(香港大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);long video(abstract);分类 cs.CV

AI总结 针对长视频生成在复杂文本输入下的评估挑战,提出包含多场景提示与层次元数据的基准LoCoT2V-Bench,并设计多维度评估框架LoCoT2V-Eval,实验发现模型在细粒度文本-视频对齐和角色一致性方面存在显著不足。

Comments Accepted by ICML 2026 (Regular)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30349 2026-05-29 cs.CV 83%

AdaState: Self-Evolving Anchors for Streaming Video Generation

AdaState: 用于流式视频生成的自演化锚点

Yusuf Dalva, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工学院)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 针对自回归视频扩散模型中静态首帧锚点抑制视频动态的问题,提出自适应状态锚点,通过隐变量与内容联合去噪并随时间演化,显著提升运动丰富度和场景自然演进。

Comments Project page: https://adastate.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30317 2026-05-29 cs.CV 83%

VPG: Visual Prefix Guidance for Autoregressive Image and Video Generation

VPG: 视觉前缀引导的自回归图像与视频生成

Xinyao Liao, Qiyuan He, Yicong Li, Jiayin Zhu, Xiaoye Qu, Wei Wei, Angela Yao

机构 * National University of Singapore(新加坡国立大学) Huazhong University of Science & Technology(华中科技大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 提出VPG,一种无需训练、推理时引导的方法,通过对比生成前缀与损坏前缀下的模型输出来改进自回归图像和视频生成的下一步预测,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26064 2026-05-29 cs.CV cs.LG 83%

Paris 2.0: A Decentralized Diffusion Model for Video Generation

Paris 2.0: 一种去中心化的视频生成扩散模型

Ali Rouzbayani, Bidhan Roy, Marcos Villagra, Zhiying Jiang

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出Paris 2.0,首个通过去中心化计算预训练的视频生成模型,基于Paris 1.0的扩散模型框架,在低分辨率文本到视频任务中相比集中式模型将FVD从561.04降至279.01,提升约2倍,并提高了CLIP文本-视频相似度和美学评分。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21996 2026-05-29 cs.CV cs.AI 83%

VRAG: Learning World Models for Interactive Video Generation

VRAG:面向交互式视频生成的世界模型学习

Taiye Chen, Xun Hu, Zihan Ding, Chi Jin

机构 * Peking University(北京大学) University of Oxford(牛津大学) Princeton University(普林斯顿大学)

专题命中 视频生成 :video generation(title,abstract);long video(abstract);分类 cs.CV

AI总结 针对自回归视频生成中累积误差和记忆机制不足的问题,提出视频检索增强生成(VRAG)方法,通过显式全局状态条件降低长期累积误差并提升时空一致性。

Comments Published at NeurIPS 2025. Project page: https://sites.google.com/view/vrag

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30346 2026-05-29 cs.CV 79%

YoCausal: How Far is Video Generation from World Model? A Causality Perspective

YoCausal: 视频生成距离世界模型还有多远?一个因果视角

You-Zhe Xie, Yu-Hsuan Li, Jie-Ying Lee, Kaipeng Zhang, Yu-Lun Liu, Zhixiang Wang

机构 * National Yang Ming Chiao Tung University Shanda AI Research Tokyo

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 提出YoCausal基准,通过时间反转真实视频生成反事实样本,利用反向惊奇指数(RSI)和因果认知指数(CCI)评估视频扩散模型的因果理解能力,发现模型感知时间方向不等于理解因果关系,与人类水平存在显著差距。

Comments Project page: https://www.youzhexie.me/papers/YoCausal/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30174 2026-05-29 cs.CV 79%

LiveSVG: Zero-Shot SVG Animation via Video Generation

LiveSVG:通过视频生成的零样本SVG动画

Matan Levy, Ran Margolin, Bar Cavia, Dvir Samuel, Yael Pritch, Shmuel Peleg, Alex Rav Acha, Ariel Shamir, Dani Lischinski

机构 * Google(谷歌) The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Bar-Ilan University(巴伊兰大学) Reichman University(雷赫曼大学)

专题命中 视频生成 :video generation(title);video diffusion(abstract);分类 cs.CV

AI总结 提出LiveSVG方法,利用视频扩散模型直接拟合目标视频实现零样本SVG动画,无需骨架或类别先验,通过双层运动表示和球体填充重着色策略解决复杂运动与颜色歧义问题。

Comments Project Page: https://levymsn.github.io/LiveSVG

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30090 2026-05-29 cs.CL cs.CV 79%

DirectorBench: Diagnosing Long-Form Video Generation with Personalized Multi-Agent Evaluation

DirectorBench: 通过个性化多智能体评估诊断长视频生成

Jiamin Chen, Qianben Chen, Jiawen Zhang, Yidi Wu, Yuchen Li, Xiaokun Zhang, Wangchunshu Zhou, Chen Ma

机构 * ByteDance Inc.(字节跳动公司) City University of Hong Kong(香港城市大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出DirectorBench,一种基于多智能体的诊断基准,通过80个结构化元数据、7个用户画像和40个检查点标准,在脚本、视觉、音频、跨模态和稳定性五个维度上评估长视频生成,并定位瓶颈和用户偏好依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30083 2026-05-29 cs.CV 79%

Future Forcing: Future-aware Training-free KV Cache Policy for Autoregressive Video Generation

未来强制:自回归视频生成中无需训练的未来感知KV缓存策略

Jiayi Luo, Qiyan Liu, Tengyang Wang, JunHao Liu, Jiayu Chen, Cong Wang, Hanxin Zhu, Chen Gao, Xiaobin Hu, Qingyun Sun, Zhibo Chen

机构 * BUAA(北京航空航天大学) ZGCA(中广核人工智能研究院) PKU(北京大学) CASIA(中国科学院自动化研究所) USTC(中国科学技术大学) NUS(新加坡国立大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出Future Forcing,一种无需训练的未来感知KV缓存策略,通过利用自回归视频模型中查询分布的平稳性来估计未来查询,从而改进长视频生成的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06022 2026-05-29 cs.CV 79%

CamC2V: Context-aware Controllable Video Generation

CamC2V: 上下文感知的可控视频生成

Luis Denninger, Sina Mokhtarzadeh Azar, Juergen Gall

机构 * University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出CamC2V模型,通过集成多图像条件与3D约束及相机控制,实现上下文感知的连贯视频生成,在RealEstate10K数据集上FVD提升24.09%。

Comments Published at 3DV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01334 2026-05-29 cs.CV 79%

AlignVid: Training-Free Attention Scaling for Semantic Fidelity in Text-Guided Image-to-Video Generation

AlignVid: 文本引导图像到视频生成中语义保真度的免训练注意力缩放

Yexin Liu, Wen-Jie Shu, Zile Huang, Haoze Zheng, Yueze Wang, Jingjin Zhu, Manyuan Zhang, Ser-Nam Lim, Harry Yang

机构 * Hong Kong University of Science(香港科学大学) University of Central Florida, Orlando, FL, USA(中央佛罗里达大学) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院) The Chinese University of Hong Kong, Hong Kong SAR, China(香港中文大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 针对文本引导图像到视频生成中视觉主导导致语义编辑失败的问题,提出免训练注意力缩放调制(ASM)和引导调度(GS)方法,并构建OmitI2V基准,有效提升语义保真度且计算开销可忽略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30073 2026-05-29 cs.CV 57%

Native Audio-Visual Alignment for Generation

原生音视频对齐生成

Longbin Ji, Guan Wang, Xuan Wei, Chenye Yang, Xiangrui Liu, Zhenyu Zhang, Shuohuan Wang, Yu Sun, Jingzhou He

机构 * ERNIE Team, Baidu Inc.(百度公司ERNIE团队)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出NAVA框架,通过原生音视频对齐和上下文条件联合去噪,实现高质量、同步且可控的音视频生成。

Comments Project page: https://ernie-research.github.io/NAVA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23993 2026-05-29 cs.CV cs.AI cs.LG 57%

Nano World Models: A Minimalist Implementation of Future Video Prediction

纳米世界模型:未来视频预测的极简实现

Siqiao Huang, Partha Kaushik, Michael Chen, Hengkai Pan, Kaiwen Geng, Omar Chehab, Fernando Moreno-Pino, Max Simchowitz

机构 * DeepMind

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出Nano World Models,一个基于扩散强迫的极简代码库,用于未来视频预测,支持可控研究世界模型的设计选择,并通过实验分析预测参数化、架构规模等因素对视频预测质量的影响。

Comments Project page: https://simchowitzlabpublic.github.io/nano-world-model/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 8 篇

2605.30325 2026-05-29 cs.CV 83%

Veda: Scalable Video Diffusion via Distilled Sparse Attention

Veda: 通过蒸馏稀疏注意力实现可扩展的视频扩散

Shihao Han, Hao Yang, Xinting Hu, Xiaofeng Mei, Yi Jiang, Xiaojuan Qi

机构 * ByteDance Inc.(字节跳动公司) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);long video(abstract);分类 cs.CV

AI总结 提出Veda蒸馏稀疏注意力框架,通过统计感知的tile评分和头感知tile选择,在保持生成质量的同时实现视频扩散模型的高效加速。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30351 2026-05-29 cs.CV cs.AI 79%

VideoMLA: Low-Rank Latent KV Cache for Minute-Scale Autoregressive Video Diffusion

VideoMLA: 用于分钟级自回归视频扩散的低秩潜在KV缓存

Hidir Yesiltepe, Jiazhen Hu, Tuna Han Salih Meral, Adil Kaan Akan, Kaan Oktay, Hoda Eldardiry, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工大学) fal Project(fal项目)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 本文提出VideoMLA,通过多头潜在注意力(MLA)将每头KV替换为共享低秩内容潜在和分离的3D-RoPE位置键,在视频扩散中减少92.7%的KV内存,并保持质量与吞吐量提升。

Comments Project Page: https://videomla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30263 2026-05-29 cs.CV 70%

minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models

minWM: 用于实时交互式视频世界模型的全栈开源框架

Min Zhao, Hongzhou Zhu, Bokai Yan, Zihan Zhou, Yimin Chen, Wenqiang Sun, Kaiwen Zheng, Guande He, Xiao Yang, Chongxuan Li, Fan Bao, Jun Zhu

机构 * ShengShu(盛书) THU(清华大学) RUC(中国人民大学) HKUST(香港科技大学) UT-Austin(德克萨斯大学奥斯汀分校)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出minWM全栈开源框架,通过因果强制/因果强制++流水线将双向视频扩散模型转化为可控制、低延迟的自回归世界模型,支持相机控制与多种骨干架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21876 2026-05-29 cs.CV cs.AI 70%

EPiC: Efficient Video Camera Control Learning with Precise Anchor-Video Guidance

EPiC: 基于精确锚点视频引导的高效视频摄像机控制学习

Zun Wang, Jaemin Cho, Jialu Li, Han Lin, Jaehong Yoon, Yue Zhang, Mohit Bansal

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出EPiC框架,通过基于首帧可见性掩码构建精确对齐的锚点视频,并引入轻量模块Anchor-ControlNet,以极低参数实现高效、精确的3D摄像机控制,在RealEstate10K和MiraData上达到最先进性能。

Comments Accepted to ICML 2026. Project website: https://zunwang1.github.io/Epic

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30311 2026-05-29 cs.CV cs.AI 57%

Archon: A Unified Multimodal Model for Holistic Digital Human Generation

Archon:面向整体数字人生成的统一多模态模型

Chong Bao, Shichen Liu, Lijun Yu, David Futschik, Stylianos Moschoglou, Shefali Srivastava, Ziqian Bai, Feitong Tan, Guofeng Zhang, Zhaopeng Cui, Sean Fanello, Yinda Zhang

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) Google(谷歌) Google DeepMind(谷歌DeepMind)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出Archon,一个完全预训练的以人为中心的统一多模态模型,通过模态特定分词器、语义视频重参数化和“模态思维”策略,实现文本、音频、动作和视觉等七种模态的整体数字人生成。

Comments Accepted to CVPR 2026. Project Page: https://zju3dv.github.io/archon/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03550 2026-05-29 cs.CV 57%

Streaming Drag-Oriented Interactive Video Manipulation: Drag Anything, Anytime!

流式拖拽导向的交互式视频操作:随时拖动任何物体!

Junbao Zhou, Yuan Zhou, Kesen Zhao, Qingshan Xu, Beier Zhu, Richang Hong, Hanwang Zhang

机构 * Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出REVEL任务和DragStream方法,通过自适应分布自校正和空间频率选择性优化,实现自回归视频扩散模型的流式拖拽交互操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23345 2026-05-29 cs.CV 57%

SCOPE: Simulating Cross-game Operations in Playable Environments for FPS World Models

SCOPE: 在可玩环境中模拟跨游戏操作以构建FPS世界模型

Zizhao Tong, Yeying Jin, Hongfeng Lai, Zeqing Wang, Zhaohu Xing, Kexu Cheng, Haoran Xu, Zhao Pu, Shangwen Zhu, Ruili Feng, Jian Zhao, Yan Zhang, Hao Tang, Ling Shao

机构 * UCAS-Terminus AI Lab, University of Chinese Academy of Sciences(中国科学院大学Terminus AI实验室) Tencent(腾讯) National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Waterloo(多伦多大学) Shanghai Jiaotong University(上海交通大学) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理国家重点实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 提出SCOPE方法,通过在每个Transformer块中插入条件模块,将特征重塑为逐像素时间序列,以分离FPS游戏中局部作用域(scope)内的操作效果与全局生成,并引入跨游戏数据集CrossFPS,实现零样本迁移。

Comments Project page: https://z2tong.github.io/SCOPE/. Code is available at https://github.com/z2tong/SCOPE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29864 2026-05-29 cs.RO 50%

LLM-Guided Future Hypotheses for Horizon-Aware Exploration in Multi-Step Robot Manipulation

LLM引导的未来假设用于多步机器人操作中的视野感知探索

Mohammad Khoshnazar, Andrew Melnik, Michael Beetz

机构 * Institute of Artificial Intelligence, University of Bremen(人工智能研究所,不莱梅大学)

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 提出未来经验条件化(FEC)框架,利用LLM生成短期未来视频作为结构化先验,结合行为克隆和强化学习微调,提升多步机器人操作中的探索和策略适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频问答 1 篇

2605.29402 2026-05-29 cs.CV cs.AI 83%

Semantic and Visual Evidence for Efficient Long-Video Reasoning: A Solution for the HD-EPIC VQA Challenge

面向高效长视频推理的语义与视觉证据:HD-EPIC VQA挑战赛的解决方案

Yinsong Xu, Wei Jing, Liuxin Zhang, Wanjun Lv, Hui Li

机构 * Lenovo, China(联想(中国))

专题命中 视频问答 :video reasoning(title,abstract);video understanding(abstract);分类 cs.CV

AI总结 提出一种统一框架,通过解耦长视频推理为语义证据(粗到细提取全局过程结构)和视觉证据(基于目标的细粒度定位),并采用查询条件证据检索与整合,在HD-EPIC VQA挑战赛中取得竞争性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视频数据与评测 1 篇

2605.29643 2026-05-29 cs.CV cs.MA 79%

AgentCVR: Active Multi-Agent Cross-Video Reasoning via Script-Simulated Reinforcement Learning

AgentCVR:通过脚本模拟强化学习的主动多智能体跨视频推理

Yilun Qiu, Jiahe Wang, Cilin Yan, Jiayin Cai, Xiaolong Jiang, Yao Hu, Chun Yuan

机构 * Xiaohongshu Inc.(小红书公司) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院,清华大学)

专题命中 视频数据与评测 :video reasoning(title,abstract);分类 cs.CV

AI总结 提出AgentCVR多智能体框架,将跨视频推理视为主动证据获取任务,通过主智能体协调视觉和音频智能体进行定向证据提取,并引入脚本模拟强化学习优化策略,在跨视频对齐和定位任务上超越单次基线,达到与闭源系统相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏