arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-06-02 至 2026-06-02 共收录 18 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 18 篇

2606.02553 2026-06-02 cs.CV 89%

LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation

LongLive-RAG: 一种用于长视频生成的通用检索增强框架

Qixin Hu, Shuai Yang, Wei Huang, Song Han, Yukang Chen

机构 * NVIDIA USC(美国大学) MIT(麻省理工学院)

专题命中 视频生成 :video generation(title,abstract);long video(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出LongLive-RAG框架,通过将自回归视频生成中的历史潜变量作为可检索记忆,利用查询嵌入检索相关历史潜变量并引入窗口时间增量损失,以减轻滑动窗口注意力导致的误差累积,提升长视频生成质量。

Comments 20 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02441 2026-06-02 cs.CV 88%

Spatial-Temporal Decoupled Reference Conditioning for Identity-Preserving Text-to-Video Generation

空间-时间解耦参考条件用于身份保持的文本到视频生成

Yuheng Chen, Teng Hu, Yuji Wang, Qingdong He, Lizhuang Ma, Jiangning Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Electronic Science and Technology of China(电子科技大学) Zhejiang University(浙江大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 提出ST-DRC框架,通过空间-时间解耦参考条件、TASS-RoPE机制和身份目标,实现高保真身份保持视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02479 2026-06-02 cs.CV 86%

Retrieve What's Missing: Coverage-Maximizing Retrieval for Consistent Long Video Generation

检索缺失内容:面向一致长视频生成的覆盖最大化检索

Minseok Joo, Dogyun Park, Taehoon Lee, Kyujin Lee, Hyunwoo J. Kim

机构 * Korea University(韩国大学) KAIST(韩国科学技术院)

专题命中 视频生成 :video generation(title,abstract);long video(title);分类 cs.CV

AI总结 提出基于深度的覆盖最大化检索增强生成框架COVRAG,利用预训练3D先验构建轻量级覆盖图作为记忆证据,通过迭代检索最大化残差覆盖来提升长视频生成的几何一致性。

Comments 19 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01481 2026-06-02 cs.CV 86%

SafeGen-Bench: Benchmarking Safety in Image-Conditioned Text-to-Video Generation

SafeGen-Bench: 图像条件文本到视频生成中的安全性基准测试

Yingzi Ma, Xiaogeng Liu, Yawen Zheng, Chaowei Xiao

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Tsinghua University(清华大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title);分类 cs.CV

AI总结 针对图像条件文本到视频生成中安全文本和图像组合仍可能产生有害内容的问题,提出SafeGen-Bench基准,定义10个恶意类别并评估现有模型,发现当前模型难以避免生成恶意内容,且单模态护栏防御不足。

Comments 8 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01285 2026-06-02 cs.CV cs.AI 83%

Knowledge-Intensive Video Generation

知识密集型视频生成

Chenxu Wang, Mingda Chen

机构 * Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 针对文本到视频生成在事实性和实用性方面的不足,提出知识密集型视频生成(KIVI)任务,构建KIVI-Bench基准和自动评估指标,实验表明现有模型在视觉属性、操作过程和信息呈现上落后于人类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02214 2026-06-02 cs.CV 83%

Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation

因果强迫:自回归扩散蒸馏的正确方法,用于高质量实时交互式视频生成

Hongzhou Zhu, Min Zhao, Guande He, Hang Su, Chongxuan Li, Jun Zhu

机构 * Hongzhou Zhu(朱洪洲) Min Zhao(赵敏) Guande He(何冠德) Hang Su(苏hang) Chongxuan Li(李崇轩) Jun Zhu(朱军)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 针对双向扩散模型蒸馏为自回归模型时的架构差距问题,提出因果强迫方法,通过自回归教师进行ODE初始化并应用DMD过程,显著提升视频生成质量。

Comments Project page and the code: \href{https://thu-ml.github.io/CausalForcing.github.io/}{https://thu-ml.github.io/CausalForcing.github.io/}; https://github.com/thu-ml/Causal-Forcing. ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07061 2026-06-02 cs.SD cs.AI cs.CV cs.MM 81%

Do Joint Audio-Video Generation Models Understand Physics?

联合音视频生成模型是否理解物理?

Zijun Cui, Xiulong Liu, Hao Fang, Mingwei Xu, Jiageng Liu, Zexin Xu, Weiguo Pian, Shijian Deng, Feiyu Du, Chenming Ge, Yapeng Tian

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Washington(华盛顿大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV、cs.MM

AI总结 针对联合音视频生成模型,提出AV-Phys Bench基准测试其物理常识,发现所有模型在物理一致性上表现不足,尤其是事件驱动和环境驱动转换场景。

Comments Preprint. Project Page: https://zijuncui.com/AV-Phys/. Full abstract appears in the PDF

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30855 2026-06-02 cs.CV 79%

Robust Dreamer: Deviation-Aware Latent Gaussian Memory for Action-Controlled AR Video Generation

Robust Dreamer: 用于动作控制AR视频生成的偏差感知潜在高斯记忆

Hanlin Chen, Jiaxin Wei, Xibin Song, Yifu Wang, Steve Wang, Hongdong Li, Pan Ji, Gim Hee Lee

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) Technische Universität München(慕尼黑技术大学) Vertex Lab(Vertex实验室) Australian National University(澳大利亚国立大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出Robust Dreamer框架,通过潜在高斯记忆和动态偏差存档解决自回归视频生成中的漂移问题,实现长程3D一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15141 2026-06-02 cs.CV 79%

Causal Forcing++: Scalable Few-Step Autoregressive Diffusion Distillation for Real-Time Interactive Video Generation

Causal Forcing++:用于实时交互式视频生成的可扩展少步自回归扩散蒸馏

Min Zhao, Hongzhou Zhu, Kaiwen Zheng, Zihan Zhou, Bokai Yan, Xinyuan Li, Xiao Yang, Chongxuan Li, Jun Zhu

机构 * Tsinghua University(清华大学) ShengShu(盛数) Renmin University of China(中国人民大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出Causal Forcing++框架,通过因果一致性蒸馏(causal CD)实现帧级1-2步自回归扩散蒸馏,在降低延迟和训练成本的同时提升视频生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30895 2026-06-02 cs.CE 78%

CamGeo: Sparse Camera-Conditioned Image-to-Video Generation with 3D Geometry Priors

CamGeo: 基于稀疏相机条件的图像到视频生成与3D几何先验

Xuanyi Liu, Deyi Ji, Liqun Liu, Lanyun Zhu, Xuhang Chen, Qianxiong Xu, Peng Shu, Huan Yu, Jie Jiang, Feng Gao, Siwei Ma

专题命中 视频生成 :video generation(title,abstract)

AI总结 提出CamGeo框架,通过从预训练视频到3D模型蒸馏3D几何知识,结合关键帧轨迹蒸馏、跨帧一致性蒸馏和三阶段课程学习,解决稀疏相机条件下图像到视频生成中的姿态漂移和运动不连续问题。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11790 2026-06-02 cs.AI cs.CL 78%

Beyond End-to-End Video Models: An LLM-Based Multi-Agent System for Educational Video Generation

超越端到端视频模型:基于LLM的多智能体系统用于教育视频生成

Lingyong Yan, Jiulong Wu, Dong Xie, Weixian Shi, Deguo Xia, Jizhou Huang

机构 * Baidu Inc.(百度公司)

专题命中 视频生成 :video generation(title,abstract)

AI总结 提出LASEV,一种基于LLM的分层多智能体系统,通过将教育视频生成分解为多个专业智能体协作,解决端到端模型在逻辑严谨性和知识表示方面的不足,实现低成本、高吞吐量的自动化教学视频生产。

Comments Accepted at ACM SIGKDD 2026 (KDD '26), Applied Data Science Track. 10 pages, 2 figures, 5 tables. The project is available at \url{https://robitsg.github.io/LASEV}

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01620 2026-06-02 cs.CV 70%

Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs

基于参考引导深度压缩VAE的流式说话人肖像视频实时生成

Sicheng Xu, Yu Deng, Shoukang Hu, Yichuan Wang, Yizhong Zhang, Zhan Chen, Jiaolong Yang, Baining Guo

机构 * Microsoft Research(微软研究院) Microsoft AI(微软人工智能)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 提出一种结合因果视频VAE和自回归潜在去噪模型的流式说话人肖像视频生成框架,通过参考图像引导实现实时高质量生成。

Comments CVPR 2026 (Highlight) Camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02575 2026-06-02 cs.CV 57%

From Zero to Hero: Training-Free Custom Concept Spawning in World Models

从零到英雄:世界模型中的免训练自定义概念生成

Kiymet Akdemir, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出SPAWN方法,利用图像到视频骨干网络的结构特性,通过交换参考帧锚点与外部概念潜变量,实现无需训练即可在世界模型中生成用户指定的视觉概念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00640 2026-06-02 cs.CV 57%

An Attribute-Based Measure of Video Complexity

基于属性的视频复杂度度量

Aditya Sarkar, Yi Li, Zihao Wang, Jiacheng Cheng, Sai Vidyaranya Nuthalapati, Aashu Singh, Shlok Kumar Mishra, David Jacobs, Nuno Vasconcelos

机构 * UMIACS-University of Maryland College Park(马里兰大学College Park分校UMIACS) University of California San Diego(加州大学圣地亚哥分校) Yale University(耶鲁大学) Meta AI

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出VideoABC框架,通过属性空间量化估计视频-问题对在视频大语言模型上的失败概率,实现非参数复杂度度量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00499 2026-06-02 cs.CV 57%

OptiWorld: Optimal Control for Video World Generation under Physical Constraints

OptiWorld: 物理约束下的视频世界生成最优控制

Yu Yuan, Jianhao Yuan, Xijun Wang, Daiqing Li, Liu He, Lu Ling, Stanley H. Chan

机构 * Purdue University(普渡大学) University of Oxford(牛津大学) SixteenMiles Labs(SixteenMiles 实验室)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出OptiWorld框架,在推理时结合经典最优控制与视频生成,通过提取紧凑世界状态、规划最优轨迹并生成条件视频,实现符合物理约束的动态优化。

Comments Porject Page: https://yuyuanspace.com/OptiWorld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06453 2026-06-02 cs.CV 57%

Pinterest Canvas: Large-Scale Image Generation at Pinterest

Pinterest Canvas: Pinterest 的大规模图像生成系统

Yu Wang, Eric Tzeng, Raymond Shiau, Jie Yang, Dmitry Kislyuk, Charles Rosenberg

机构 * Pinterest, Inc.(Pinterest公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出 Pinterest Canvas,一个基于扩散模型的大规模图像生成系统,通过基础模型微调为特定任务(如背景增强和宽高比外扩)生成专用模型,并在线上实验中分别获得18.0%和12.5%的参与度提升。

Comments Accepted by KDD 2026 Applied Data Science Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18340 2026-06-02 cs.CV 57%

Beyond Rigid: Benchmarking Non-Rigid Video Editing

超越刚性:非刚性视频编辑基准测试

Bingzheng Qu, Xuefeng Bai, Kehai Chen, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳))

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 提出NRVBench诊断基准,通过物理感知评估框架揭示传统指标在非刚性视频编辑中的不足,并引入VM-Edit基线分析稳定性-可塑性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00133 2026-06-02 cs.LG cs.ET 50%

World Models: A Comprehensive Survey of Architectures, Methodologies, Reasoning Paradigms, and Applications

世界模型:架构、方法论、推理范式与应用的全面综述

Arif Hassan Zidan, Yi Pan, Hanqi Jiang, Ruiyu Yan, Wei Ruan, Zihao Wu, Lifeng Chen, Weihang You, Xinliang Li, Bowen Chen, Huawen Hu, Peilong Wang, Sizhuang Liu, Jing Zhang, Siyuan Li, Zhengliang Liu, Yu Bao, Lin Zhao, Lichao Sun, Dajiang Zhu, Xiang Li, Jinglei Lv, Quanzheng Li, Wei Liu, Tianming Liu, Wei Zhang

机构 * School of Computer and Cyber Sciences, Augusta University(奥古斯塔大学计算机与网络科学学院) School of Computing, University of Georgia(佐治亚大学计算机学院) Department of Biomedical Engineering, New Jersey Institute of Technology(新泽西理工学院生物医学工程系) Department of Radiology, Massachusetts General Hospital, Harvard Medical School(麻省总医院放射科,哈佛医学院) Department of Computer Science and Engineering, University of Texas at Arlington(德克萨斯大学阿灵顿分校计算机科学与工程系) Department of Graduate Psychology, James Madison University(詹姆斯麦迪逊大学研究生心理学系) Computer Science and Engineering, Lehigh University(莱斯大学计算机科学与工程系) School of Biomedical Engineering, The University of Sydney(悉尼大学生物医学工程学院) Tandon School of Engineering, New York University(纽约大学泰坦工程学院) Department of Radiation Oncology, City of Hope National Medical Center(城市希望国家医学中心放射肿瘤科) Department of Mayo Clinic Comprehensive Cancer Center, Mayo Clinics(梅奥诊所综合癌症中心,梅奥诊所) Savannah River Ecology Laboratory (SREL), University of Georgia(萨凡纳河生态实验室(SREL),佐治亚大学)

专题命中 视频生成 :video generation(abstract)

AI总结 本文提出一个多轴分类法,从架构、方法论、推理策略和应用领域四个维度系统综述世界模型,涵盖从早期认知科学基础到PlaNet、Dreamer系列、MuZero、Sora等里程碑系统,并指出未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏