arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-03-31 至 2026-03-31 共收录 7 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 7 篇

2505.21545 2026-03-31 cs.CV cs.LG 92%

Corruption-Aware Training of Latent Video Diffusion Models for Robust Text-to-Video Generation

面向鲁棒文本到视频生成的潜变量视频扩散模型腐蚀感知训练

Chika Maduabuchi, Hao Chen, Yujin Han, Jindong Wang

机构 * William & Mary(威廉与玛丽学院) Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学)

专题命中 视频扩散模型 :video generation(title,abstract);video diffusion(title,abstract);text-to-video(title);video understanding(abstract)

AI总结 本文提出CAT-LVDM框架,通过结构化噪声注入提升视频扩散模型的鲁棒性,实验显示其在多个数据集上优于传统方法,且能扩展至自回归生成和多模态视频理解模型。

Comments ICLR 2026 ReALM-GEN

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07775 2026-03-31 cs.CV 79%

Rolling Sink: Bridging Limited-Horizon Training and Open-Ended Testing in Autoregressive Video Diffusion

滚动汇:在有限时间训练和开放-ended测试之间架桥

Haodong Li, Shaoteng Liu, Zhe Lin, Manmohan Chandraker

机构 * UC San Diego(加州大学圣地亚哥分校) Adobe Research(Adobe研究院)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Rolling Sink,通过分析AR缓存维护,实现无需训练的超长视频生成,提升视觉质量和时间一致性。

Comments v5: Fix some typos. Figures were compressed to 150 dpi to comply with arXiv's submission size limit. Project page: https://rolling-sink.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27593 2026-03-31 cs.CV cs.AI 74%

STRIDE: When to Speak Meets Sequence Denoising for Streaming Video Understanding

STRIDE:当语音识别与序列去噪相结合用于流媒体视频理解

Junho Kim, Hosu Lee, James M. Rehg, Minsu Kim, Yong Man Ro

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) KAIST(韩国科学技术院) Google DeepMind(谷歌DeepMind)

专题命中 视频扩散模型 :video understanding(title);分类 cs.CV

AI总结 本文提出STRIDE方法,通过结构化序列建模解决流媒体视频中的主动激活问题,提升在线流媒体场景下的'何时说话'决策质量。

Comments Project page: https://interlive-team.github.io/STRIDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05138 2026-03-31 cs.CV 70%

VerseCrafter: Dynamic Realistic Video World Model with 4D Geometric Control

VerseCrafter:基于4D几何控制的动态真实视频世界模型

Sixiao Zheng, Minghao Yin, Wenbo Hu, Xiaoyu Li, Ying Shan, Yanwei Fu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) HKU(香港大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出VerseCrafter,通过4D几何控制生成动态真实视频,相比传统方法更精确控制相机和多物体运动。

Comments Project Page: https://sixiaozheng.github.io/VerseCrafter_page/, Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27086 2026-03-31 cs.CV 70%

EFlow: Fast Few-Step Video Generator Training from Scratch via Efficient Solution Flow

EFlow:通过高效解流实现从零开始的快速少步视频生成训练

Dogyun Park, Yanyu Li, Sergey Tulyakov, Anil Kag

机构 * Snap Inc.(Snap公司) Korea University(高丽大学)

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出EFlow框架,通过高效解流目标和改进的训练方法,减少采样步骤和计算成本,实现更高的训练吞吐量和更低的推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27209 2026-03-31 cs.CV cs.CL cs.GR cs.LG 57%

LightMover: Generative Light Movement with Color and Intensity Controls

LightMover:具有颜色和强度控制的生成式光移动

Gengze Zhou, Tianyu Wang, Soo Ye Kim, Zhixin Shu, Xin Yu, Yannick Hold-Geoffroy, Sumit Chaturvedi, Qi Wu, Zhe Lin, Scott Cohen

机构 * AIML, Adelaide University(阿德莱德大学机器学习研究所) Adobe Research(Adobe研究院) University of Hong Kong(香港大学) Yale University(耶鲁大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 LightMover通过视频扩散先验生成单图像中可控的光照变化,统一处理空间和外观控制,提升操控与光照理解,并引入自适应令牌修剪机制,减少控制序列长度41%同时保持编辑保真度。

Comments CVPR 2026. 10 pages, 5 figures, 6 tables in main paper; supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22065 2026-03-31 cs.CV cs.AI cs.HC 57%

StreamAvatar: Streaming Diffusion Models for Real-Time Interactive Human Avatars

StreamAvatar:用于实时交互人类分身的流式扩散模型

Zhiyao Sun, Ziqiao Peng, Yifeng Ma, Yi Chen, Zhengguang Zhou, Zixiang Zhou, Guozhen Zhang, Youliang Zhang, Yuan Zhou, Qinglin Lu, Yong-Jin Liu

机构 * Tsinghua University(清华大学) Renmin University of China(中国人民大学) Tencent Hunyuan(腾讯混元) Nanjing University(南京大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出一种两阶段自回归适应与加速框架,通过自回归蒸馏和对抗性细化,使高保真人类视频扩散模型适用于实时交互流式生成,实现自然对话与倾听行为。

Comments Accepted by CVPR 2026. Project page: https://streamavatar.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏