arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6781 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1305 篇

2601.16214 2026-01-23 cs.CV 79%

CamPilot: Improving Camera Control in Video Diffusion Model with Efficient Camera Reward Feedback

CamPilot: 通过高效的相机奖励反馈提升视频扩散模型的相机控制

Wenhang Ge, Guibao Shen, Jiawei Feng, Luozhou Wang, Hao Lu, Xingye Tian, Xin Tao, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 CamPilot通过高效的3D解码器和奖励机制提升视频扩散模型的相机控制能力

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23171 2026-01-07 cs.CV 79%

RoboTransfer: Controllable Geometry-Consistent Video Diffusion for Manipulation Policy Transfer

RoboTransfer: 可控的几何一致视频扩散用于操控策略迁移

Liu Liu, Xiaofeng Wang, Guosheng Zhao, Keyu Li, Wenkang Qin, Jiagang Zhu, Jiaxiong Qiu, Zheng Zhu, Guan Huang, Zhizhong Su

机构 * Horizon Robotics GigaAI CASIA

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 RoboTransfer通过可控的几何一致视频扩散技术,提升机器人操控策略在真实环境中的泛化能力。

Comments 20 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01085 2026-01-01 cs.CV 79%

Bidirectional Sparse Attention for Faster Video Diffusion Training

双向稀疏注意力用于更快的视频扩散训练

Chenlu Zhan, Wen Li, Chuyu Shen, Jun Zhang, Suhui Wu, Hao Zhang

机构 * ByteDance(字节跳动)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 本文提出双向稀疏注意力框架,通过动态稀疏化查询和键值对,显著提升视频扩散模型的训练效率,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23705 2025-12-30 cs.CV 79%

Diffusion Knows Transparency: Repurposing Video Diffusion for Transparent Object Depth and Normal Estimation

扩散知道透明:将视频扩散用于透明物体深度和法线估计

Shaocong Xu, Songlin Wei, Qizhe Wei, Zheng Geng, Hong Li, Licheng Shen, Qianpu Sun, Shu Han, Bin Ma, Bohan Li, Chongjie Ye, Yuhang Zheng, Nan Wang, Saining Zhang, Hao Zhao

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) University of Southern California(南加州大学) Tsinghua University(清华大学) Beihang University(北航) Wuhan University(武汉大学) Shanghai Jiao Tong University(上海交通大学) European Institute of Innovation and Technology Ningbo(创新与技术欧洲研究所宁波) FNii, The Chinese University of Hong Kong, Shenzhen(FNii,香港中文大学(深圳)) National University of Singapore(新加坡国立大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 本文提出DKT模型,利用视频扩散模型估计透明物体的深度和法线,实现零样本SOTA,提升现实和合成视频中的透明感知性能。

Comments Project Page: https://daniellli.github.io/projects/DKT/; Code: https://github.com/Daniellli/DKT; Dataset: https://huggingface.co/datasets/Daniellesry/TransPhy3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21734 2025-12-30 cs.CV 79%

Knot Forcing: Taming Autoregressive Video Diffusion Models for Real-time Infinite Interactive Portrait Animation

结绳强制:驯服自回归视频扩散模型以实现实时无限交互肖像动画

Steven Xiao, Xindi Zhang, Dechao Meng, Qi Wang, Peng Zhang, Bang Zhang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里集团)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 Knot Forcing通过分块生成、时间结模块和提前运行机制,解决实时肖像动画中的时间一致性、误差累积和长期一致性问题,实现高保真、低延迟的无限交互动画。

Comments Project Page: https://humanaigc.github.io/knot_forcing_demo_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19823 2025-12-30 cs.CV 79%

Learning to Refocus with Video Diffusion Models

利用视频扩散模型学习重聚焦

SaiKiran Tedla, Zhoutong Zhang, Xuaner Zhang, Shumian Xin

机构 * Adobe, USA \& York University Canada Adobe USA Adobe, USA \& York University Adobe

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 本文提出利用视频扩散模型实现拍摄后重聚焦,生成感知准确的焦点堆栈,提升日常摄影的聚焦编辑能力。

Comments Code and data are available at https://learn2refocus.github.io . SIGGRAPH Asia 2025, Dec. 2025

Journal ref Proceedings of the SIGGRAPH Asia 2025, pp. 1-11, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12898 2025-12-23 cs.LG cs.AI cs.CV cs.RO 79%

Vidar: Embodied Video Diffusion Model for Generalist Manipulation

Vidar:面向通用操作的具身视频扩散模型

Yao Feng, Hengkai Tan, Xinyi Mao, Chendong Xiang, Guodong Liu, Shuhe Huang, Hang Su, Jun Zhu

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 Vidar通过具身视频扩散模型和掩码逆动力学模型,实现了在不同机器人形态上的通用操作,仅需少量人类演示即可超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16093 2025-12-19 cs.CV cs.AI cs.LG 79%

TurboDiffusion: Accelerating Video Diffusion Models by 100-200 Times

TurboDiffusion:通过100-200倍加速视频扩散模型

Jintao Zhang, Kaiwen Zheng, Kai Jiang, Haoxu Wang, Ion Stoica, Joseph E. Gonzalez, Jianfei Chen, Jun Zhu

机构 * Tsinghua University(清华大学) Shengshu Technology(盛舒科技) UC Berkeley(加州大学伯克利分校)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 TurboDiffusion通过低比特注意力、步骤蒸馏和W8A8量化等技术,实现视频扩散模型100-200倍加速并保持视频质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12375 2025-12-16 cs.CV 79%

V-Warper: Appearance-Consistent Video Diffusion Personalization via Value Warping

V-Warper:通过价值扭曲实现外观一致的视频扩散个性化

Hyunkoo Lee, Wooseok Jang, Jini Yang, Taehwan Kim, Sangoh Kim, Sangwon Jung, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Korea University(韩国大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 V-Warper通过价值扭曲实现视频扩散模型的无训练粗到细个性化,提升外观一致性与生成质量。

Comments Project Page: https://cvlab-kaist.github.io/V-Warper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11203 2025-12-16 cs.CV 79%

AutoRefiner: Improving Autoregressive Video Diffusion Models via Reflective Refinement Over the Stochastic Sampling Path

AutoRefiner: 通过在随机采样路径上的反思细化改进自回归视频扩散模型

Zhengyang Yu, Akio Hayakawa, Masato Ishii, Qingtao Yu, Takashi Shibuya, Jing Zhang, Yuki Mitsufuji

机构 * Australian National University(澳大利亚国立大学) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 AutoRefiner通过路径噪声细化和反射式KV缓存改进AR-VDMs的样本保真度

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12080 2025-12-16 cs.CV cs.LG 79%

BAgger: Backwards Aggregation for Mitigating Drift in Autoregressive Video Diffusion Models

BAgger: 逆向聚合用于缓解自回归视频扩散模型中的漂移

Ryan Po, Eric Ryan Chan, Changan Chen, Gordon Wetzstein

机构 * Stanford University(斯坦福大学)

专题命中 视频扩散模型 :video diffusion(title);text-to-video(abstract);分类 cs.CV

AI总结 BAgger通过自监督方法缓解自回归视频扩散模型中的漂移问题,利用标准分数或流匹配目标提升长期运动稳定性与视觉一致性。

Comments Project page here: https://ryanpo.com/bagger

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02339 2025-12-03 cs.CV cs.AI 79%

Video Diffusion Models Excel at Tracking Similar-Looking Objects Without Supervision

视频扩散模型在无监督情况下能有效追踪相似外观的对象

Chenshuang Zhang, Kang Zhang, Joon Son Chung, In So Kweon, Junmo Kim, Chengzhi Mao

机构 * KAIST(韩国科学技术院) Rutgers University(罗格斯大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 本文提出利用预训练视频扩散模型的运动表示能力,实现无监督环境下对视觉相似对象的高效追踪,提升了追踪性能并克服了现有方法的局限。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23127 2025-12-02 cs.CV 79%

DualCamCtrl: Dual-Branch Diffusion Model for Geometry-Aware Camera-Controlled Video Generation

DualCamCtrl: 基于双分支扩散模型的几何感知摄像机控制视频生成

Hongfei Zhang, Kanghao Chen, Zixin Zhang, Harold Haodong Chen, Yuanhuiyi Lyu, Yuqi Zhang, Shuai Yang, Kun Zhou, Yingcong Chen

机构 * HKUST (GZ)(香港科技大学) HKUST(香港科技大学) Fudan University(复旦大学) Shenzhen University(深圳大学)

专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV

AI总结 DualCamCtrl通过双分支扩散模型实现几何感知的摄像机控制视频生成,有效提升视频生成的一致性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19229 2025-12-01 cs.CV cs.AI 79%

Learning Plug-and-play Memory for Guiding Video Diffusion Models

学习插件式记忆以指导视频扩散模型

Selena Song, Ziming Xu, Zijun Zhang, Kun Zhou, Jiaxian Guo, Lianhui Qin, Biwei Huang

机构 * University of California, San Diego(加州大学圣地亚哥分校) The University of Tokyo(东京大学)

专题命中 视频扩散模型 :video diffusion(title);video generation(abstract);分类 cs.CV

AI总结 本文提出DiT-Mem,通过学习插件式记忆增强视频扩散模型的物理规则遵循和视频保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17481 2025-11-24 cs.CV 79%

Counterfactual World Models via Digital Twin-conditioned Video Diffusion

通过数字孪生条件的视频扩散实现反事实世界模型

Yiqing Shen, Aiza Maksutova, Chenjia Li, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 CWMDT通过构建数字孪生和应用大语言模型,实现反事实世界模型,提升对视频正向模拟的控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01406 2025-11-21 cs.CV cs.CR cs.LG 79%

VIDSTAMP: A Temporally-Aware Watermark for Ownership and Integrity in Video Diffusion Models

VIDSTAMP:一种时间感知的水印用于视频扩散模型中的所有权和完整性

Mohammadreza Teymoorianfard, Siddarth Sitaraman, Shiqing Ma, Amir Houmansadr

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Brown University(布朗大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

AI总结 VidStamp通过帧级信息嵌入和动态控制信号实现高容量、低感知影响的视频水印,提升视频扩散模型的版权和完整性保障能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12072 2025-11-18 cs.MM cs.AI cs.SD 79%

ProAV-DiT: A Projected Latent Diffusion Transformer for Efficient Synchronized Audio-Video Generation

Jiahui Sun, Weining Wang, Mingzhen Sun, Yirong Yang, Xinxin Zhu, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beihang University(北航大学)

专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12056 2025-11-18 cs.CV cs.AI cs.DC 79%

PipeDiT: Accelerating Diffusion Transformers in Video Generation with Task Pipelining and Model Decoupling

Sijie Wang, Qiang Wang, Shaohuai Shi

机构 * Sijie Wang, Qiang Wang, Shaohuai Shi(作者)

专题命中 视频扩散模型 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11343 2025-11-14 cs.CV stat.AP 79%

Latent Knowledge-Guided Video Diffusion for Scientific Phenomena Generation from a Single Initial Frame

Qinglong Cao, Xirui Li, Ding Wang, Chao Ma, Yuntian Chen, Xiaokang Yang

机构 * Eitech(艾tech)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13389 2025-10-29 cs.CV 79%

VSA: Faster Video Diffusion with Trainable Sparse Attention

Peiyuan Zhang, Yongqi Chen, Haofeng Huang, Will Lin, Zhengzhong Liu, Ion Stoica, Eric Xing, Hao Zhang

机构 * UC San Diego(UC圣迭戈大学) MBZUAI(穆桑大学人工智能研究所) UC Berkeley(伯克利大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments Accepted by Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18033 2025-10-17 cs.CV 79%

OmnimatteZero: Fast Training-free Omnimatte with Pre-trained Video Diffusion Models

Dvir Samuel, Matan Levy, Nir Darshan, Gal Chechik, Rami Ben-Ari

机构 * Bar-Ilan University \& OriginAI Israel The Hebrew University of Jerusalem Israel Bar-Ilan University \& NVIDIA Research Israel Bar-Ilan University \& OriginAI The Hebrew University of Jerusalem Bar-Ilan University \& NVIDIA Research

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments Accepted to SIGGRAPH ASIA 2025. Project Page: https://dvirsamuel.github.io/omnimattezero.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21593 2025-10-13 cs.CV cs.AI 79%

Any-to-Bokeh: Arbitrary-Subject Video Refocusing with Video Diffusion Model

Yang Yang, Siming Zheng, Qirui Yang, Jinwei Chen, Boxi Wu, Xiaofei He, Deng Cai, Bo Li, Peng-Tao Jiang

机构 * Zhejiang University(浙江大学) vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments project page: https://vivocameraresearch.github.io/any2bokeh/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02851 2025-10-13 cs.CV cs.GR 79%

Human-VDM: Learning Single-Image 3D Human Gaussian Splatting from Video Diffusion Models

Zhibin Liu, Haoye Dong, Aviral Chharia, Hefeng Wu

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments 14 Pages, 8 figures, Project page: https://human-vdm.github.io/Human-VDM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13934 2025-10-07 cs.CV 79%

DiViD: Disentangled Video Diffusion for Static-Dynamic Factorization

Marzieh Gheisari, Auguste Genovesio

机构 * École Normale Supérieure PSL(巴黎高等师范学院)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01669 2025-10-06 cs.CV 79%

UniVerse: Unleashing the Scene Prior of Video Diffusion Models for Robust Radiance Field Reconstruction

Jin Cao, Hongrui Wu, Ziyong Feng, Hujun Bao, Xiaowei Zhou, Sida Peng

机构 * State Key Lab of CAD&CG, Zhejiang University(CAD与CG国家重点实验室,浙江大学) Tongji University(同济大学) DeepGlint

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments page: https://jin-cao-tma.github.io/UniVerse.github.io/ code: https://github.com/zju3dv/UniVerse

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23769 2025-10-02 cs.GR cs.AI cs.CV 79%

ReLumix: Extending Image Relighting to Video via Video Diffusion Models

Lezhong Wang, Shutong Jin, Ruiqi Cui, Anders Bjorholm Dahl, Jeppe Revall Frisvad, Siavash Bigdeli

机构 * Technical University of Denmark(丹麦技术大学) KTH Royal Institute of Technology(皇家理工学院)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments Project page: https://lez-s.github.io/Relumix_project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19296 2025-09-24 cs.CV cs.GR 79%

Lyra: Generative 3D Scene Reconstruction via Video Diffusion Model Self-Distillation

Sherwin Bahmani, Tianchang Shen, Jiawei Ren, Jiahui Huang, Yifeng Jiang, Haithem Turki, Andrea Tagliasacchi, David B. Lindell, Zan Gojcic, Sanja Fidler, Huan Ling, Jun Gao, Xuanchi Ren

机构 * NVIDIA University of Toronto(多伦多大学) Vector Institute(向量研究所) Simon Fraser University(西蒙弗雷泽大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments Project Page: https://research.nvidia.com/labs/toronto-ai/lyra/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03680 2025-09-05 cs.GR cs.AI cs.CV 79%

LuxDiT: Lighting Estimation with Video Diffusion Transformer

Ruofan Liang, Kai He, Zan Gojcic, Igor Gilitschenski, Sanja Fidler, Nandita Vijaykumar, Zian Wang

机构 * NVIDIA University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments Project page: https://research.nvidia.com/labs/toronto-ai/LuxDiT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00843 2025-09-03 cs.CV cs.AI 79%

Look Beyond: Two-Stage Scene View Generation via Panorama and Video Diffusion

Xueyang Kang, Zhengkang Xiang, Zezheng Zhang, Kourosh Khoshelham

机构 * University of Melbourne(墨尔本大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments 26 pages, 30 figures, 2025 ACM Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13188 2025-08-27 cs.CV 79%

StreetCrafter: Street View Synthesis with Controllable Video Diffusion Models

Yunzhi Yan, Zhen Xu, Haotong Lin, Haian Jin, Haoyu Guo, Yida Wang, Kun Zhan, Xianpeng Lang, Hujun Bao, Xiaowei Zhou, Sida Peng

机构 * Zhejiang University(浙江大学) Li Auto Inc.(Li汽车公司) Cornell University(康奈尔大学)

专题命中 视频扩散模型 :video diffusion(title,abstract);分类 cs.CV

Comments Project page: https://zju3dv.github.io/street_crafter

详情

展开后加载摘要…

URL PDF HTML 收藏