arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1299 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1299 篇

2510.07654 2025-10-10 cs.CV 57%

Once Is Enough: Lightweight DiT-Based Video Virtual Try-On via One-Time Garment Appearance Injection

Yanjie Pan, Qingdong He, Lidong Wang, Bo Peng, Mingmin Chi

机构 * School of computer science, Shanghai key laboratory of data science, Fudan University, China(计算机学院、数据科学重点实验室、复旦大学) Tencent Youtu Lab, China(腾讯优图实验室) Shanghai Ocean University, China(上海海洋大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 5 pages (including references), 4 figures. Code and models will be released upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15742 2025-10-10 cs.CV 57%

Uncertainty-Aware Diffusion Guided Refinement of 3D Scenes

Sarosij Bose, Arindam Dutta, Sayak Nag, Junge Zhang, Jiachen Li, Konstantinos Karydis, Amit K. Roy Chowdhury

机构 * University of California, Riverside, USA(加州大学河滨分校)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07344 2025-10-09 cs.CV cs.AI 57%

Generative Pre-trained Autoregressive Diffusion Transformer

Yuan Zhang, Jiacheng Jiang, Guoqing Ma, Zhiying Lu, Haoyang Huang, Jianlong Yuan, Nan Duan, Daxin Jiang

机构 * University of Science and Technology of China(中国科学技术大学) StepFun, China(StepFun)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24210 2025-10-02 cs.CV cs.NA math.NA 57%

STORK: Faster Diffusion And Flow Matching Sampling By Resolving Both Stiffness And Structure-Dependence

Zheng Tan, Weizhen Wang, Andrea L. Bertozzi, Ernest K. Ryu

机构 * Department of Mathematics, University of California, Los Angeles(数学系,加州大学洛杉矶分校) Department of Computer Science, University of California, Los Angeles(计算机科学系,加州大学洛杉矶分校)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24416 2025-09-30 cs.CV cs.AI 57%

CLQ: Cross-Layer Guided Orthogonal-based Quantization for Diffusion Transformers

Kai Liu, Shaoqiu Zhang, Linghe Kong, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 10 pages, 5 figures. Code is released at https://github.com/Kai-Liu001/CLQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06040 2025-09-30 cs.CV cs.AI cs.LG 57%

BranchGRPO: Stable and Efficient GRPO with Structured Branching in Diffusion Models

Yuming Li, Yikai Wang, Yuying Zhu, Zhongyu Zhao, Ming Lu, Qi She, Shanghang Zhang

机构 * Peking University(北京大学) Beijing Normal University(北京师范大学) ByteDance(字节跳动)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19838 2025-09-30 cs.CV 57%

SimpleGVR: A Simple Baseline for Latent-Cascaded Video Super-Resolution

Liangbin Xie, Yu Li, Shian Du, Menghan Xia, Xintao Wang, Fanghua Yu, Ziyan Chen, Pengfei Wan, Jiantao Zhou, Chao Dong

机构 * State Key Laboratory of Internet of Things for Smart City, University of Macau(澳门大学物联网智能城市国家重点实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) Tsinghua University(清华大学) Kuaishou Technology(快手科技) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12053 2025-09-30 cs.CV cs.AI 57%

VFRTok: Variable Frame Rates Video Tokenizer with Duration-Proportional Information Assumption

Tianxiong Zhong, Xingye Tian, Boyuan Jiang, Xuebo Wang, Xin Tao, Pengfei Wan, Zhiwei Zhang

机构 * Beijing Institute of Technology(北京理工大学) Kling Team(Kling团队)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00639 2025-09-30 cs.CV cs.AI cs.LG stat.ML 57%

Half-order Fine-Tuning for Diffusion Model: A Recursive Likelihood Ratio Optimizer

Tao Ren, Zishi Zhang, Jingyang Jiang, Zehao Li, Shentao Qin, Yi Zheng, Guanghao Li, Qianyou Sun, Yan Li, Jiafeng Liang, Xinping Li, Yijie Peng

机构 * Peking University(北京大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.00796 2025-09-30 cs.LG cs.AI cs.CV 57%

Diffusion Models: A Comprehensive Survey of Methods and Applications

Ling Yang, Zhilong Zhang, Yang Song, Shenda Hong, Runsheng Xu, Yue Zhao, Wentao Zhang, Bin Cui, Ming-Hsuan Yang

机构 * Peking University(北京大学) OpenAI University of California, Los Angeles(加州大学洛杉矶分校) Carnegie Mellon University(卡内基梅隆大学) University of California at Merced(加州大学默塞德分校)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 59 pages, 19 figures, citing 396 (up-to-date) papers, project: https://github.com/YangLing0818/Diffusion-Models-Papers-Survey-Taxonomy, accepted by ACM Computing Surveys

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06028 2025-09-24 cs.CV 57%

SparseDiT: Token Sparsification for Efficient Diffusion Transformer

Shuning Chang, Pichao Wang, Jiasheng Tang, Fan Wang, Yi Yang

机构 * Zhejiang University(浙江大学) Damo Academy, Alibaba Group(阿里达摩院) Hupan Lab(虎斑实验室)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01799 2025-09-17 cs.CV 57%

WorldExplorer: Towards Generating Fully Navigable 3D Scenes

Manuel-Andreas Schneider, Lukas Höllein, Matthias Nießner

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted to SIGGRAPH Asia 2025. Project page: see https://mschneider456.github.io/world-explorer, video: see https://youtu.be/N6NJsNyiv6I, code: https://github.com/mschneider456/WorldExplorer

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21070 2025-08-29 cs.CV cs.LG 57%

Dress&Dance: Dress up and Dance as You Like It - Technical Preview

Jun-Kun Chen, Aayush Bansal, Minh Phuoc Vo, Yu-Xiong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) SpreeAI

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project Page: https://immortalco.github.io/DressAndDance/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19852 2025-08-29 cs.CV 57%

Ego-centric Predictive Model Conditioned on Hand Trajectories

Binjie Zhang, Mike Zheng Shou

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Code: github.com/showlab/Ego-PM

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19204 2025-08-27 cs.CV cs.AI cs.GR 57%

LSD-3D: Large-Scale 3D Driving Scene Generation with Geometry Grounding

Julian Ost, Andrea Ramazzina, Amogh Joshi, Maximilian Bömer, Mario Bijelic, Felix Heide

机构 * Julian Ost(未知) Andrea Ramazzina(未知) Amogh Joshi(未知) Maximilian Bömer(未知) Mario Bijelic(未知) Felix Heide(未知)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project webpage: https://light.princeton.edu/LSD-3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16930 2025-08-26 eess.AS cs.CV cs.SD 57%

HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation

Sizhe Shan, Qiulin Li, Yutao Cui, Miles Yang, Yuehai Wang, Qun Yang, Jin Zhou, Zhao Zhong

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16212 2025-08-26 cs.CV cs.AI cs.LG 57%

OmniCache: A Trajectory-Oriented Global Perspective on Training-Free Cache Reuse for Diffusion Transformer Models

Huanpeng Chu, Wei Wu, Guanyu Fen, Yutao Zhang

机构 * Zhipu AI(智谱AI)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16211 2025-08-25 cs.CV 57%

Forecast then Calibrate: Feature Caching as ODE for Efficient Diffusion Transformers

Shikang Zheng, Liang Feng, Xinyu Wang, Qinming Zhou, Peiliang Cai, Chang Zou, Jiacheng Liu, Yuqi Lin, Junjie Chen, Yue Ma, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) South China University of Technology(华南理工大学) Fudan University(复旦大学) Tsinghua University(清华大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08170 2025-08-22 cs.CV 57%

ReconDreamer-RL: Enhancing Reinforcement Learning via Diffusion-based Scene Reconstruction

Chaojun Ni, Guosheng Zhao, Xiaofeng Wang, Zheng Zhu, Wenkang Qin, Xinze Chen, Guanghong Jia, Guan Huang, Wenjun Mei

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14811 2025-08-21 cs.CV 57%

Tinker: Diffusion's Gift to 3D--Multi-View Consistent Editing From Sparse Inputs without Per-Scene Optimization

Canyu Zhao, Xiaoman Li, Tianjian Feng, Zhiyue Zhao, Hao Chen, Chunhua Shen

机构 * Zhejiang University(浙江大学) Zhejiang University of Technology(浙江工业大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project webpage: https://aim-uofa.github.io/Tinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13300 2025-08-20 cs.CV cs.AI 57%

GaitCrafter: Diffusion Model for Biometric Preserving Gait Synthesis

Sirshapan Mitra, Yogesh S. Rawat

机构 * CRCV, University of Central Florida(CRCV,中央佛罗里达大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13154 2025-08-19 cs.CV 57%

4DNeX: Feed-Forward 4D Generative Modeling Made Easy

Zhaoxi Chen, Tianqi Liu, Long Zhuo, Jiawei Ren, Zeng Tao, He Zhu, Fangzhou Hong, Liang Pan, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project Page: https://4dnex.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10905 2025-08-19 cs.CV cs.HC 57%

InterAnimate: Taming Region-aware Diffusion Model for Realistic Human Interaction Animation

Yukang Lin, Yan Hong, Zunnan Xu, Xindi Li, Chao Xu, Chuanbiao Song, Ronghui Li, Haoxing Chen, Jun Lan, Huijia Zhu, Weiqiang Wang, Jianfu Zhang, Xiu Li

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Accept to ACMMM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07905 2025-08-12 cs.CV 57%

Generative Video Matting

Yongtao Ge, Kangyang Xie, Guangkai Xu, Mingyu Liu, Li Ke, Longtao Huang, Hui Xue, Hao Chen, Chunhua Shen

机构 * The University of Adelaide(阿德莱德大学) Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Zhejiang University of Technology(浙江工业大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Journal ref SIGGRAPH Conference Papers 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07603 2025-08-12 cs.CV 57%

LaVieID: Local Autoregressive Diffusion Transformers for Identity-Preserving Video Creation

Wenhui Song, Hanhui Li, Jiehui Huang, Panwen Hu, Yuhao Cheng, Long Chen, Yiqiang Yan, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Hong Kong University of Science and Technology(香港科学与技术大学) Mohamed bin Zayed University of Artificial Intelligence(马尔代夫 bin Zayed 人工智能大学) Lenovo Research(联想研究)

专题命中 视频扩散模型 :text-to-video(abstract);分类 cs.CV

Comments Accepted to ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07557 2025-08-12 cs.CV 57%

Splat4D: Diffusion-Enhanced 4D Gaussian Splatting for Temporally and Spatially Consistent Content Creation

Minghao Yin, Yukang Cao, Songyou Peng, Kai Han

机构 * The University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学) Google DeepMind(谷歌DeepMind)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07246 2025-08-12 cs.CV 57%

Consistent and Controllable Image Animation with Motion Linear Diffusion Transformers

Xin Ma, Yaohui Wang, Genyun Jia, Xinyuan Chen, Tien-Tsin Wong, Cunjian Chen

机构 * Department of Data Science & AI, Faculty of Information Technology, Monash University(数据科学与人工智能系,信息科技学院,墨尔本大学) Nanjing University of Posts and Telecommunications(南京邮电大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视频扩散模型 :text-to-video(abstract);分类 cs.CV

Comments Project Page: https://maxin-cn.github.io/miramo_project

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21205 2025-08-12 cs.CV 57%

EF-VI: Enhancing End-Frame Injection for Video Inbetweening

Liuhan Chen, Xiaodong Cun, Xiaoyu Li, Xianyi He, Shenghai Yuan, Jie Chen, Ying Shan, Li Yuan

机构 * Shenzhen Graduate School, Peking University(北京大学深圳研究生院) GVC Lab, Great Bay University(大湾大学GVC实验室) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) Rabbitpre Intelligence(Rabbitpre智能)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06014 2025-08-11 cs.CV 57%

ExploreGS: Explorable 3D Scene Reconstruction with Virtual Camera Samplings and Diffusion Priors

Minsu Kim, Subin Jeon, In Cho, Mijin Yoo, Seon Joo Kim

机构 * Yonsei University(延世大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments 10 pages, 6 Figures, ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01603 2025-08-08 cs.CV 57%

DepthSync: Diffusion Guidance-Based Depth Synchronization for Scale- and Geometry-Consistent Video Depth Estimation

Yue-Jiang Dong, Wang Zhao, Jiale Xu, Ying Shan, Song-Hai Zhang

机构 * Tsinghua University(清华大学) ARC Lab, Tencent PCG(腾讯PCG实验室)

专题命中 视频扩散模型 :long video(abstract);分类 cs.CV

Comments Accepted by ICCV 2025; Project Homepage: https://yuejiangdong.github.io/depthsync

详情

展开后加载摘要…

URL PDF HTML 收藏