arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6781 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1305 篇

2507.15260 2025-07-22 cs.LG 50%

CHORDS: Diffusion Sampling Accelerator with Multi-core Hierarchical ODE Solvers

Jiaqi Han, Haotian Ye, Puheng Li, Minkai Xu, James Zou, Stefano Ermon

机构 * Stanford University(斯坦福大学)

专题命中 视频扩散模型 :video diffusion(abstract)

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08438 2025-07-15 cs.RO stat.ML 50%

Diffusion Models for Robotic Manipulation: A Survey

Rosa Wolf, Yitian Shi, Sheng Liu, Rania Rayyes

机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院)

专题命中 视频扩散模型 :video generation(abstract)

Comments 26 pages, 2 figure, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07050 2025-07-10 cs.CL cs.LG stat.ML 50%

Discrete Diffusion Models for Language Generation

Ashen Weligalle

机构 * Department of Computer and Information Science(计算机与信息科学系)

专题命中 视频扩散模型 :video generation(abstract)

Comments pdfLaTeX, 69 pages with 21 figures, Licentiate Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01309 2025-07-03 cs.AR 50%

SD-Acc: Accelerating Stable Diffusion through Phase-aware Sampling and Hardware Co-Optimizations

Zhican Wang, Guanghui He, Hongxiang Fan

专题命中 视频扩散模型 :video generation(abstract)

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17301 2025-07-03 cs.GR 50%

FramePrompt: In-context Controllable Animation with Zero Structural Changes

Guian Fang, Yuchao Gu, Mike Zheng Shou

专题命中 视频扩散模型 :video diffusion(abstract)

Comments Project page: https://frameprompt.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21478 2025-06-27 cs.SD cs.AI 50%

SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture

Kehan Sui, Jinxu Xiang, Fang Jin

机构 * George Washington University(乔治华盛顿大学)

专题命中 视频扩散模型 :video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13497 2025-06-17 cs.DC 50%

DDiT: Dynamic Resource Allocation for Diffusion Transformer Model Serving

Heyang Huang, Cunchen Hu, Jiaqi Zhu, Ziyuan Gao, Liangliang Xu, Yizhou Shan, Yungang Bao, Sun Ninghui, Tianwei Zhang, Sa Wang

专题命中 视频扩散模型 :text-to-video(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03099 2025-06-04 cs.SD cs.AI cs.GR 50%

TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models

Chetwin Low, Weimin Wang

机构 * Character AI

专题命中 视频扩散模型 :video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10510 2025-05-23 cs.LG 50%

SmoothCache: A Universal Inference Acceleration Technique for Diffusion Transformers

Joseph Liu, Joshua Geddes, Ziyu Guo, Haomiao Jiang, Mahesh Kumar Nandwana

机构 * Roblox(Roblox公司) Queen’s University(女王大学)

专题命中 视频扩散模型 :text-to-video(abstract)

Comments Code can be found at https://github.com/Roblox/SmoothCache. Accepted at CVPR eLVM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09286 2025-05-22 cs.RO cs.AI cs.LG 50%

Learning Novel Skills from Language-Generated Demonstrations

Ao-Qun Jin, Tian-Yu Xiang, Xiao-Hu Zhou, Mei-Jiang Gui, Xiao-Liang Xie, Shi-Qi Liu, Shuang-Yi Wang, Yue Cao, Sheng-Bin Duan, Fu-Chao Xie, Zeng-Guang Hou

机构 * Institute of Automation Chinese Academy of Sciences(自动化研究所,中国科学院)

专题命中 视频扩散模型 :video diffusion(abstract)

Comments 10 pages, International Conference on Learning Representations (ICLR) 2025 Workshop on Generative Models for Robot Learning (GenBot)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21314 2025-05-01 cs.LG stat.ML 50%

Capturing Conditional Dependence via Auto-regressive Diffusion Models

Xunpeng Huang, Yujin Han, Difan Zou, Yian Ma, Tong Zhang

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 视频扩散模型 :video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20754 2025-04-30 cs.LG 50%

DDPS: Discrete Diffusion Posterior Sampling for Paths in Layered Graphs

Hao Luan, See-Kiong Ng, Chun Kai Ling

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所)

专题命中 视频扩散模型 :video generation(abstract)

Comments To appear at Frontiers in Probabilistic Inference: Sampling meets Learning (FPI) workshop at ICLR 2025. https://openreview.net/forum?id=DBdkU0Ikzy

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07566 2025-04-21 cs.LG cs.AI 50%

Diffusion Transformers for Tabular Data Time Series Generation

Fabrizio Garuti, Enver Sangineto, Simone Luetto, Lorenzo Forni, Rita Cucchiara

专题命中 视频扩散模型 :video generation(abstract)

Comments Accepted at ICLR 2025. 26 pages, 19 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10445 2025-04-18 cs.LG cs.AI 50%

SparseDM: Toward Sparse Efficient Diffusion Models

Kafeng Wang, Jianfei Chen, He Li, Zhenpeng Mi, Jun Zhu

专题命中 视频扩散模型 :video generation(abstract)

Comments This paper has been accepted by ICME 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10540 2025-04-16 stat.ML cs.AI cs.LG 50%

AB-Cache: Training-Free Acceleration of Diffusion Models via Adams-Bashforth Cached Feature Reuse

Zichao Yu, Zhen Zou, Guojiang Shao, Chengwei Zhang, Shengze Xu, Jie Huang, Feng Zhao, Xiaodong Cun, Wenyi Zhang

专题命中 视频扩散模型 :video diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18426 2025-04-01 physics.geo-ph cs.LG 50%

Diffusion-based subsurface CO$_2$ multiphysics monitoring and forecasting

Xinquan Huang, Fu Wang, Tariq Alkhalifah

专题命中 视频扩散模型 :video diffusion(abstract)

Comments JGR: Machine Learning and Computation, accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14132 2025-03-27 cs.LG 50%

Text-to-Model: Text-Conditioned Neural Network Diffusion for Train-Once-for-All Personalization

Zexi Li, Lingzhi Gao, Chao Wu

专题命中 视频扩散模型 :text-to-video(abstract)

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19172 2025-03-11 cs.LG cs.CR 50%

PSyDUCK: Training-Free Steganography for Latent Diffusion

Aqib Mahfuz, Georgia Channing, Mark van der Wilk, Philip Torr, Fabio Pizzati, Christian Schroeder de Witt

专题命中 视频扩散模型 :video diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16134 2025-02-05 cs.LG math.ST stat.ML stat.TH 50%

Diffusion Transformer Captures Spatial-Temporal Dependencies: A Theory for Gaussian Process Data

Hengyu Fu, Zehao Dou, Jiawei Guo, Mengdi Wang, Minshuo Chen

专题命中 视频扩散模型 :video generation(abstract)

Comments 56 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00887 2024-12-03 cs.AI 50%

Playable Game Generation

Mingyu Yang, Junyou Li, Zhongbin Fang, Sheng Chen, Yangbin Yu, Qiang Fu, Wei Yang, Deheng Ye

专题命中 视频扩散模型 :text-to-video(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14664 2024-11-01 cs.LG cs.AI 50%

Fisher Flow Matching for Generative Modeling over Discrete Data

Oscar Davis, Samuel Kessler, Mircea Petrache, İsmail İlkan Ceylan, Michael Bronstein, Avishek Joey Bose

专题命中 视频扩散模型 :video generation(abstract)

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09016 2024-10-17 cs.RO 50%

Closed-Loop Visuomotor Control with Generative Expectation for Robotic Manipulation

Qingwen Bu, Jia Zeng, Li Chen, Yanchao Yang, Guyue Zhou, Junchi Yan, Ping Luo, Heming Cui, Yi Ma, Hongyang Li

专题命中 视频扩散模型 :video diffusion(abstract)

Comments Accepted at NeurIPS 2024. Code and models: https://github.com/OpenDriveLab/CLOVER

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13908 2024-10-01 cs.AI cs.CE 50%

Nonlinear Inverse Design of Mechanical Multi-Material Metamaterials Enabled by Video Denoising Diffusion and Structure Identifier

Jaewan Park, Shashank Kushwaha, Junyan He, Seid Koric, Qibang Liu, Iwona Jasiuk, Diab Abueidda

专题命中 视频扩散模型 :video diffusion(abstract)

Comments 26 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14709 2024-09-24 eess.AS cs.SD 50%

Video-to-Audio Generation with Fine-grained Temporal Semantics

Yuchen Hu, Yu Gu, Chenxing Li, Rilin Chen, Dong Yu

专题命中 视频扩散模型 :video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01851 2024-06-05 cs.HC 50%

Turning Text and Imagery into Captivating Visual Video

Mingming Wang, Elijah Miller

专题命中 视频扩散模型 :video diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.04384 2024-02-13 cs.LG stat.ML 50%

Denoising Diffusion Probabilistic Models in Six Simple Steps

Richard E. Turner, Cristiana-Diana Diaconu, Stratis Markou, Aliaksandra Shysheya, Andrew Y. K. Foong, Bruno Mlodozeniec

专题命中 视频扩散模型 :video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.19836 2024-02-02 cs.CE 50%

Inverse-design of nonlinear mechanical metamaterials via video denoising diffusion models

Jan-Hendrik Bastek, Dennis M. Kochmann

专题命中 视频扩散模型 :video diffusion(abstract)

Comments 21 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08587 2023-09-22 cs.LG cs.AI cs.RO 50%

Compositional Foundation Models for Hierarchical Planning

Anurag Ajay, Seungwook Han, Yilun Du, Shuang Li, Abhi Gupta, Tommi Jaakkola, Josh Tenenbaum, Leslie Kaelbling, Akash Srivastava, Pulkit Agrawal

专题命中 视频扩散模型 :video diffusion(abstract)

Comments Website: https://hierarchical-planning-foundation-model.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.07896 2023-09-12 stat.ML cs.LG math.DS stat.CO 50%

SciRE-Solver: Accelerating Diffusion Models Sampling by Score-integrand Solver with Recursive Difference

Shigui Li, Wei Chen, Delu Zeng

专题命中 视频扩散模型 :video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.02591 2023-08-29 cs.LG cs.AI cs.SI 50%

Generative Diffusion Models on Graphs: Methods and Applications

Chengyi Liu, Wenqi Fan, Yunqing Liu, Jiatong Li, Hang Li, Hui Liu, Jiliang Tang, Qing Li

专题命中 视频扩散模型 :video generation(abstract)

Comments This survey paper is accepted by IJCAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏