arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1299 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1299 篇

2507.02608 2025-11-04 cs.LG physics.flu-dyn 50%

Lost in Latent Space: An Empirical Study of Latent Diffusion Models for Physics Emulation

François Rozet, Ruben Ohana, Michael McCabe, Gilles Louppe, François Lanusse, Shirley Ho

机构 * Polymathic AI Flatiron Institute University of Liège(列日大学) New York University(纽约大学) Princeton University(普林斯顿大学) Université Paris-Saclay, Université Paris Cité, CEA, CNRS, AIM(巴黎-萨克莱大学、巴黎-cite大学、CEA、CNRS、AIM)

专题命中 视频扩散模型 :video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25319 2025-10-30 cs.GR cs.AI 50%

4-Doodle: Text to 3D Sketches that Move!

Hao Chen, Jiaqi Wang, Yonggang Qi, Ke Li, Kaiyue Pang, Yi-Zhe Song

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) SketchX, CVSSP, University of Surrey(Surrey大学)

专题命中 视频扩散模型 :video diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21991 2025-10-28 cs.RO cs.AI 50%

Two-Steps Diffusion Policy for Robotic Manipulation via Genetic Denoising

Mateo Clemente, Leo Brunswic, Rui Heng Yang, Xuan Zhao, Yasser Khalil, Haoyu Lei, Amir Rasouli, Yinchuan Li

机构 * Huawei Technologies Canada(华为技术加拿大)

专题命中 视频扩散模型 :video generation(abstract)

Comments 16 pages, 11 figure, 2 tables, accepted at Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03886 2025-10-07 cs.AI 50%

Rare Text Semantics Were Always There in Your Diffusion Transformer

Seil Kang, Woojung Han, Dayun Ju, Seong Jae Hwang

专题命中 视频扩散模型 :text-to-video(abstract)

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22199 2025-09-30 cs.RO cs.AI 50%

MimicDreamer: Aligning Human and Robot Demonstrations for Scalable VLA Training

Haoyun Li, Ivan Zhang, Runqi Ouyang, Xiaofeng Wang, Zheng Zhu, Zhiqin Yang, Zhentao Zhang, Boyuan Wang, Chaojun Ni, Wenkang Qin, Xinze Chen, Yun Ye, Guan Huang, Zhenbo Song, Xingang Wang

机构 * GigaAI CASIA NJUST(南京工业大学) Tsinghua University(清华大学)

专题命中 视频扩散模型 :video diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01442 2025-09-19 cs.RO 50%

Physically-based Lighting Generation for Robotic Manipulation

Shutong Jin, Lezhong Wang, Ben Temming, Florian T. Pokorny

机构 * KTH Royal Institute of Technology(皇家理工学院) Technical University of Denmark(丹麦技术大学)

专题命中 视频扩散模型 :video diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06573 2025-09-09 cs.GR 50%

From Rigging to Waving: 3D-Guided Diffusion for Natural Animation of Hand-Drawn Characters

Jie Zhou, Linzi Qu, Miu-Ling Lam, Hongbo Fu

专题命中 视频扩散模型 :video diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15843 2025-08-25 cs.NI 50%

xDiff: Online Diffusion Model for Collaborative Inter-Cell Interference Management in 5G O-RAN

Peihao Yan, Huacheng Zeng, Y. Thomas Hou

专题命中 视频扩散模型 :video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15260 2025-07-22 cs.LG 50%

CHORDS: Diffusion Sampling Accelerator with Multi-core Hierarchical ODE Solvers

Jiaqi Han, Haotian Ye, Puheng Li, Minkai Xu, James Zou, Stefano Ermon

机构 * Stanford University(斯坦福大学)

专题命中 视频扩散模型 :video diffusion(abstract)

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08438 2025-07-15 cs.RO stat.ML 50%

Diffusion Models for Robotic Manipulation: A Survey

Rosa Wolf, Yitian Shi, Sheng Liu, Rania Rayyes

机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院)

专题命中 视频扩散模型 :video generation(abstract)

Comments 26 pages, 2 figure, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07050 2025-07-10 cs.CL cs.LG stat.ML 50%

Discrete Diffusion Models for Language Generation

Ashen Weligalle

机构 * Department of Computer and Information Science(计算机与信息科学系)

专题命中 视频扩散模型 :video generation(abstract)

Comments pdfLaTeX, 69 pages with 21 figures, Licentiate Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01309 2025-07-03 cs.AR 50%

SD-Acc: Accelerating Stable Diffusion through Phase-aware Sampling and Hardware Co-Optimizations

Zhican Wang, Guanghui He, Hongxiang Fan

专题命中 视频扩散模型 :video generation(abstract)

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17301 2025-07-03 cs.GR 50%

FramePrompt: In-context Controllable Animation with Zero Structural Changes

Guian Fang, Yuchao Gu, Mike Zheng Shou

专题命中 视频扩散模型 :video diffusion(abstract)

Comments Project page: https://frameprompt.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21478 2025-06-27 cs.SD cs.AI 50%

SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture

Kehan Sui, Jinxu Xiang, Fang Jin

机构 * George Washington University(乔治华盛顿大学)

专题命中 视频扩散模型 :video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13497 2025-06-17 cs.DC 50%

DDiT: Dynamic Resource Allocation for Diffusion Transformer Model Serving

Heyang Huang, Cunchen Hu, Jiaqi Zhu, Ziyuan Gao, Liangliang Xu, Yizhou Shan, Yungang Bao, Sun Ninghui, Tianwei Zhang, Sa Wang

专题命中 视频扩散模型 :text-to-video(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03099 2025-06-04 cs.SD cs.AI cs.GR 50%

TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models

Chetwin Low, Weimin Wang

机构 * Character AI

专题命中 视频扩散模型 :video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10510 2025-05-23 cs.LG 50%

SmoothCache: A Universal Inference Acceleration Technique for Diffusion Transformers

Joseph Liu, Joshua Geddes, Ziyu Guo, Haomiao Jiang, Mahesh Kumar Nandwana

机构 * Roblox(Roblox公司) Queen’s University(女王大学)

专题命中 视频扩散模型 :text-to-video(abstract)

Comments Code can be found at https://github.com/Roblox/SmoothCache. Accepted at CVPR eLVM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09286 2025-05-22 cs.RO cs.AI cs.LG 50%

Learning Novel Skills from Language-Generated Demonstrations

Ao-Qun Jin, Tian-Yu Xiang, Xiao-Hu Zhou, Mei-Jiang Gui, Xiao-Liang Xie, Shi-Qi Liu, Shuang-Yi Wang, Yue Cao, Sheng-Bin Duan, Fu-Chao Xie, Zeng-Guang Hou

机构 * Institute of Automation Chinese Academy of Sciences(自动化研究所,中国科学院)

专题命中 视频扩散模型 :video diffusion(abstract)

Comments 10 pages, International Conference on Learning Representations (ICLR) 2025 Workshop on Generative Models for Robot Learning (GenBot)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21314 2025-05-01 cs.LG stat.ML 50%

Capturing Conditional Dependence via Auto-regressive Diffusion Models

Xunpeng Huang, Yujin Han, Difan Zou, Yian Ma, Tong Zhang

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 视频扩散模型 :video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20754 2025-04-30 cs.LG 50%

DDPS: Discrete Diffusion Posterior Sampling for Paths in Layered Graphs

Hao Luan, See-Kiong Ng, Chun Kai Ling

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所)

专题命中 视频扩散模型 :video generation(abstract)

Comments To appear at Frontiers in Probabilistic Inference: Sampling meets Learning (FPI) workshop at ICLR 2025. https://openreview.net/forum?id=DBdkU0Ikzy

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07566 2025-04-21 cs.LG cs.AI 50%

Diffusion Transformers for Tabular Data Time Series Generation

Fabrizio Garuti, Enver Sangineto, Simone Luetto, Lorenzo Forni, Rita Cucchiara

专题命中 视频扩散模型 :video generation(abstract)

Comments Accepted at ICLR 2025. 26 pages, 19 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10445 2025-04-18 cs.LG cs.AI 50%

SparseDM: Toward Sparse Efficient Diffusion Models

Kafeng Wang, Jianfei Chen, He Li, Zhenpeng Mi, Jun Zhu

专题命中 视频扩散模型 :video generation(abstract)

Comments This paper has been accepted by ICME 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10540 2025-04-16 stat.ML cs.AI cs.LG 50%

AB-Cache: Training-Free Acceleration of Diffusion Models via Adams-Bashforth Cached Feature Reuse

Zichao Yu, Zhen Zou, Guojiang Shao, Chengwei Zhang, Shengze Xu, Jie Huang, Feng Zhao, Xiaodong Cun, Wenyi Zhang

专题命中 视频扩散模型 :video diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18426 2025-04-01 physics.geo-ph cs.LG 50%

Diffusion-based subsurface CO$_2$ multiphysics monitoring and forecasting

Xinquan Huang, Fu Wang, Tariq Alkhalifah

专题命中 视频扩散模型 :video diffusion(abstract)

Comments JGR: Machine Learning and Computation, accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14132 2025-03-27 cs.LG 50%

Text-to-Model: Text-Conditioned Neural Network Diffusion for Train-Once-for-All Personalization

Zexi Li, Lingzhi Gao, Chao Wu

专题命中 视频扩散模型 :text-to-video(abstract)

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19172 2025-03-11 cs.LG cs.CR 50%

PSyDUCK: Training-Free Steganography for Latent Diffusion

Aqib Mahfuz, Georgia Channing, Mark van der Wilk, Philip Torr, Fabio Pizzati, Christian Schroeder de Witt

专题命中 视频扩散模型 :video diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16134 2025-02-05 cs.LG math.ST stat.ML stat.TH 50%

Diffusion Transformer Captures Spatial-Temporal Dependencies: A Theory for Gaussian Process Data

Hengyu Fu, Zehao Dou, Jiawei Guo, Mengdi Wang, Minshuo Chen

专题命中 视频扩散模型 :video generation(abstract)

Comments 56 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00887 2024-12-03 cs.AI 50%

Playable Game Generation

Mingyu Yang, Junyou Li, Zhongbin Fang, Sheng Chen, Yangbin Yu, Qiang Fu, Wei Yang, Deheng Ye

专题命中 视频扩散模型 :text-to-video(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14664 2024-11-01 cs.LG cs.AI 50%

Fisher Flow Matching for Generative Modeling over Discrete Data

Oscar Davis, Samuel Kessler, Mircea Petrache, İsmail İlkan Ceylan, Michael Bronstein, Avishek Joey Bose

专题命中 视频扩散模型 :video generation(abstract)

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09016 2024-10-17 cs.RO 50%

Closed-Loop Visuomotor Control with Generative Expectation for Robotic Manipulation

Qingwen Bu, Jia Zeng, Li Chen, Yanchao Yang, Guyue Zhou, Junchi Yan, Ping Luo, Heming Cui, Yi Ma, Hongyang Li

专题命中 视频扩散模型 :video diffusion(abstract)

Comments Accepted at NeurIPS 2024. Code and models: https://github.com/OpenDriveLab/CLOVER

详情

展开后加载摘要…

URL PDF HTML 收藏