arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6781 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1305 篇

2411.18677 2024-12-02 cs.CV cs.AI cs.LG 70%

MatchDiffusion: Training-free Generation of Match-cuts

Alejandro Pardo, Fabio Pizzati, Tong Zhang, Alexander Pondaven, Philip Torr, Juan Camilo Perez, Bernard Ghanem

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments https://matchdiffusion.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10818 2024-11-19 cs.GR cs.CV 70%

FlipSketch: Flipping Static Drawings to Text-Guided Sketch Animations

Hmrishav Bandyopadhyay, Yi-Zhe Song

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments Code: https://github.com/hmrishavbandy/FlipSketch

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04924 2024-11-08 cs.CV 70%

MVSplat360: Feed-Forward 360 Scene Synthesis from Sparse Views

Yuedong Chen, Chuanxia Zheng, Haofei Xu, Bohan Zhuang, Andrea Vedaldi, Tat-Jen Cham, Jianfei Cai

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments NeurIPS 2024, Project page: https://donydchen.github.io/mvsplat360, Code: https://github.com/donydchen/mvsplat360

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16266 2024-10-22 cs.CV cs.AI 70%

3DGS-Enhancer: Enhancing Unbounded 3D Gaussian Splatting with View-consistent 2D Diffusion Priors

Xi Liu, Chaoyi Zhou, Siyu Huang

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2024 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12960 2024-09-20 cs.CV cs.GR 70%

LVCD: Reference-based Lineart Video Colorization with Diffusion Models

Zhitong Huang, Mohan Zhang, Jing Liao

专题命中 视频扩散模型 :video diffusion(abstract);long video(abstract);分类 cs.CV

Comments Accepted by ACM Transactions on Graphics and SIGGRAPH Asia 2024. Project page: https://luckyhzt.github.io/lvcd

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19453 2024-07-30 cs.CV 70%

FIND: Fine-tuning Initial Noise Distribution with Policy Optimization for Diffusion Models

Changgu Chen, Libing Yang, Xiaoyan Yang, Lianggangxu Chen, Gaoqi He, CHangbo Wang, Yang Li

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15153 2024-07-23 cs.CV 70%

Anchored Diffusion for Video Face Reenactment

Idan Kligvasser, Regev Cohen, George Leifman, Ehud Rivlin, Michael Elad

专题命中 视频扩散模型 :video generation(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12684 2024-07-18 cs.CV 70%

4Dynamic: Text-to-4D Generation with Hybrid Priors

Yu-Jie Yuan, Leif Kobbelt, Jiwen Liu, Yuan Zhang, Pengfei Wan, Yu-Kun Lai, Lin Gao

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18326 2024-06-10 cs.CV 70%

VITON-DiT: Learning In-the-Wild Video Try-On from Human Dance Videos via Diffusion Transformers

Jun Zheng, Fuwei Zhao, Youjiang Xu, Xin Dong, Xiaodan Liang

专题命中 视频扩散模型 :video generation(abstract);long video(abstract);分类 cs.CV

Comments Project Page: https://zhengjun-ai.github.io/viton-dit-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18132 2024-05-29 cs.CV 70%

EG4D: Explicit Generation of 4D Object without Score Distillation

Qi Sun, Zhiyang Guo, Ziyu Wan, Jing Nathan Yan, Shengming Yin, Wengang Zhou, Jing Liao, Houqiang Li

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17306 2024-05-29 cs.CV 70%

Controllable Longer Image Animation with Diffusion Models

Qiang Wang, Minghua Liu, Junjun Hu, Fan Jiang, Mu Xu

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments https://wangqiang9.github.io/Controllable.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09967 2024-05-27 cs.CV cs.AI cs.LG 70%

Ctrl-Adapter: An Efficient and Versatile Framework for Adapting Diverse Controls to Any Diffusion Model

Han Lin, Jaemin Cho, Abhay Zala, Mohit Bansal

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments First two authors contributed equally; Project page: https://ctrl-adapter.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.13763 2024-01-04 cs.CV cs.LG 70%

Align Your Gaussians: Text-to-4D with Dynamic 3D Gaussians and Composed Diffusion Models

Huan Ling, Seung Wook Kim, Antonio Torralba, Sanja Fidler, Karsten Kreis

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Project page: https://research.nvidia.com/labs/toronto-ai/AlignYourGaussians/

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.08818 2023-12-29 cs.CV cs.LG 70%

Align your Latents: High-Resolution Video Synthesis with Latent Diffusion Models

Andreas Blattmann, Robin Rombach, Huan Ling, Tim Dockhorn, Seung Wook Kim, Sanja Fidler, Karsten Kreis

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments Conference on Computer Vision and Pattern Recognition (CVPR) 2023. Project page: https://research.nvidia.com/labs/toronto-ai/VideoLDM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09109 2023-12-15 cs.CV cs.AI 70%

VideoLCM: Video Latent Consistency Model

Xiang Wang, Shiwei Zhang, Han Zhang, Yu Liu, Yingya Zhang, Changxin Gao, Nong Sang

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17009 2023-12-05 cs.CV 70%

Space-Time Diffusion Features for Zero-Shot Text-Driven Motion Transfer

Danah Yatim, Rafail Fridman, Omer Bar-Tal, Yoni Kasten, Tali Dekel

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments Project page: https://diffusion-motion-transfer.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.16498 2023-11-29 cs.CV cs.GR 70%

MagicAnimate: Temporally Consistent Human Image Animation using Diffusion Model

Zhongcong Xu, Jianfeng Zhang, Jun Hao Liew, Hanshu Yan, Jia-Wei Liu, Chenxu Zhang, Jiashi Feng, Mike Zheng Shou

专题命中 视频扩散模型 :video diffusion(abstract);long video(abstract);分类 cs.CV

Comments Project Page at https://showlab.github.io/magicanimate

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.13439 2023-03-24 cs.CV 70%

Text2Video-Zero: Text-to-Image Diffusion Models are Zero-Shot Video Generators

Levon Khachatryan, Andranik Movsisyan, Vahram Tadevosyan, Roberto Henschel, Zhangyang Wang, Shant Navasardyan, Humphrey Shi

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.CV

Comments The project is available at: https://github.com/Picsart-AI-Research/Text2Video-Zero

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.03011 2023-02-07 cs.CV 70%

Structure and Content-Guided Video Synthesis with Diffusion Models

Patrick Esser, Johnathan Chiu, Parmida Atighehchian, Jonathan Granskog, Anastasis Germanidis

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments Project page at https://research.runwayml.com/gen1

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.12661 2023-01-31 cs.SD cs.LG cs.MM eess.AS 70%

Make-An-Audio: Text-To-Audio Generation with Prompt-Enhanced Diffusion Models

Rongjie Huang, Jiawei Huang, Dongchao Yang, Yi Ren, Luping Liu, Mingze Li, Zhenhui Ye, Jinglin Liu, Xiang Yin, Zhou Zhao

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract);分类 cs.MM

Comments Audio samples are available at https://Text-to-Audio.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.03250 2022-12-08 cs.CV 70%

Neural Cell Video Synthesis via Optical-Flow Diffusion

Manuel Serna-Aguilera, Khoa Luu, Nathaniel Harris, Min Zou

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments 9 pages, 2 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.07696 2022-11-15 cs.CV cs.LG stat.ML 70%

Diffusion Models for Video Prediction and Infilling

Tobias Höppe, Arash Mehrjou, Stefan Bauer, Didrik Nielsen, Andrea Dittadi

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments Published in TMLR (11/2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06008 2026-08-07 cs.RO 新提交 67%

Adaptive-WAM: Quality-Guided Early-Exit Planning from Intermediate Video-Diffusion Features

Adaptive-WAM:基于质量引导的中间视频扩散特征早期退出规划

Sining Ang, Yuguang Yang, Yan Wang

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract)

AI总结 Adaptive-WAM是基于Wan2.2-5B主干的质量感知多出口规划器,通过动态分配主干深度减少计算量,在NAVSIM、nuScenes等数据集上取得优异规划性能,延迟显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00126 2026-07-21 cs.RO 版本更新 67%

Compositional Diffusion with Guided Search for Long-Horizon Planning

用于长期规划的带引导搜索的组合扩散

Utkarsh A Mishra, David He, Yongxin Chen, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 视频扩散模型 :video generation(abstract);long video(abstract)

AI总结 研究针对组合生成模型在局部分布多模态时的模式平均问题,提出带引导搜索的组合扩散方法(CDGS),通过特定采样、过滤和重采样解决问题,在机器人操作任务上表现出色且跨领域通用。

Comments 38 pages, 18 figures, ICLR 2026 ORAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13501 2026-07-03 cs.DC cs.LG cs.PF 新提交 67%

GF-DiT: Scheduling Parallelism for Diffusion Transformer Serving

GF-DiT:扩散Transformer服务的并行调度

Xinwei Qiang, Yifan Hu, Shixuan Sun, Jing Yang, Han Zhao, Chen Chen, Yu Feng, Jingwen Leng, Minyi Guo

机构 * Shanghai Jiao Tong University(上海交通大学) Guizhou University(贵州大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract)

AI总结 提出GF-DiT,一种策略可编程运行时,通过动态调整请求并行度来优化扩散Transformer服务,利用无组集合通信实现低开销在线重配置,显著提升吞吐量和降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00837 2026-06-02 cs.RO cs.LG 67%

Coarse-to-Fine Compositional Diffusion for Long-Horizon Planning

粗到细的组合扩散用于长时域规划

Byoungwoo Park, Utkarsh A. Mishra, Jaemoo Choi, Juho Lee, Yongxin Chen

机构 * KAIST(韩国科学技术院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视频扩散模型 :video generation(abstract);long video(abstract)

AI总结 提出Coarse-to-Fine Compositional Diffusion (CoFi)方法,通过先形成全局骨架再细化局部细节,在长时域机器人规划、全景图像生成和长视频生成中提升全局一致性和局部质量,同时减少2-8倍去噪评估次数。

Comments Project page: https://cofi-diffusion.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10448 2026-03-24 cs.RO 67%

DiT4DiT: Jointly Modeling Video Dynamics and Actions for Generalizable Robot Control

DiT4DiT:联合建模视频动态与动作以实现通用机器人控制

Teli Ma, Jia Zheng, Zifan Wang, Chunli Jiang, Andy Cui, Junwei Liang, Shuo Yang

机构 * Mondo Robotics(Mondo机器人公司) HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract)

AI总结 本文提出DiT4DiT模型,通过结合视频扩散变换器与动作扩散变换器,实现视频动态与动作的联合建模,提升机器人控制的泛化能力与样本效率。

Comments https://dit4dit.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04928 2026-02-09 cs.LG 67%

Euphonium: Steering Video Flow Matching via Process Reward Gradient Guided Stochastic Dynamics

euphonium:通过过程奖励梯度引导的随机动态控制视频流匹配

Ruizhe Zhong, Jiesong Lian, Xiaoyue Mi, Zixiang Zhou, Yuan Zhou, Qinglin Lu, Junchi Yan

机构 * Huazhong University of Science and Technology(华中科技大学) Shanghai Jiao Tong University(上海交通大学) Tencent Hunyuan(腾讯混元) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视频扩散模型 :video generation(abstract);text-to-video(abstract)

AI总结 Euphonium通过过程奖励梯度引导动态,提升视频流匹配的生成效率和对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09650 2025-10-06 cs.CV cs.LG cs.MM cs.RO eess.IV 67%

HopaDIFF: Holistic-Partial Aware Fourier Conditioned Diffusion for Referring Human Action Segmentation in Multi-Person Scenarios

Kunyu Peng, Junchao Huang, Xiangsheng Huang, Di Wen, Junwei Zheng, Yufan Chen, Kailun Yang, Jiamin Wu, Chongqing Hao, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Beijing Institute of Technology(北京理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hunan University(湖南大学) Shanghai AI Lab(上海人工智能实验室) HEBUST

专题命中 视频扩散模型 :video understanding(abstract);分类 cs.CV、eess.IV、cs.MM

Comments Accepted to NeurIPS 2025. The dataset and code are available at https://github.com/KPeng9510/HopaDIFF

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01064 2025-09-22 cs.CV cs.AI cs.LG cs.MM eess.IV 67%

FLOAT: Generative Motion Latent Flow Matching for Audio-driven Talking Portrait

Taekyung Ki, Dongchan Min, Gyeongsu Chae

机构 * KAIST(韩国科学技术院) DeepBrain AI Inc.(DeepBrain AI公司)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV、eess.IV、cs.MM

Comments ICCV 2025. Project page: https://deepbrainai-research.github.io/float/

详情

展开后加载摘要…

URL PDF HTML 收藏