arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6781 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1305 篇

2403.14939 2024-03-25 cs.CV 57%

STAG4D: Spatial-Temporal Anchored Generative 4D Gaussians

Yifei Zeng, Yanqin Jiang, Siyu Zhu, Yuanxun Lu, Youtian Lin, Hao Zhu, Weiming Hu, Xun Cao, Yao Yao

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09368 2024-03-21 cs.CV cs.AI 57%

Magic-Me: Identity-Specific Video Customized Diffusion

Ze Ma, Daquan Zhou, Chun-Hsiao Yeh, Xue-She Wang, Xiuyu Li, Huanrui Yang, Zhen Dong, Kurt Keutzer, Jiashi Feng

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Project Page at https://magic-me-webpage.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.12706 2024-03-20 cs.CV cs.AI 57%

AnimateDiff-Lightning: Cross-Model Diffusion Distillation

Shanchuan Lin, Xiao Yang

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08902 2024-03-15 cs.CV 57%

Envision3D: One Image to 3D with Anchor Views Interpolation

Yatian Pang, Tanghui Jia, Yujun Shi, Zhenyu Tang, Junwu Zhang, Xinhua Cheng, Xing Zhou, Francis E. H. Tay, Li Yuan

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments GitHub repository: https://github.com/PKU-YuanGroup/Envision3D

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.08764 2024-03-14 cs.CV 57%

VLOGGER: Multimodal Diffusion for Embodied Avatar Synthesis

Enric Corona, Andrei Zanfir, Eduard Gabriel Bazavan, Nikos Kolotouros, Thiemo Alldieck, Cristian Sminchisescu

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Project web: https://enriccorona.github.io/vlogger/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14603 2024-02-20 cs.CV 57%

Animate124: Animating One Image to 4D Dynamic Scene

Yuyang Zhao, Zhiwen Yan, Enze Xie, Lanqing Hong, Zhenguo Li, Gim Hee Lee

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project Page: https://animate124.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01566 2024-02-05 cs.CV cs.AI 57%

Boximator: Generating Rich and Controllable Motions for Video Synthesis

Jiawei Wang, Yuchen Zhang, Jiaxin Zou, Yan Zeng, Guoqiang Wei, Liping Yuan, Hang Li

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments 16 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10822 2024-01-22 cs.CV 57%

ActAnywhere: Subject-Aware Video Background Generation

Boxiao Pan, Zhan Xu, Chun-Hao Paul Huang, Krishna Kumar Singh, Yang Zhou, Leonidas J. Guibas, Jimei Yang

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08232 2024-01-17 cs.CV 57%

Multi-scale 2D Temporal Map Diffusion Models for Natural Language Video Localization

Chongzhi Zhang, Mingyuan Zhang, Zhiyang Teng, Jiayi Li, Xizhou Zhu, Lewei Lu, Ziwei Liu, Aixin Sun

专题命中 视频扩散模型 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.05870 2024-01-12 cs.CV cs.AI 57%

HiCAST: Highly Customized Arbitrary Style Transfer with Adapter Enhanced Diffusion Models

Hanzhang Wang, Haoran Wang, Jinze Yang, Zhongrui Yu, Zeke Xie, Lei Tian, Xinyan Xiao, Junjun Jiang, Xianming Liu, Mingming Sun

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.05288 2024-01-04 cs.CV 57%

MotionCrafter: One-Shot Motion Customization of Diffusion Models

Yuxin Zhang, Fan Tang, Nisha Huang, Haibin Huang, Chongyang Ma, Weiming Dong, Changsheng Xu

专题命中 视频扩散模型 :text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.13305 2023-12-22 cs.CV 57%

DVIS++: Improved Decoupled Framework for Universal Video Segmentation

Tao Zhang, Xingye Tian, Yikang Zhou, Shunping Ji, Xuebo Wang, Xin Tao, Yuan Zhang, Pengfei Wan, Zhongyuan Wang, Yu Wu

专题命中 视频扩散模型 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.12030 2023-12-20 cs.CV cs.AI 57%

Towards Accurate Guided Diffusion Sampling through Symplectic Adjoint Method

Jiachun Pan, Hanshu Yan, Jun Hao Liew, Jiashi Feng, Vincent Y. F. Tan

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01567 2023-11-06 cs.CV 57%

Exploring the Hyperparameter Space of Image Diffusion Models for Echocardiogram Generation

Hadrien Reynaud, Bernhard Kainz

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments MedNeurIPS 2023 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.11497 2023-10-19 cs.CV 57%

FreeU: Free Lunch in Diffusion U-Net

Chenyang Si, Ziqi Huang, Yuming Jiang, Ziwei Liu

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Method update: we proposed structure-based scaling to enhance the performance of FreeU. Project page: https://chenyangsi.top/FreeU/

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.14108 2023-10-13 cs.CV 57%

3DDesigner: Towards Photorealistic 3D Object Generation and Editing with Text-guided Diffusion Models

Gang Li, Heliang Zheng, Chaoyue Wang, Chang Li, Changwen Zheng, Dacheng Tao

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Submitted to IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.14073 2023-08-04 cs.CV 57%

VideoControlNet: A Motion-Guided Video-to-Video Translation Framework by Using Diffusion Model with ControlNet

Zhihao Hu, Dong Xu

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.03396 2023-08-01 cs.CV 57%

Diffused Heads: Diffusion Models Beat GANs on Talking-Face Generation

Michał Stypułkowski, Konstantinos Vougioukas, Sen He, Maciej Zięba, Stavros Petridis, Maja Pantic

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.11743 2023-06-21 cs.CV cs.LG 57%

SinFusion: Training Diffusion Models on a Single Image or Video

Yaniv Nikankin, Niv Haim, Michal Irani

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Project Page: https://yanivnik.github.io/sinfusion

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.04001 2023-05-24 cs.CV cs.AI 57%

AADiff: Audio-Aligned Video Synthesis with Text-to-Image Diffusion

Seungwoo Lee, Chaerin Kong, Donghyeon Jeon, Nojun Kwak

专题命中 视频扩散模型 :text-to-video(abstract);分类 cs.CV

Comments CVPR2023 Workshop on AI for Content Creation. Project Page: https://lifrary.github.io/AADiff/

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.00235 2022-12-02 cs.CV 57%

VIDM: Video Implicit Diffusion Models

Kangfu Mei, Vishal M. Patel

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments AAAI2023 https://kfmei.page/vidm/

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.04403 2019-01-17 cs.CV cs.LG 57%

Label Denoising with Large Ensembles of Heterogeneous Neural Networks

Pavel Ostyakov, Elizaveta Logacheva, Roman Suvorov, Vladimir Aliev, Gleb Sterkin, Oleg Khomenko, Sergey I. Nikolenko

专题命中 视频扩散模型 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
1303.5913 2013-03-26 cs.CV cs.LG cs.RO stat.ML 57%

A Diffusion Process on Riemannian Manifold for Visual Tracking

Marcus Chen, Cham Tat Jen, Pang Sze Kim, Alvina Goh

专题命中 视频扩散模型 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18804 2026-08-10 stat.ML cs.LG math.ST stat.TH 版本更新 50%

Convergence of Diffusion Models Under the Manifold Hypothesis in High-Dimensions

高维流形假设下扩散模型的收敛性

Iskander Azangulov, George Deligiannidis, Judith Rousseau

专题命中 视频扩散模型 :video generation(abstract)

AI总结 该研究在流形假设下证明 DDPM 的分数学习和采样复杂度均实现与高维 ambient 空间维度无关的速率,通过建立扩散模型与高斯过程极值理论的新框架完成,解释了其经验成功。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01150 2026-08-04 cs.DC 新提交 50%

Zellige: Moldable Sequence Placement for Mixed Image-Video DiT Training

Zellige:用于混合图像-视频DiT训练的可塑序列放置

Guangyu Xiang, Xueze Kang, Minwei Zhao, Yuxin Wang, Shaohuai Shi, Lin Zhang, Xiaowen Chu

专题命中 视频扩散模型 :video generation(abstract)

AI总结 Zellige是一种可塑序列放置系统,通过硬件分析器、两阶段规划器和合并注意力引擎解决混合图像-视频DiT训练的GPU序列放置问题,在多GPU环境下性能优于KnapFormer。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15846 2026-07-20 cs.AR 新提交 50%

DSTAR: Accelerating Diffusion Transformers via Spatial and Temporal Redundancy Reduction

DSTAR:通过减少空间和时间冗余加速扩散变换器

Chi Zhang, Jieru Zhao, Yu Feng, Chen Zhang, Quan Chen, Minyi Guo

专题命中 视频扩散模型 :video generation(abstract)

AI总结 研究针对扩散变换器多迭代推理低效耗能问题,提出软硬件协同设计框架DSTAR。算法上用细粒度混合精度量化和稀疏注意力重用机制,架构上设计专用硬件加速器,经评估在多个典型DiTs上实现显著延迟加速和节能,且不降低精度。

Comments Accepted to the 59th IEEE/ACM International Symposium on Microarchitecture (MICRO 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21210 2026-07-01 cs.LG cs.CE 版本更新 50%

Pretrained Video Models as Differentiable Physics Simulators for Urban Wind Flows

预训练视频模型作为可微物理模拟器用于城市风流

Janne Perini, Rafael Bischof, Moab Arar, Ayça Duran, Michael A. Kraus, Siddhartha Mishra, Bernd Bickel

机构 * ETH Zurich(苏黎世联邦理工学院) Tel Aviv University(特拉维夫大学) TU Darmstadt(达姆施塔特工业大学)

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 本文提出WinDiNet,一种预训练视频扩散模型,用于快速模拟城市风流,通过反向传播优化建筑布局以提升风安全性和行人舒适度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11025 2026-06-30 cs.LG 新提交 50%

Flow-DPPO: Divergence Proximal Policy Optimization for Flow Matching Models

Flow-DPPO:用于流匹配模型的散度近端策略优化

Bowen Ping, Xiangxin Zhou, Penghui Qi, Minnan Luo, Liefeng Bo, Tianyu Pang

机构 * Xi’an Jiaotong University(西安交通大学) Tencent Hunyuan(腾讯混元) National University of Singapore(新加坡国立大学)

专题命中 视频扩散模型 :video generation(abstract)

AI总结 针对流匹配模型中PPO比率裁剪的结构性缺陷,提出Flow-DPPO方法,利用高斯策略的精确KL散度计算实现散度近端约束,提升奖励和训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28237 2026-06-29 cs.RO 新提交 50%

Unleashing Infinite Motion: Scaling Expressive Quadrupedal Motion via Generative Video Priors

释放无限运动:通过生成式视频先验扩展富有表现力的四足运动

Youzhi Liu, Li Gao, Yifei Qian, Liu Liu, Yang Cai, Ziqiao Li

机构 * Amap, Alibaba Group(高德,阿里巴巴集团)

专题命中 视频扩散模型 :video diffusion(abstract)

AI总结 提出Uni-Mo全自动流水线,利用LLM和视频扩散模型生成四足机器人运动数据,通过身份一致性损失提取3D轨迹,训练真实机器人跟踪策略,并发布包含7488个语言标注运动的数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19163 2026-06-18 cs.DC 新提交 50%

Pulse: Training Acceleration for Large Diffusion Models with Automatic Pipeline Parallelism

Pulse: 面向大规模扩散模型的自动流水线并行训练加速

Boran Sun, Guoyong Jiang, Lin Zhang, Chen Chen, Yuechen Tao, Zhishu Che, Jieling Yu, Shan Chang, Huaxi Gu, Fangming Liu, Bo Li

专题命中 视频扩散模型 :video generation(abstract)

AI总结 提出PULSE自动流水线并行策略,通过将跳跃连接层同设备放置、局部缓存激活值,消除跨流水线通信,结合动态规划分区器、ILP调度合成器和混合并行调优器,在通信受限硬件上实现最高2.3倍吞吐提升。

Comments Accepted by International Conference on Distributed Computing Systems(ICDCS'26)

详情

展开后加载摘要…

URL PDF HTML 收藏