arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1299 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1299 篇

2310.16400 2024-10-10 cs.CV cs.AI 57%

Fuse Your Latents: Video Editing with Multi-source Latent Diffusion Models

Tianyi Lu, Xing Zhang, Jiaxi Gu, Renjing Pei, Songcen Xu, Xingjun Ma, Hang Xu, Zuxuan Wu

专题命中 视频扩散模型 :text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04721 2024-10-08 cs.LG cs.CV 57%

ACDC: Autoregressive Coherent Multimodal Generation using Diffusion Correction

Hyungjin Chung, Dohun Lee, Jong Chul Ye

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 25 pages, 10 figures. Project page: https://acdc2025.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04005 2024-10-07 cs.CV 57%

Qihoo-T2X: An Efficient Proxy-Tokenized Diffusion Transformer for Text-to-Any-Task

Jing Wang, Ao Ma, Jiasong Feng, Dawei Leng, Yuhui Yin, Xiaodan Liang

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06911 2024-09-27 cs.CV cs.AI 57%

AsyncDiff: Parallelizing Diffusion Models by Asynchronous Denoising

Zigeng Chen, Xinyin Ma, Gongfan Fang, Zhenxiong Tan, Xinchao Wang

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10491 2024-09-23 cs.CV 57%

Make a Cheap Scaling: A Self-Cascade Diffusion Model for Higher-Resolution Adaptation

Lanqing Guo, Yingqing He, Haoxin Chen, Menghan Xia, Xiaodong Cun, Yufei Wang, Siyu Huang, Yong Zhang, Xintao Wang, Qifeng Chen, Ying Shan, Bihan Wen

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Accepted by ECCV 2024; Project Page: https://guolanqing.github.io/Self-Cascade/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12532 2024-09-20 cs.CV 57%

Denoising Reuse: Exploiting Inter-frame Motion Consistency for Efficient Video Latent Generation

Chenyu Wang, Shuo Yan, Yixuan Chen, Yujiang Wang, Mingzhi Dong, Xiaochen Yang, Dongsheng Li, Robert P. Dick, Qin Lv, Fan Yang, Tun Lu, Ning Gu, Li Shang

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07447 2024-09-12 cs.CV cs.GR 57%

StereoCrafter: Diffusion-based Generation of Long and High-fidelity Stereoscopic 3D from Monocular Videos

Sijie Zhao, Wenbo Hu, Xiaodong Cun, Yong Zhang, Xiaoyu Li, Zhe Kong, Xiangjun Gao, Muyao Niu, Ying Shan

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments 11 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07255 2024-09-12 cs.CV 57%

EMOdiffhead: Continuously Emotional Control in Talking Head Generation via Diffusion

Jian Zhang, Weijian Mai, Zhijun Zhang

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07179 2024-09-12 cs.CV 57%

Phy124: Fast Physics-Driven 4D Content Generation from a Single Image

Jiajing Lin, Zhenzhong Wang, Yongjie Hou, Yuzhou Tang, Min Jiang

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03514 2024-09-06 cs.CV 57%

Blended Latent Diffusion under Attention Control for Real-World Video Editing

Deyin Liu, Lin Yuanbo Wu, Xianghua Xie

专题命中 视频扩散模型 :text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15111 2024-09-04 cs.CV cs.LG 57%

Matryoshka Diffusion Models

Jiatao Gu, Shuangfei Zhai, Yizhe Zhang, Josh Susskind, Navdeep Jaitly

专题命中 视频扩散模型 :text-to-video(abstract);分类 cs.CV

Comments Accepted by ICLR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.17131 2024-09-02 cs.CV cs.AI 57%

VQ4DiT: Efficient Post-Training Vector Quantization for Diffusion Transformers

Juncan Deng, Shuaiting Li, Zeyu Wang, Hong Gu, Kedong Xu, Kejie Huang

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16704 2024-08-30 cs.CV 57%

One-Shot Learning Meets Depth Diffusion in Multi-Object Videos

Anisha Jain

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15868 2024-08-29 cs.CV cs.AI 57%

GenDDS: Generating Diverse Driving Video Scenarios with Prompt-to-Video Generative Model

Yongjie Fu, Yunlong Li, Xuan Di

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14016 2024-08-27 cs.CV cs.AI 57%

Pixel-Aligned Multi-View Generation with Depth Guided Decoder

Zhenggang Tang, Peiye Zhuang, Chaoyang Wang, Aliaksandr Siarohin, Yash Kant, Alexander Schwing, Sergey Tulyakov, Hsin-Ying Lee

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08342 2024-08-19 cs.GR cs.CV 57%

CT4D: Consistent Text-to-4D Generation with Animatable Meshes

Ce Chen, Shaoli Huang, Xuelin Chen, Guangyi Chen, Xiaoguang Han, Kun Zhang, Mingming Gong

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02934 2024-08-09 cs.CV 57%

WoVoGen: World Volume-aware Diffusion for Controllable Multi-camera Driving Scene Generation

Jiachen Lu, Ze Huang, Zeyu Yang, Jiahui Zhang, Li Zhang

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02024 2024-08-06 cs.CV 57%

Faster Diffusion Action Segmentation

Shuaibing Wang, Shunli Wang, Mingcheng Li, Dingkang Yang, Haopeng Kuang, Ziyun Qian, Lihua Zhang

专题命中 视频扩散模型 :long video(abstract);分类 cs.CV

Comments 25 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13534 2024-08-05 cs.CV 57%

Motion-aware Latent Diffusion Models for Video Frame Interpolation

Zhilin Huang, Yijie Yu, Ling Yang, Chujun Qin, Bing Zheng, Xiawu Zheng, Zikun Zhou, Yaowei Wang, Wenming Yang

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06062 2024-07-23 cs.CV cs.AI 57%

ProcessPainter: Learn Painting Process from Sequence Data

Yiren Song, Shijie Huang, Chen Yao, Xiaojun Ye, Hai Ci, Jiaming Liu, Yuxuan Zhang, Mike Zheng Shou

专题命中 视频扩散模型 :text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13903 2024-07-23 cs.CV 57%

Accelerating Image Generation with Sub-path Linear Approximation Model

Chen Xu, Tianhui Song, Weixin Feng, Xubin Li, Tiezheng Ge, Bo Zheng, Limin Wang

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10937 2024-07-16 cs.CV 57%

IDOL: Unified Dual-Modal Latent Diffusion for Human-Centric Joint Video-Depth Generation

Yuanhao Zhai, Kevin Lin, Linjie Li, Chung-Ching Lin, Jianfeng Wang, Zhengyuan Yang, David Doermann, Junsong Yuan, Zicheng Liu, Lijuan Wang

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments ECCV 2024; project page: https://yhzhai.github.io/idol/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10476 2024-07-16 cs.CV cs.AI 57%

Kinetic Typography Diffusion Model

Seonmi Park, Inhwan Bae, Seunghyun Shin, Hae-Gon Jeon

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted at ECCV 2024, Project page: https://seonmip.github.io/kinety

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08231 2024-07-12 cs.CV 57%

E2VIDiff: Perceptual Events-to-Video Reconstruction using Diffusion Priors

Jinxiu Liang, Bohan Yu, Yixin Yang, Yiming Han, Boxin Shi

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15829 2024-06-25 cs.CV 57%

MVOC: a training-free multiple video object composition method with diffusion models

Wei Wang, Yaosen Chen, Yuegen Liu, Qi Yuan, Shubin Yang, Yanru Zhang

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08204 2024-06-13 cs.CV 57%

Diffusion-Promoted HDR Video Reconstruction

Yuanshen Guan, Ruikang Xu, Mingde Yao, Ruisheng Gao, Lizhi Wang, Zhiwei Xiong

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Arxiv Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04662 2024-06-10 cs.CV 57%

Evaluating and Mitigating IP Infringement in Visual Generative AI

Zhenting Wang, Chen Chen, Vikash Sehwag, Minzhou Pan, Lingjuan Lyu

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07133 2024-06-04 cs.CV cs.LG 57%

LatentMan: Generating Consistent Animated Characters using Image Diffusion Models

Abdelrahman Eldesokey, Peter Wonka

专题命中 视频扩散模型 :text-to-video(abstract);分类 cs.CV

Comments CVPRW 2024. Project page: https://abdo-eldesokey.github.io/latentman/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14329 2024-06-04 cs.CV 57%

X-Ray: A Sequential 3D Representation For Generation

Tao Hu, Wenhang Ge, Yuyang Zhao, Gim Hee Lee

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20334 2024-05-31 cs.CV cs.GR 57%

VividDream: Generating 3D Scene with Ambient Dynamics

Yao-Chih Lee, Yi-Ting Chen, Andrew Wang, Ting-Hsuan Liao, Brandon Y. Feng, Jia-Bin Huang

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project page: https://vivid-dream-4d.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏