arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 1299 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1299 篇

2508.03480 2025-08-06 cs.CV cs.AI 57%

VideoGuard: Protecting Video Content from Unauthorized Editing

Junjie Cao, Kaizhou Li, Xinchun Yu, Hongxiang Li, Xiaoping Zhang

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments ai security, 10pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02807 2025-08-06 cs.CV 57%

DreamVVT: Mastering Realistic Video Virtual Try-On in the Wild via a Stage-Wise Diffusion Transformer Framework

Tongchun Zuo, Zaiyu Huang, Shuliang Ning, Ente Lin, Chao Liang, Zerong Zheng, Jianwen Jiang, Yuan Zhang, Mingyuan Gao, Xin Dong

机构 * ByteDance Intelligent Creation(字节跳动智能创作)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14404 2025-08-06 cs.CV cs.AI 57%

Causally Steered Diffusion for Automated Video Counterfactual Generation

Nikos Spyrou, Athanasios Vlontzos, Paraskevas Pegios, Thomas Melistas, Nefeli Gkouti, Yannis Panagakis, Giorgos Papanastasiou, Sotirios A. Tsaftaris

机构 * Spotify, UK(英国Spotify)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12049 2025-08-05 cs.CV 57%

TACO: Taming Diffusion for in-the-wild Video Amodal Completion

Ruijie Lu, Yixin Chen, Yu Liu, Jiaxiang Tang, Junfeng Ni, Diwen Wan, Gang Zeng, Siyuan Huang

机构 * State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) State Key Laboratory of General Artificial Intelligence, BIGAI(BIGAI 通用人工智能国家重点实验室) Tsinghua University(清华大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted by ICCV 2025.Project page: https://jason-aplp.github.io/TACO

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15580 2025-08-05 cs.CV 57%

TKG-DM: Training-free Chroma Key Content Generation Diffusion Model

Ryugo Morita, Stanislav Frolov, Brian Bernhard Moser, Takahiro Shirakawa, Ko Watanabe, Andreas Dengel, Jinjia Zhou

机构 * Faculty of Science and Engineering(科学与工程学部) RPTU Kaiserslautern-Landau & DFKI GmbH(科隆-兰道大学与DFKI GmbH)

专题命中 视频扩散模型 :text-to-video(abstract);分类 cs.CV

Comments Accepted to CVPR2025(Highlight). Code at: https://github.com/ryugo417/TKG-DM

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20158 2025-07-29 cs.CV 57%

AnimeColor: Reference-based Animation Colorization with Diffusion Transformers

Yuhong Zhang, Liyao Wang, Han Wang, Danni Wu, Zuzeng Lin, Feng Wang, Li Song

机构 * Shanghai Jiao Tong University(上海交通大学) Tianjin University(天津大学) Communication University of China(中国通信大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08714 2025-07-29 cs.CV cs.AI 57%

Versatile Multimodal Controls for Expressive Talking Human Animation

Zheng Qin, Ruobing Zheng, Yabing Wang, Tianqi Li, Zixin Zhu, Sanping Zhou, Ming Yang, Le Wang

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi'an Jiaotong University, Ant Group(人机混合增强智能国家级实验室,西安交通大学,蚂蚁集团) National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi'an Jiaotong University(人机混合增强智能国家级实验室,西安交通大学) University at Buffalo(布法罗大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted by ACM MM2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03456 2025-07-29 cs.CV 57%

LM-Gaussian: Boost Sparse-view 3D Gaussian Splatting with Large Model Priors

Hanyang Yu, Xiaoxiao Long, Ping Tan

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project page: https://hanyangyu1021.github.io/lm-gaussian.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15064 2025-07-22 cs.CV cs.AI 57%

StableAnimator++: Overcoming Pose Misalignment and Face Distortion for Human Image Animation

Shuyuan Tu, Zhen Xing, Xintong Han, Zhi-Qi Cheng, Qi Dai, Chong Luo, Zuxuan Wu, Yu-Gang Jiang

机构 * School of Computer Science, Fudan University(复旦大学计算机科学学院) Microsoft Research Asia(微软亚洲研究院) Tencent Inc.(腾讯公司) University of Washington(华盛顿大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments arXiv admin note: substantial text overlap with arXiv:2411.17697

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05763 2025-07-09 cs.CV 57%

DreamArt: Generating Interactable Articulated Objects from a Single Image

Ruijie Lu, Yu Liu, Jiaxiang Tang, Junfeng Ni, Yuxiang Wang, Diwen Wan, Gang Zeng, Yixin Chen, Siyuan Huang

机构 * State Key Lab of General AI, Peking University(北京大学通用人工智能国家重点实验室) Tsinghua University(清华大学) State Key Lab of General AI, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01717 2025-07-09 cs.CV 57%

Driving View Synthesis on Free-form Trajectories with Generative Prior

Zeyu Yang, Zijie Pan, Yuankun Yang, Xiatian Zhu, Li Zhang

机构 * Fudan University(复旦大学) University of Surrey(Surrey大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05198 2025-07-08 cs.RO cs.AI cs.CV 57%

EmbodieDreamer: Advancing Real2Sim2Real Transfer for Policy Training via Embodied World Modeling

Boyuan Wang, Xinpan Meng, Xiaofeng Wang, Zheng Zhu, Angen Ye, Yang Wang, Zhiqin Yang, Chaojun Ni, Guan Huang, Xingang Wang

机构 * GigaAI Institute of Automation, Chinese Academy of Sciences(自动化研究所) Peking University(北京大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project Page: https://embodiedreamer.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01380 2025-07-08 cs.CV cs.AI 57%

Playing with Transformer at 30+ FPS via Next-Frame Diffusion

Xinle Cheng, Tianyu He, Jiayi Xu, Junliang Guo, Di He, Jiang Bian

机构 * Peking University(北京大学) Microsoft Research(微软研究院)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Project page: https://nextframed.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02299 2025-07-04 cs.CV 57%

DreamComposer++: Empowering Diffusion Models with Multi-View Conditions for 3D Content Generation

Yunhan Yang, Shuo Chen, Yukun Huang, Xiaoyang Wu, Yuan-Chen Guo, Edmund Y. Lam, Hengshuang Zhao, Tong He, Xihui Liu

机构 * The University of Hong Kong(香港大学) Tsinghua University(清华大学) Vast Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted by TPAMI, extension of CVPR 2024 paper DreamComposer

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04320 2025-07-03 cs.CV cs.LG 57%

ConceptAttention: Diffusion Transformers Learn Highly Interpretable Features

Alec Helbling, Tuna Han Salih Meral, Ben Hoover, Pinar Yanardag, Duen Horng Chau

机构 * ibm(IBM研究院)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments Oral Presentation at ICML 2025, Best Paper Award at CVPR Workshop on Visual Concepts

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05255 2025-07-02 cs.CV cs.LG 57%

Bridging SFT and DPO for Diffusion Model Alignment with Self-Sampling Preference Optimization

Daoan Zhang, Guangchen Lan, Dong-Jun Han, Wenlin Yao, Xiaoman Pan, Hongming Zhang, Mingxiao Li, Pengcheng Chen, Yu Dong, Christopher Brinton, Jiebo Luo

机构 * University of Rochester(罗切斯特大学) Purdue University(普渡大学) Yonsei University(延世大学) Tencent AI Lab(腾讯AI实验室) University of Washington(华盛顿大学)

专题命中 视频扩散模型 :text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10507 2025-07-01 cs.GR cs.CV 57%

Edit360: 2D Image Edits to 3D Assets from Any Angle

Junchao Huang, Xinting Hu, Shaoshuai Shi, Zhuotao Tian, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Nanyang Technological University(南洋理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Voyager Research, Didi Chuxing(Voyager Research与滴滴出行)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22298 2025-06-30 cs.CV 57%

OutDreamer: Video Outpainting with a Diffusion Transformer

Linhao Zhong, Fan Li, Yi Huang, Jianzhuang Liu, Renjing Pei, Fenglong Song

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院)

专题命中 视频扩散模型 :long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21270 2025-06-27 cs.CV 57%

Video Virtual Try-on with Conditional Diffusion Transformer Inpainter

Cheng Zou, Senlin Cheng, Bolei Xu, Dandan Zheng, Xiaobo Li, Jingdong Chen, Ming Yang

机构 * Ant Group(蚂蚁集团)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20946 2025-06-27 cs.GR cs.AI cs.CV 57%

Consistent Zero-shot 3D Texture Synthesis Using Geometry-aware Diffusion and Temporal Video Models

Donggoo Kang, Jangyeong Kim, Dasol Jeong, Junyoung Choi, Jeonga Wi, Hyunmin Lee, Joonho Gwon, Joonki Paik

机构 * Department of Image, Chung-Ang University(Chung-Ang大学图像系) Graphics AI Lab, NCSOFT(NCSOFT图形AI实验室) Department of Computer Science, University of Seoul(首尔大学计算机科学系)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19851 2025-06-25 cs.CV 57%

AnimaX: Animating the Inanimate in 3D with Joint Video-Pose Diffusion Models

Zehuan Huang, Haoran Feng, Yangtian Sun, Yuanchen Guo, Yanpei Cao, Lu Sheng

机构 * Beihang University(北航) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project page: https://anima-x.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19798 2025-06-25 cs.CV 57%

CoCo4D: Comprehensive and Complex 4D Scene Generation

Junwei Zhou, Xueting Li, Lu Qi, Ming-Hsuan Yang

机构 * Huazhong University of Science and Technology(华中科技大学) NVIDIA Wuhan University(武汉大学) Insta360 Research(Insta360研究院) UC Merced(加州大学默塞德分校)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments 16 pages,10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07497 2025-06-23 cs.CV 57%

Genesis: Multimodal Driving Scene Generation with Spatio-Temporal and Cross-Modal Consistency

Xiangyu Guo, Zhanqian Wu, Kaixin Xiong, Ziyang Xu, Lijun Zhou, Gangwei Xu, Shaoqing Xu, Haiyang Sun, Bing Wang, Guang Chen, Hangjun Ye, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米电动车)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15673 2025-06-19 cs.CV 57%

UniRelight: Learning Joint Decomposition and Synthesis for Video Relighting

Kai He, Ruofan Liang, Jacob Munkberg, Jon Hasselgren, Nandita Vijaykumar, Alexander Keller, Sanja Fidler, Igor Gilitschenski, Zan Gojcic, Zian Wang

机构 * NVIDIA University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project page: https://research.nvidia.com/labs/toronto-ai/UniRelight/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13754 2025-06-18 cs.LG cs.AI cs.CV 57%

VideoPDE: Unified Generative PDE Solving via Video Inpainting Diffusion Models

Edward Li, Zichen Wang, Jiahe Huang, Jeong Joon Park

机构 * University of Michigan(密歇根大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project page: https://videopde.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08529 2025-06-11 cs.CV 57%

LiftVSR: Lifting Image Diffusion to Video Super-Resolution via Hybrid Temporal Modeling with Only 4$\times$RTX 4090s

Xijun Wang, Xin Li, Bingchen Li, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频扩散模型 :long video(abstract);分类 cs.CV

Comments Project page: https://kopperx.github.io/projects/liftvsr

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08351 2025-06-11 cs.CV cs.AI cs.CL 57%

How Much To Guide: Revisiting Adaptive Guidance in Classifier-Free Guidance Text-to-Vision Diffusion Models

Huixuan Zhang, Junzhe Zhang, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王玄计算技术研究所)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08004 2025-06-10 cs.CV cs.AI 57%

Dynamic View Synthesis as an Inverse Problem

Hidir Yesiltepe, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project Page: https://inverse-dvs.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14831 2025-06-10 cs.CV cs.AI cs.LG 57%

Improving the Diffusability of Autoencoders

Ivan Skorokhodov, Sharath Girish, Benran Hu, Willi Menapace, Yanyu Li, Rameen Abdal, Sergey Tulyakov, Aliaksandr Siarohin

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06199 2025-06-09 cs.RO cs.CV 57%

3DFlowAction: Learning Cross-Embodiment Manipulation from 3D Flow World Model

Hongyan Zhi, Peihao Chen, Siyuan Zhou, Yubo Dong, Quanxi Wu, Lei Han, Mingkui Tan

机构 * South China University of Technology(南方科技大学) Tencent Robotics X(腾讯机器人实验室) Hong Kong University of Science and Technology(香港科学与技术大学) Pazhou Laboratory(琶洲实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏