arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6781 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1305 篇

2503.15996 2025-03-21 cs.GR cs.CV 74%

Animating the Uncaptured: Humanoid Mesh Animation with Video Diffusion Models

Marc Benedí San Millán, Angela Dai, Matthias Nießner

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10634 2025-03-18 cs.CV 74%

V2Edit: Versatile Video Diffusion Editor for Videos and 3D Scenes

Yanming Zhang, Jun-Kun Chen, Jipeng Lyu, Yu-Xiong Wang

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

Comments Project Website: https://immortalco.github.io/V2Edit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00733 2025-03-14 cs.CV cs.GR cs.LG 74%

Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer

Jiahao Cui, Hui Li, Yun Zhan, Hanlin Shang, Kaihui Cheng, Yuqi Ma, Shan Mu, Hang Zhou, Jingdong Wang, Siyu Zhu

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15191 2025-03-12 cs.CV cs.LG cs.SD eess.AS 74%

AV-Link: Temporally-Aligned Diffusion Features for Cross-Modal Audio-Video Generation

Moayed Haji-Ali, Willi Menapace, Aliaksandr Siarohin, Ivan Skorokhodov, Alper Canberk, Kwot Sin Lee, Vicente Ordonez, Sergey Tulyakov

专题命中 视频扩散模型 :video generation(title);分类 cs.CV

Comments Project Page: snap-research.github.io/AVLink/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14531 2024-12-20 cs.CV 74%

Consistent Human Image and Video Generation with Spatially Conditioned Diffusion

Mingdeng Cao, Chong Mou, Ziyang Yuan, Xintao Wang, Zhaoyang Zhang, Ying Shan, Yinqiang Zheng

专题命中 视频扩散模型 :video generation(title);分类 cs.CV

Comments Project page: https://github.com/ljzycmd/SCD

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16726 2024-12-17 cs.CV cs.AI 74%

EmotiveTalk: Expressive Talking Head Generation through Audio Information Decoupling and Emotional Video Diffusion

Haotian Wang, Yuzhe Weng, Yueyan Li, Zilu Guo, Jun Du, Shutong Niu, Jiefeng Ma, Shan He, Xiaoyan Wu, Qiming Hu, Bing Yin, Cong Liu, Qingfeng Liu

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

Comments https://emotivetalk.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04462 2024-12-06 cs.CV 74%

4Real-Video: Learning Generalizable Photo-Realistic 4D Video Diffusion

Chaoyang Wang, Peiye Zhuang, Tuan Duc Ngo, Willi Menapace, Aliaksandr Siarohin, Michael Vasilkovsky, Ivan Skorokhodov, Sergey Tulyakov, Peter Wonka, Hsin-Ying Lee

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

Comments Project page: https://snap-research.github.io/4Real-Video/

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17405 2024-09-25 cs.CV 74%

Human4DiT: 360-degree Human Video Generation with 4D Diffusion Transformer

Ruizhi Shao, Youxin Pang, Zerong Zheng, Jingxiang Sun, Yebin Liu

专题命中 视频扩散模型 :video generation(title);分类 cs.CV

Comments Our project website is https://human4dit.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10285 2024-07-16 cs.CV 74%

Noise Calibration: Plug-and-play Content-Preserving Video Enhancement using Pre-trained Video Diffusion Models

Qinyu Yang, Haoxin Chen, Yong Zhang, Menghan Xia, Xiaodong Cun, Zhixun Su, Ying Shan

专题命中 视频扩散模型 :video diffusion(title);分类 cs.CV

Comments ECCV 2024, Project Page: https://yangqy1110.github.io/NC-SDEdit/, Code Repo: https://github.com/yangqy1110/NC-SDEdit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.16371 2023-08-01 cs.CV 74%

MobileVidFactory: Automatic Diffusion-Based Social Media Video Generation for Mobile Devices from Text

Junchen Zhu, Huan Yang, Wenjing Wang, Huiguo He, Zixi Tuo, Yongsheng Yu, Wen-Huang Cheng, Lianli Gao, Jingkuan Song, Jianlong Fu, Jiebo Luo

专题命中 视频扩散模型 :video generation(title);分类 cs.CV

Comments Accepted by ACM-MM 2023 demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00874 2026-07-28 cs.CV cs.AI cs.LG cs.MM 73%

Latent Space Probing for Adult Content Detection in Video Generative Models

潜在空间探测用于视频生成模型中的成人内容检测

Alizishaan Khatri, Chiquita Prabhu

机构 * Wrynx Inc.(Wrynx公司) Independent Researcher(独立研究者)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV、cs.MM

AI总结 本文提出一种潜在空间探测框架,通过拦截视频扩散模型生成过程中的去噪潜在表示,利用轻量级分类器实现实时成人内容检测,实验表明潜在空间信号在有害内容检测中具有强判别能力。

Comments To be published in 2026 56th Annual IEEE International Conference on Dependable Systems and Networks Workshops (DSN-W)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03355 2026-07-03 cs.CV cs.LG eess.IV 73%

Rethinking Video Super-Resolution: Towards Diffusion-Based Methods without Motion Alignment

重新思考视频超分辨率:基于扩散的方法无需运动对齐

Zhihao Zhan, Wang Pang, Xiang Zhu, Yechao Bai

机构 * TopXGun Robotics(TopXGun机器人研究所) Nanjing University(南京大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV、eess.IV

AI总结 本文提出基于扩散后验采样框架的视频超分辨率方法,无需显式估计光流或运动参数,通过学习现实物理规律来处理多种运动模式,实验证明其有效性。

Comments ICSPS 2025

Journal ref 17th International Conference on Signal Processing Systems (ICSPS), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05442 2025-08-05 cs.CV cs.AI eess.IV 73%

Progressive Growing of Video Tokenizers for Temporally Compact Latent Spaces

Aniruddha Mahapatra, Long Mai, David Bourgin, Yitian Zhang, Feng Liu

机构 * Adobe Research(Adobe研究院) Northeastern University(东北大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV、eess.IV

Comments Project website: https://progressive-video-tokenizer.github.io/Pro-MAG/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10002 2025-06-13 cs.MM cs.AI cs.CV cs.RO 73%

EQ-TAA: Equivariant Traffic Accident Anticipation via Diffusion-Based Accident Video Synthesis

Jianwu Fang, Lei-Lei Li, Zhedong Zheng, Hongkai Yu, Jianru Xue, Zhengguo Li, Tat-Seng Chua

机构 * Xi’an Jiaotong University(西安交通大学) University of Macau(澳门大学) National University of Singapore(新加坡国立大学) Department of Electrical Engineering and Computer Science, Cleveland State University(克莱姆森大学电气工程与计算机科学系) Institute for Infocomm Research, Agency for Science, Technology and Research (A ∗ STAR)(信息与通信研究机构,科技研究局)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV、cs.MM

Comments Accepted by IEEE-TMM

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18837 2023-12-01 cs.CV cs.AI cs.LG cs.MM 73%

VIDiff: Translating Videos via Multi-Modal Instructions with Diffusion Models

Zhen Xing, Qi Dai, Zihao Zhang, Hui Zhang, Han Hu, Zuxuan Wu, Yu-Gang Jiang

专题命中 视频扩散模型 :video generation(abstract);long video(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07131 2023-10-12 eess.IV cs.CV 73%

Echocardiography video synthesis from end diastolic semantic map via diffusion model

Phi Nguyen Van, Duc Tran Minh, Hieu Pham Huy, Long Tran Quoc

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.05464 2023-05-10 cs.CV cs.MM 73%

Style-A-Video: Agile Diffusion for Arbitrary Text-based Video Style Transfer

Nisha Huang, Yuxin Zhang, Weiming Dong

专题命中 视频扩散模型 :video diffusion(abstract);text-to-video(abstract);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08558 2026-08-11 cs.RO 新提交 71%

Vid2WAM: Distilling Video Diffusion Priors into World Action Models

Vid2WAM:将视频扩散先验蒸馏为世界动作模型

Chenhao Qiu, Ruixiang Wang, Runyi Zhao, Sixu Lin, Songen Gu, Shufeng Nan, Guiliang Liu, Kui Jia, Yanwei Fu, Simo Wu

专题命中 视频扩散模型 :video diffusion(title)

AI总结 Vid2WAM是将视频扩散先验蒸馏为WAM的离线框架,通过双监督通道与源感知残差动作适配,提升了机器人策略的新任务泛化性与数据效率,且推理高效。

Comments Project website: https://qch-fa.github.io/vid2wam-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17631 2025-08-28 cs.LG cs.AI 71%

ControlEchoSynth: Boosting Ejection Fraction Estimation Models via Controlled Video Diffusion

Nima Kondori, Hanwen Liang, Hooman Vaseli, Bingyu Xie, Christina Luong, Purang Abolmaesumi, Teresa Tsang, Renjie Liao

机构 * The University of British Columbia(不列颠哥伦比亚大学) University of Toronto(多伦多大学) Vancouver General Hospital, Vancouver, BC, Canada(温哥华总医院)

专题命中 视频扩散模型 :video diffusion(title)

Comments Data Curation and Augmentation in Medical Imaging CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04546 2026-08-20 cs.RO cs.AI cs.CV cs.LG 版本更新 70%

Mask2Real-WM: Segmentation Masks as a Sim-to-Real Bridge for Controllable Dexterous World Models

Mask2Real-WM:作为可控灵巧世界模型的模拟到现实桥梁的分割掩码

Riccardo O. Feingold, Davide Liconti, Chenyu Yang, Robert K. Katzschmann

机构 * Soft Robotic Lab, Department of Mechanical and Process Engineering ETH Zurich, Switzerland(苏黎世联邦理工学院机械与过程工程系软机器人实验室)

专题命中 视频扩散模型 :video diffusion(abstract,abstract_cn);分类 cs.CV

AI总结 提出Mask2Real-WM,一种用于灵巧操纵的两阶段动作条件世界模型,将像素预测解耦为动力学和渲染模型,利用分割空间较小的模拟到现实差距,通过合成数据预训练和真实演示微调实现各自由度动作可控。

Comments 23 pages, 24 figures, 4 tables. Preprint. Project page: https://srl-ethz.github.io/Mask2Real-WM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13357 2026-08-06 cs.CV cs.AI 版本更新 70%

AdaCorrection: Adaptive Offset Cache Correction for Accurate Diffusion Transformers

AdaCorrection: 用于准确扩散变换器的自适应偏移缓存校正

Dong Liu, Yanxuan Yu, Ben Lengerich, Ying Nian Wu

机构 * Columbia University(哥伦比亚大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出AdaCorrection框架,通过自适应偏移缓存校正提升扩散变换器的生成质量与缓存复用效率,减少计算开销并保持高保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01127 2026-08-05 cs.CV 版本更新 70%

MiniWorld: Democratizing the Training of Video World Models from Scratch

MiniWorld:从零开始普及视频世界模型的训练

Yian Zhao, Ruochong Zheng, Hongcan Guo, Yu Yan, Jian Zhang, Jie Chen

机构 * Peking University(北京大学)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 MiniWorld是从零开始训练流式视频世界模型的可复现框架,采用特定模型与训练策略,可在单台8-GPU服务器数天内完成训练,旨在降低训练门槛以推动相关研究。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22718 2026-07-31 cs.CV 版本更新 70%

Generative Relightable Avatars

生成式可重光照虚拟化身

Kunwar Maheep Singh, Christian Theobalt, Rishabh Dabral

机构 * Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息学研究所,萨尔兰信息学园区)

专题命中 视频扩散模型 :video diffusion(abstract);long video(abstract);分类 cs.CV

AI总结 提出生成式可重光照虚拟化身(GRA),结合物理光照与概率细化,实现全身人物的自由视角渲染和环境图重光照,在感知质量上优于现有方法。

Comments Project Page: https://vcai.mpi-inf.mpg.de/projects/GRA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26646 2026-07-30 cs.CV 新提交 70%

Genie Sim PanoWorld: An Infinite Indoor 3D World Generation Pipeline via Panoramic Scene Modeling and Simulation

Genie Sim PanoWorld:基于全景场景建模与仿真的无限室内3D世界生成流水线

Yongxin Su, Linjie Hou, Feng Wang, Jialin Tang, Zhijun Li, Qian Wang, Maoqing Yao

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 Genie Sim PanoWorld是两阶段前馈流水线,从单张360°全景生成可自由导航的高保真3D高斯场景,优于几何条件基线,且能零样本泛化至未见室内场景

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15284 2026-07-30 cs.CV 版本更新 70%

Walk through Paintings: Egocentric World Models from Internet Priors

穿越绘画:来自互联网先验的自我中心世界模型

Anurag Bagchi, Zhipeng Bao, Homanga Bharadhwaj, Yu-Xiong Wang, Pavel Tokmakov, Martial Hebert

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Toyota Research Institute(丰田研究机构)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 EgoWM通过利用互联网先验和轻量级条件层,将预训练视频扩散模型转换为自我中心世界模型,实现可控的未来预测,提升结构一致性评分并降低推理延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23844 2026-07-28 cs.CV 新提交 70%

OmniCache: Multidimensional Hierarchical Feature Caching For Diffusion Models

OmniCache:用于扩散模型的多维分层特征缓存

Zhaoyuan He, Muhammad Muaz, Lili Qiu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 针对高分辨率图像和视频扩散模型推理成本高的问题,提出OmniCache框架,利用中间扩散特征冗余,通过多种缓存实现多维特征重用,减少推理延迟,在多模型上取得良好效果,且无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12940 2026-07-28 cs.CV 版本更新 70%

Recurrent Autoregressive Diffusion: Global Memory Meets Local Attention

循环自回归扩散:全局记忆与局部注意力相结合

Taiye Chen, Zihan Ding, Anjian Li, Christina Zhang, Zeqi Xiao, Yisen Wang, Chi Jin

机构 * Peking University(北京大学) Princeton University(普林斯顿大学) Nanyang Technological University(南洋理工大学)

专题命中 视频扩散模型 :video generation(abstract);long video(abstract);分类 cs.CV

AI总结 研究针对超长视频生成中现有模型的不足,提出循环自回归扩散(RAD)框架,结合循环块与局部注意力,解决训练推理差距等问题,在相关数据集实验中展现出长视频生成的优越性。

Comments Published at ECCV 2026. Project page: https://yeyutaihan.github.io/recurrent-autoregressive-diffusion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21594 2026-07-24 cs.CV 新提交 70%

Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers

具有世界状态寄存器的流式多智能体自回归扩散模型

Sicheng Mo, Yuheng Li, Ziyang Leng, Krishna Kumar Singh, Bolei Zhou

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Adobe Research(Adobe研究院)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 研究多智能体交互世界模型共享状态维护难题,提出WorldWeaver模型,利用跨智能体世界状态寄存器及混合变压器设计,经双智能体我的世界视频生成实验验证,该模型能提升逻辑一致性与生成质量。

Comments Project page: https://vail-ucla.github.io/worldweaver/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20628 2026-07-24 cs.CV cs.AI 新提交 70%

RealVDeblur: One-Step Diffusion for Generalizable Real-World Video Deblurring

RealVDeblur:用于通用真实世界视频去模糊的一步扩散法

Renbiao Jin, Mingxin Yang, Yutian Chen, Junhao Zhuang, Xin Cai, Mulin Yu, Linning Xu, Wenxian Yu, Danping Zou, Shi Guo, Tianfan Xue

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) CUHK MMLab(香港中文大学多媒体实验室) CPII under InnoHK(创新香港研究院下的CPII) Tsinghua University(清华大学)

专题命中 视频扩散模型 :video diffusion(abstract);long video(abstract);分类 cs.CV

AI总结 针对真实世界视频去模糊难题,提出RealVDeblur框架。构建模糊合成管道提供数据,利用视频扩散先验恢复,采用逐帧编码并简化采样为一步生成器,还有时间窗口掩码稳定推理,在多方面表现出色且提升3D重建鲁棒性。

Comments Project page with code: https://rbjin.github.io/RealVDeblur/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19235 2026-07-20 cs.CV cs.RO 版本更新 70%

Generation Models Know Space: Unleashing Implicit 3D Priors for Scene Understanding

生成模型了解空间:解锁隐式3D先验用于场景理解

Xianjin Wu, Dingkang Liang, Tianrui Feng, Kui Xia, Yumeng Zhang, Xiaofan Li, Xiao Tan, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Baidu Inc.(百度公司)

专题命中 视频扩散模型 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出通过大规模视频生成模型的隐式空间先验提升场景理解,引入VEGA-3D框架,利用预训练视频扩散模型作为潜在世界模拟器,通过时空特征提取与语义融合增强大语言模型的几何信息,实验验证其在3D场景理解、空间推理和具身操控中的优越性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏