arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6781 信号源:cs.CV, eess.IV, cs.MM

1. 视频扩散模型 1305 篇

2512.01481 2025-12-02 cs.CV 57%

ChronosObserver: Taming 4D World with Hyperspace Diffusion Sampling

ChronosObserver: 用超空间扩散采样驯服4D世界

Qisen Wang, Yifan Zhao, Peisen Shen, Jialu Li, Jia Li

机构 * State Key Laboratory of Virtual Reality Technology and Systems, SCSE, Beihang University(虚拟现实技术与系统国家重点实验室,北京航空航天大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 ChronosObserver通过超空间表示和引导采样,实现无需训练的高质量多视角时间同步视频生成,解决4D世界生成难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00532 2025-12-02 cs.CV cs.RO 57%

Image Generation as a Visual Planner for Robotic Manipulation

图像生成作为机器人操作的视觉规划器

Ye Pang

机构 * Southern China University of Technology(华南理工大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出利用图像生成模型作为机器人视觉规划器,通过轻度微调实现时间连贯的机器人操作视频生成。

Comments 11 pages 9 figures Under review at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23886 2025-12-02 cs.CV 57%

Generating Fit Check Videos with a Handheld Camera

使用手持相机生成符合检查的视频

Bowei Chen, Brian Curless, Ira Kemelmacher-Shlizerman, Steven M. Seitz

机构 * University of Washington(华盛顿大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种基于视频扩散模型的方法,利用手持设备和静态照片生成逼真的全身视频,通过多参考注意力机制和图像微调策略提升视频真实感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18255 2025-11-27 cs.CV 57%

Sequence-Adaptive Video Prediction in Continuous Streams using Diffusion Noise Optimization

基于扩散噪声优化的连续流序列适应视频预测

Sina Mokhtarzadeh Azar, Emad Bahrami, Enrico Pallotta, Gianpiero Francesca, Radu Timofte, Juergen Gall

机构 * University of Bonn(波恩大学) Toyota Motor Europe(丰田欧洲公司) University of Wuerzburg(乌尔姆大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔人工智能与机器学习研究所)

专题命中 视频扩散模型 :long video(abstract);分类 cs.CV

AI总结 本文提出了一种基于扩散噪声优化的连续流序列适应视频预测方法,通过在推理过程中细化扩散噪声以提升视频预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16565 2025-11-26 cs.CV 57%

M2SVid: End-to-End Inpainting and Refinement for Monocular-to-Stereo Video Conversion

M2SVid:单目到立体视频转换的端到端修复与细化

Nina Shvetsova, Goutam Bhat, Prune Truong, Hilde Kuehne, Federico Tombari

机构 * Google(谷歌) Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学) Goethe University Frankfurt(法兰克福歌德大学) MPI for Informatics, Saarland Informatics Campus(信息研究所,萨尔兰信息校区) Technical University of Munich(慕尼黑技术大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 M2SVid通过端到端修复和细化技术,实现单目到立体视频转换,生成高质量右视图并提升效率。

Comments To be published at 3DV 2026, project webpage https://m2svid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18786 2025-11-25 cs.CV 57%

STCDiT: Spatio-Temporally Consistent Diffusion Transformer for High-Quality Video Super-Resolution

STCDiT:一种时空一致的扩散变换器用于高质量视频超分辨率

Junyang Chen, Jiangxin Dong, Long Sun, Yixin Yang, Jinshan Pan

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院,南京理工大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 STCDiT通过结合运动感知的VAE重建和锚帧指导方法,实现了高质量视频超分辨率,提升了结构保真度和时间一致性。

Comments Project page: https://jychen9811.github.io/STCDiT_page

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14208 2025-11-25 cs.CV 57%

InstantViR: Real-Time Video Inverse Problem Solver with Distilled Diffusion Prior

InstantViR: 基于蒸馏扩散先验的实时视频逆问题求解器

Weimin Bai, Suzhe Xu, Yiwei Ren, Jinhua Hao, Ming Sun, Wenzheng Chen, He Sun

机构 * Peking University(北京大学) Huaqiao University(华侨大学) Kuaishou Technology(快手科技)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

AI总结 InstantViR通过蒸馏扩散先验实现高效实时视频重建,以35 FPS速度在NVIDIA A100 GPU上达到与基线相当的重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23584 2025-11-21 cs.CV 57%

VividFace: High-Quality and Efficient One-Step Diffusion For Video Face Enhancement

VividFace: 高质量和高效的一步扩散用于视频面部增强

Shulian Zhang, Yong Guo, Long Peng, Ziyang Wang, Ye Chen, Wenbo Li, Xiao Zhang, Yulun Zhang, Jian Chen

机构 * South China University of Technology(华南理工大学) Max Planck Institute for Informatics(马克斯·普朗克研究所(信息学)) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) Nanjing University of Science and Technology(南京理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 VividFace通过单步扩散框架和联合训练策略,高效提升视频面部增强的高质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24006 2025-11-20 cs.LG cs.AI cs.CV 57%

SLA: Beyond Sparsity in Diffusion Transformers via Fine-Tunable Sparse-Linear Attention

Jintao Zhang, Haoxu Wang, Kai Jiang, Shuo Yang, Kaiwen Zheng, Haocheng Xi, Ziteng Wang, Hongzhou Zhu, Min Zhao, Ion Stoica, Joseph E. Gonzalez, Jun Zhu, Jianfei Chen

机构 * Tsinghua University(清华大学) UC Berkeley(伯克利大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13121 2025-11-18 cs.CV 57%

CloseUpShot: Close-up Novel View Synthesis from Sparse-views via Point-conditioned Diffusion Model

Yuqi Zhang, Guanying Chen, Jiaxing Chen, Chuanyu Fu, Chuan Huang, Shuguang Cui

机构 * Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来网络智能研究院(FNii-深圳)) Chinese University of Hong Kong at Shenzhen (CUHKSZ)(香港中文大学(深圳)) Sun Yat-sen University(中山大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project Link: https://zyqz97.github.io/CloseUpShot/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03457 2025-11-18 cs.GR cs.CV cs.SD eess.AS 57%

READ: Real-time and Efficient Asynchronous Diffusion for Audio-driven Talking Head Generation

Haotian Wang, Yuzhe Weng, Jun Du, Haoran Xu, Xiaoyan Wu, Shan He, Bing Yin, Cong Liu, Jianqing Gao, Qingfeng Liu

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project page: https://readportrait.github.io/READ/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01895 2025-11-18 cs.RO cs.CV cs.LG 57%

EnerVerse: Envisioning Embodied Future Space for Robotics Manipulation

Siyuan Huang, Liliang Chen, Pengfei Zhou, Shengcong Chen, Zhengkai Jiang, Yue Hu, Yue Liao, Peng Gao, Hongsheng Li, Maoqing Yao, Guanghui Ren

机构 * SJTU(上海交通大学) AgiBot Shanghai AI Lab(上海人工智能实验室) CUHK MMLab(香港大学多模态实验室) LV-NUS Lab(南洋理工大学-立陶宛实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted by NeurIPS 2025. Website: https://sites.google.com/view/enerverse

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11213 2025-11-17 cs.CV 57%

RealisticDreamer: Guidance Score Distillation for Few-shot Gaussian Splatting

Ruocheng Wu, Haolan He, Yufei Wang, Zhihao Li, Bihan Wen

机构 * University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05314 2025-11-14 cs.RO cs.AI cs.CV 57%

ManipDreamer3D : Synthesizing Plausible Robotic Manipulation Video with Occupancy-aware 3D Trajectory

Ying Li, Xiaobao Wei, Xiaowei Chi, Yuming Li, Zhongyu Zhao, Hao Wang, Ningning Ma, Ming Lu, Sirui Han, Shanghang Zhang

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments 7pages; 7figures; 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20756 2025-11-11 cs.CV 57%

StereoDiff: Stereo-Diffusion Synergy for Video Depth Estimation

Haodong Li, Chen Wang, Jiahui Lei, Kostas Daniilidis, Lingjie Liu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Pennsylvania(宾夕法尼亚大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Work done in Nov 2024, during an internship at the University of Pennsylvania. Project page: https://stereodiff.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08239 2025-11-11 cs.GR cs.CV 57%

ACT-R: Adaptive Camera Trajectories for Single View 3D Reconstruction

Yizhi Wang, Mingrui Zhao, Hao Zhang

机构 * Simon Fraser University(西蒙弗雷泽大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments 3DV 2026, Project Page: https://mingrui-zhao.github.io/ACT-R/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16239 2025-11-07 cs.CV 57%

DOVE: Efficient One-Step Diffusion Model for Real-World Video Super-Resolution

Zheng Chen, Zichen Zou, Kewei Zhang, Xiongfei Su, Xin Yuan, Yong Guo, Yulun Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Zhiyuan College, Shanghai Jiao Tong University(上海交通大学紫阳学院) China Mobile Research Institute(中国移动研究院) Westlake University(西湖大学) Huawei Consumer Business Group(华为消费者业务集团)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2025. Code is available at: https://github.com/zhengchen1999/DOVE

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05635 2025-11-05 cs.RO cs.CV 57%

Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation

Yue Liao, Pengfei Zhou, Siyuan Huang, Donglin Yang, Shengcong Chen, Yuxin Jiang, Yue Hu, Jingbin Cai, Si Liu, Jianlan Luo, Liliang Chen, Shuicheng Yan, Maoqing Yao, Guanghui Ren

机构 * AgiBot Genie Team(AgiBot Genie团队) LV-NUS Lab(LV-NUS实验室) BUAA(北京航空航天大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments https://genie-envisioner.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24448 2025-11-04 cs.CV cs.AI 57%

Rethinking Visual Intelligence: Insights from Video Pretraining

Pablo Acuaviva, Aram Davtyan, Mariam Hassan, Sebastian Stapf, Ahmad Rahimi, Alexandre Alahi, Paolo Favaro

机构 * Computer Vision Group, University of Bern(伯尔尼大学计算机视觉组) VITA Lab, EPFL(苏黎世联邦理工学院VITA实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Updated version from preprint arXiv:2506.07280 (Gen2Gen) focused on visual intelligence. This work can be considered as v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08271 2025-11-04 cs.GR cs.CV cs.LG 57%

SViM3D: Stable Video Material Diffusion for Single Image 3D Generation

Andreas Engelhardt, Mark Boss, Vikram Voleti, Chun-Han Yao, Hendrik P. A. Lensch, Varun Jampani

机构 * Stability AI University of Tübingen(图宾根大学)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Accepted by International Conference on Computer Vision (ICCV 2025). Project page: http://svim3d.aengelhardt.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23402 2025-10-17 cs.CV 57%

WorldSplat: Gaussian-Centric Feed-Forward 4D Scene Generation for Autonomous Driving

Ziyue Zhu, Zhanqian Wu, Zhenxin Zhu, Lijun Zhou, Haiyang Sun, Bing Wan, Kun Ma, Guang Chen, Hangjun Ye, Jin Xie, jian Yang

机构 * Nankai University(南开大学) Nanjing University, Suzhou(南京大学苏州校区)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13678 2025-10-16 cs.CV 57%

FlashWorld: High-quality 3D Scene Generation within Seconds

Xinyang Li, Tengfei Wang, Zixiao Gu, Shengchuan Zhang, Chunchao Guo, Liujuan Cao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) Tencent(腾讯) Yes Lab, Fudan University(复旦大学Yes实验室)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments Project Page: https://imlixinyang.github.io/FlashWorld-Project-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07654 2025-10-10 cs.CV 57%

Once Is Enough: Lightweight DiT-Based Video Virtual Try-On via One-Time Garment Appearance Injection

Yanjie Pan, Qingdong He, Lidong Wang, Bo Peng, Mingmin Chi

机构 * School of computer science, Shanghai key laboratory of data science, Fudan University, China(计算机学院、数据科学重点实验室、复旦大学) Tencent Youtu Lab, China(腾讯优图实验室) Shanghai Ocean University, China(上海海洋大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 5 pages (including references), 4 figures. Code and models will be released upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15742 2025-10-10 cs.CV 57%

Uncertainty-Aware Diffusion Guided Refinement of 3D Scenes

Sarosij Bose, Arindam Dutta, Sayak Nag, Junge Zhang, Jiachen Li, Konstantinos Karydis, Amit K. Roy Chowdhury

机构 * University of California, Riverside, USA(加州大学河滨分校)

专题命中 视频扩散模型 :video diffusion(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07344 2025-10-09 cs.CV cs.AI 57%

Generative Pre-trained Autoregressive Diffusion Transformer

Yuan Zhang, Jiacheng Jiang, Guoqing Ma, Zhiying Lu, Haoyang Huang, Jianlong Yuan, Nan Duan, Daxin Jiang

机构 * University of Science and Technology of China(中国科学技术大学) StepFun, China(StepFun)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24210 2025-10-02 cs.CV cs.NA math.NA 57%

STORK: Faster Diffusion And Flow Matching Sampling By Resolving Both Stiffness And Structure-Dependence

Zheng Tan, Weizhen Wang, Andrea L. Bertozzi, Ernest K. Ryu

机构 * Department of Mathematics, University of California, Los Angeles(数学系,加州大学洛杉矶分校) Department of Computer Science, University of California, Los Angeles(计算机科学系,加州大学洛杉矶分校)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24416 2025-09-30 cs.CV cs.AI 57%

CLQ: Cross-Layer Guided Orthogonal-based Quantization for Diffusion Transformers

Kai Liu, Shaoqiu Zhang, Linghe Kong, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 10 pages, 5 figures. Code is released at https://github.com/Kai-Liu001/CLQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06040 2025-09-30 cs.CV cs.AI cs.LG 57%

BranchGRPO: Stable and Efficient GRPO with Structured Branching in Diffusion Models

Yuming Li, Yikai Wang, Yuying Zhu, Zhongyu Zhao, Ming Lu, Qi She, Shanghang Zhang

机构 * Peking University(北京大学) Beijing Normal University(北京师范大学) ByteDance(字节跳动)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19838 2025-09-30 cs.CV 57%

SimpleGVR: A Simple Baseline for Latent-Cascaded Video Super-Resolution

Liangbin Xie, Yu Li, Shian Du, Menghan Xia, Xintao Wang, Fanghua Yu, Ziyan Chen, Pengfei Wan, Jiantao Zhou, Chao Dong

机构 * State Key Laboratory of Internet of Things for Smart City, University of Macau(澳门大学物联网智能城市国家重点实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) Tsinghua University(清华大学) Kuaishou Technology(快手科技) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12053 2025-09-30 cs.CV cs.AI 57%

VFRTok: Variable Frame Rates Video Tokenizer with Duration-Proportional Information Assumption

Tianxiong Zhong, Xingye Tian, Boyuan Jiang, Xuebo Wang, Xin Tao, Pengfei Wan, Zhiwei Zhang

机构 * Beijing Institute of Technology(北京理工大学) Kling Team(Kling团队)

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

Comments 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏