arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2141 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2141 篇

2512.24724 2026-01-01 cs.CV 74%

FlowBlending: Stage-Aware Multi-Model Sampling for Fast and High-Fidelity Video Generation

FlowBlending: 时序感知多模型采样用于快速且高保真的视频生成

Jibin Song, Mingi Kwon, Jaeseok Jeong, Youngjung Uh

机构 * Yonsei University(延世大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 FlowBlending通过时序感知的多模型采样策略,在保持视觉质量的同时,显著提升视频生成的推理速度和效率。

Comments Project page: https://jibin86.github.io/flowblending_project_page

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24979 2025-12-17 cs.CV 74%

Video Generation with Stable Transparency via Shiftable RGB-A Distribution Learner

通过可移动的RGB-A分布学习实现稳定的透明度视频生成

Haotian Dong, Wenjing Wang, Chen Li, Jing Lyu, Di Lin

机构 * Tianjin University(天津大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出了一种通过可移动RGB-A分布学习实现稳定透明度视频生成的方法,提升了视频质量和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14945 2025-12-16 cs.CV 74%

3D Scene Prompting for Scene-Consistent Camera-Controllable Video Generation

用于场景一致的摄像机可控视频生成的3D场景提示

JoungBin Lee, Jaewoo Jung, Jisang Han, Takuya Narihira, Kazumi Fukuda, Junyoung Seo, Sunghwan Hong, Yuki Mitsufuji, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Sony AI(索尼人工智能研究所) ETH Zürich(苏黎世联邦理工学院) Sony Group Corporation(索尼集团)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 3DScenePrompt通过双时空条件化和3D场景记忆实现场景一致且可控的视频生成,提升生成质量与摄像机控制精度。

Comments Project page : https://cvlab-kaist.github.io/3DScenePrompt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05046 2025-12-15 cs.CV 74%

FlowDirector: Training-Free Flow Steering for Precise Text-to-Video Editing

FlowDirector: 无需训练的流引导文本到视频编辑

Guangzhao Li, Yanming Yang, Chenxi Song, Chi Zhang

机构 * AGI Lab, Westlake University(西湖大学AGI实验室) Central South University(中南大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频生成 :text-to-video(title);分类 cs.CV

AI总结 FlowDirector通过直接在数据空间中建模编辑过程,无需训练和倒置步骤,实现了更精确的文本到视频编辑。

Comments Project Page is https://flowdirector-edit.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08765 2025-12-10 cs.CV 74%

Wan-Move: Motion-controllable Video Generation via Latent Trajectory Guidance

Wan-Move:通过潜在轨迹引导实现可动视频生成

Ruihang Chu, Yefei He, Zhekai Chen, Shiwei Zhang, Xiaogang Xu, Bin Xia, Dingdong Wang, Hongwei Yi, Xihui Liu, Hengshuang Zhao, Yu Liu, Yingya Zhang, Yujiu Yang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) Tsinghua University(清华大学) HKU(香港大学) CUHK(香港中文大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 Wan-Move通过潜在轨迹引导实现视频生成的精确运动控制,无需修改架构即可提升运动可控性。

Comments NeurlPS 2025. Code and data available at https://github.com/ali-vilab/Wan-Move

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08577 2025-12-10 cs.CV cs.AI cs.LG cs.RO 74%

Disturbance-Free Surgical Video Generation from Multi-Camera Shadowless Lamps for Open Surgery

多摄像头无影灯下开放式手术的干扰自由视频生成

Yuna Kato, Shohei Mori, Hideo Saito, Yoshifumi Takatsume, Hiroki Kajita, Mariko Isogawa

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出了一种自动化方法,通过识别照明系统移动并重新对齐视频帧,生成无遮挡的开放式手术视频,提升手术区域的可视化效果和观看舒适度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06723 2025-12-10 cs.CV 74%

Zo3T: Zero-Shot 3D-Aware Trajectory-Guided Image-to-Video Generation via Test-Time Training

Zo3T: 无监督3D感知轨迹引导图像到视频生成 via 测试时间训练

Ruicheng Zhang, Jun Zhou, Zunnan Xu, Zihao Liu, Jiehui Huang, Mingyang Zhang, Yu Sun, Xiu Li

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 Zo3T通过引入3D感知运动投影、轨迹引导测试时间LoRA和指导场校正,提升了轨迹引导图像到视频生成的3D真实感和运动准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01677 2025-12-02 cs.CV 74%

Open-world Hand-Object Interaction Video Generation Based on Structure and Contact-aware Representation

基于结构和接触感知表示的开放世界手-物体交互视频生成

Haodong Yan, Hang Yu, Zhide Zhong, Weilin Yuan, Xin Gong, Zehang Luo, Chengxi Heyu, Junfeng Li, Wenxuan Song, Shunbo Zhou, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文提出一种结构和接触感知表示,用于生成逼真的手-物体交互视频,通过联合生成范式提升开放世界场景下的交互物理建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21579 2025-12-01 cs.CV 74%

Harmony: Harmonizing Audio and Video Generation through Cross-Task Synergy

Harmony: 通过跨任务协同实现音频和视频生成

Teng Hu, Zhentao Yu, Guozhen Zhang, Zihan Su, Zhengguang Zhou, Youliang Zhang, Yuan Zhou, Qinglin Lu, Ran Yi

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent Hunyuan Project(腾讯文心项目)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 Harmony通过跨任务协同机制和同步增强CFG,实现高效音频视频同步生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25187 2025-11-17 cs.CV 74%

FlashI2V: Fourier-Guided Latent Shifting Prevents Conditional Image Leakage in Image-to-Video Generation

Yunyang Ge, Xinhua Cheng, Chengshu Zhao, Xianyi He, Shenghai Yuan, Bin Lin, Bin Zhu, Li Yuan

机构 * Peking University, Shenzhen Graduate School(北京大学深圳研究生院) Peng Cheng Laboratory(鹏城实验室) Rabbitpre AI

专题命中 视频生成 :video generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08536 2025-11-12 cs.CV 74%

3D4D: An Interactive, Editable, 4D World Model via 3D Video Generation

Yunhong He, Zhengqing Yuan, Zhengzhong Tu, Yanfang Ye, Lichao Sun

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments Accepted by AAAI 2026 Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21840 2025-10-28 cs.CV cs.GR 74%

Improving the Physics of Video Generation with VJEPA-2 Reward Signal

Jianhao Yuan, Xiaofeng Zhang, Felix Friedrich, Nicolas Beltran-Velez, Melissa Hall, Reyhane Askari-Hemmat, Xiaochuang Han, Nicolas Ballas, Michal Drozdzal, Adriana Romero-Soriano

机构 * FAIR, Meta Superintelligence Labs(FAIR、Meta超智能实验室) University of Oxford(牛津大学) Mila - Québec AI Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Columbia University(哥伦比亚大学) McGill University(麦吉尔大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair)

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments 2 pages

Journal ref Winning entry of the ICCV 2025 Physics IQ Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24427 2025-09-30 cs.CV 74%

UI2V-Bench: An Understanding-based Image-to-video Generation Benchmark

Ailing Zhang, Lina Lei, Dehong Kong, Zhixin Wang, Jiaqi Xu, Fenglong Song, Chun-Le Guo, Chang Liu, Fan Li, Jie Chen

机构 * Peking University(北京大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Nankai University(南开大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21119 2025-09-26 cs.CV 74%

MotionFlow:Learning Implicit Motion Flow for Complex Camera Trajectory Control in Video Generation

Guojun Lei, Chi Wang, Yikai Wang, Hong Li, Ying Song, Weiwei Xu

机构 * Zhejiang University(浙江大学) Tsinghua University(清华大学) Beihang University(北航) Zhejiang Gongshang University(浙江工商大学) ShengShu(盛舒)

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments ICME2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15269 2025-09-26 cs.CV cs.AI 74%

Conditional Video Generation for High-Efficiency Video Compression

Fangqiu Yi, Jingyu Xu, Jiawei Shao, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI)(人工智能研究院)

专题命中 视频生成 :video generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17190 2025-09-23 cs.CV cs.AI 74%

Echo-Path: Pathology-Conditioned Echo Video Generation

Kabir Hamzah Muhammad, Marawan Elbatel, Yi Qin, Xiaomeng Li

机构 * Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments 10 pages, 3 figures, MICCAI-AMAI2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20471 2025-08-29 cs.CV 74%

Realistic and Controllable 3D Gaussian-Guided Object Editing for Driving Video Generation

Jiusi Li, Jackson Jiang, Jinyu Miao, Miao Long, Tuopu Wen, Peijin Jia, Shengxiang Liu, Chunlei Yu, Maolin Liu, Yuzhan Cai, Kun Jiang, Mengmeng Yang, Diange Yang

机构 * School of Vehicle and Mobility, and State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(车辆与移动系统学院,智能绿色车辆与移动系统国家重点实验室,清华大学) WUWEN AI PhiGent Robotics

专题命中 视频生成 :video generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04631 2025-08-29 cs.CV cs.AI 74%

Puppet-Master: Scaling Interactive Video Generation as a Motion Prior for Part-Level Dynamics

Ruining Li, Chuanxia Zheng, Christian Rupprecht, Andrea Vedaldi

机构 * Visual Geometry Group, University of Oxford(牛津大学视觉几何组)

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments Accepted at ICCV 2025. Project page: https://vgg-puppetmaster.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14033 2025-08-20 cs.CV 74%

InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing

Shaoshu Yang, Zhe Kong, Feng Gao, Meng Cheng, Xiangyu Liu, Yong Zhang, Zhuoliang Kang, Wenhan Luo, Xunliang Cai, Ran He, Xiaoming Wei

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Meituan New Laboratory of Pattern Recognition (NLPR), CASIA(美团模式识别新实验室(NLPR),中国科学院自动化所) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Meituan Division of AMC and Department of ECE, HKUST(美团AMC部门和香港科技大学电子与计算机工程系) State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(多模态人工智能系统国家重点实验室,中国科学院自动化所) Meituan School of Artificial Intelligence, University of Chinese Academy of Sciences(美团人工智能学院,中国科学院大学) Meituan(美团)

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17414 2025-07-14 cs.CV 74%

X-Dancer: Expressive Music to Human Dance Video Generation

Zeyuan Chen, Hongyi Xu, Guoxian Song, You Xie, Chenxu Zhang, Xin Chen, Chao Wang, Di Chang, Linjie Luo

机构 * UC San Diego(圣迭戈大学) ByteDance(字节跳动) University of Southern California(南加州大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments ICCV 2025. Project Page: https://zeyuan-chen.com/X-Dancer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04036 2025-07-08 cs.CV 74%

PresentAgent: Multimodal Agent for Presentation Video Generation

Jingwei Shi, Zeyu Zhang, Biao Wu, Yanjie Liang, Meng Fang, Ling Chen, Yang Zhao

机构 * AI Geeks, Australia Australian Artificial Intelligence Institute, Australia(澳大利亚人工智能研究所) University of Liverpool, United Kingdom(利物浦大学) La Trobe University, Australia(拉特罗布大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22046 2025-07-01 cs.CV 74%

LatentMove: Towards Complex Human Movement Video Generation

Ashkan Taghipour, Morteza Ghahremani, Mohammed Bennamoun, Farid Boussaid, Aref Miri Rekavandi, Zinuo Li, Qiuhong Ke, Hamid Laga

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments The authors are withdrawing this paper due to major issues in the experiments and methodology. To prevent citation of this outdated and flawed version, we have decided to remove it while we work on a substantial revision. Thank you

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04956 2025-06-06 cs.CV 74%

FEAT: Full-Dimensional Efficient Attention Transformer for Medical Video Generation

Huihan Wang, Zhiwen Yang, Hui Zhang, Dan Zhao, Bingzheng Wei, Yan Xu

机构 * School of Biological Science and Medical Engineering, State Key Laboratory of Software Development Environment, Key Laboratory of Biomechanics and Mechanobiology of Ministry of Education, Beijing Advanced Innovation Center for Biomedical Engineering, Beihang University, Beijing 100191, China(生物科学与医学工程学院、软件开发环境国家重点实验室、教育部生物力学与机械生物学重点实验室、北京生物医学工程先进创新中心、北京航空航天大学) Department of Biomedical Engineering, Tsinghua University, Beijing 100084, China(生物医学工程系、清华大学) Department of Gynecology Oncology, National Cancer Center/National Clinical Research Center for Cancer/Cancer Hospital, Chinese Academy of Medical Sciences and Peking Union Medical College, Beijing 100021, China(妇科肿瘤科、国家癌症中心/国家癌症临床研究中心/癌症医院、中国医学科学院和北京协和医学院) ByteDance Inc., Beijing 100098, China(字节跳动公司)

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments This paper has been early accepted by MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03140 2025-06-04 cs.CV 74%

CamCloneMaster: Enabling Reference-based Camera Control for Video Generation

Yawen Luo, Jianhong Bai, Xiaoyu Shi, Menghan Xia, Xintao Wang, Pengfei Wan, Di Zhang, Kun Gai, Tianfan Xue

机构 * The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Kuaishou Technology(快手科技)

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments Project Page: https://camclonemaster.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01103 2025-06-03 cs.CV 74%

DeepVerse: 4D Autoregressive Video Generation as a World Model

Junyi Chen, Haoyi Zhu, Xianglong He, Yifan Wang, Jianjun Zhou, Wenzheng Chang, Yang Zhou, Zizun Li, Zhoujie Fu, Jiangmiao Pang, Tong He

机构 * SJTU(上海交通大学) Shanghai AI Lab(上海人工智能实验室) USTC(中国科学技术大学) THU(清华大学) ZJU(浙江大学) FDU(福建师范大学) NTU(国立台湾大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15880 2025-05-26 cs.CV 74%

Challenger: Affordable Adversarial Driving Video Generation

Zhiyuan Xu, Bohan Li, Huan-ang Gao, Mingju Gao, Yong Chen, Ming Liu, Chenxu Yan, Hang Zhao, Shuo Feng, Hao Zhao

机构 * AIR, Tsinghua(清华大学人工智能研究院) UCAS(中国科学技术大学) SJTU(上海交通大学) EIT, Ningbo(宁波工程学院) Geely Auto(吉利汽车) IIIS, Tsinghua(清华大学人工智能研究院) DA, Tsinghua(清华大学人工智能研究院)

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments Project page: https://pixtella.github.io/Challenger/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13211 2025-05-20 cs.CV cs.AI 74%

MAGI-1: Autoregressive Video Generation at Scale

Sand. ai, Hansi Teng, Hongyu Jia, Lei Sun, Lingzhi Li, Maolin Li, Mingqiu Tang, Shuai Han, Tianning Zhang, W. Q. Zhang, Weifeng Luo, Xiaoyang Kang, Yuchen Sun, Yue Cao, Yunpeng Huang, Yutong Lin, Yuxin Fang, Zewei Tao, Zheng Zhang, Zhongshu Wang, Zixun Liu, Dai Shi, Guoli Su, Hanwen Sun, Hong Pan, Jie Wang, Jiexin Sheng, Min Cui, Min Hu, Ming Yan, Shucheng Yin, Siran Zhang, Tingting Liu, Xianping Yin, Xiaoyu Yang, Xin Song, Xuan Hu, Yankai Zhang, Yuqiao Li

专题命中 视频生成 :video generation(title);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22357 2025-03-31 cs.CV 74%

EchoFlow: A Foundation Model for Cardiac Ultrasound Image and Video Generation

Hadrien Reynaud, Alberto Gomez, Paul Leeson, Qingjie Meng, Bernhard Kainz

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12761 2025-03-17 cs.CV cs.AI cs.LG 74%

SAFREE: Training-Free and Adaptive Guard for Safe Text-to-Image And Video Generation

Jaehong Yoon, Shoubin Yu, Vaidehi Patil, Huaxiu Yao, Mohit Bansal

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments ICLR 2025; The first two authors contributed equally; Project page: https://safree-safe-t2i-t2v.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09733 2025-03-14 cs.CV 74%

I2V3D: Controllable image-to-video generation with 3D guidance

Zhiyuan Zhang, Dongdong Chen, Jing Liao

专题命中 视频生成 :video generation(title);分类 cs.CV

Comments Project page: https://bestzzhang.github.io/I2V3D

详情

展开后加载摘要…

URL PDF HTML 收藏