arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2141 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2141 篇

2511.06271 2025-11-11 cs.CV 77%

RelightMaster: Precise Video Relighting with Multi-plane Light Images

Weikang Bian, Xiaoyu Shi, Zhaoyang Huang, Jianhong Bai, Qinghe Wang, Xintao Wang, Pengfei Wan, Kun Gai, Hongsheng Li

机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Kling Team, Kuaishou Technology(快手技术 Kling 团队) CPII under InnoHK(创新香港 CPII) Zhejiang University(浙江大学) Dalian University of Technology(大连理工大学)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments Project Page: https://wkbian.github.io/Projects/RelightMaster/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22200 2025-10-29 cs.CV 77%

LongCat-Video Technical Report

Meituan LongCat Team, Xunliang Cai, Qilong Huang, Zhuoliang Kang, Hongyu Li, Shijun Liang, Liya Ma, Siyu Ren, Xiaoming Wei, Rixu Xie, Tong Zhang

机构 * Meituan LongCat Team(美团LongCat团队)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08143 2025-10-10 cs.CV 77%

UniMMVSR: A Unified Multi-Modal Framework for Cascaded Video Super-Resolution

Shian Du, Menghan Xia, Chang Liu, Quande Liu, Xintao Wang, Pengfei Wan, Xiangyang Ji

机构 * Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23263 2025-07-01 cs.CV 77%

Causal-Entity Reflected Egocentric Traffic Accident Video Synthesis

Lei-lei Li, Jianwu Fang, Junbin Xiao, Shanmin Pang, Hongkai Yu, Chen Lv, Jianru Xue, Tat-Seng Chua

机构 * Xi’an Jiaotong University(西安交通大学) National University of Singapore(国立新加坡大学) Nanyang Technological University(南洋理工大学) Cleveland State University(克利夫兰州立大学)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments Accepted by ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11190 2025-03-17 cs.SD cs.AI cs.CL cs.MM eess.AS 77%

Cross-Modal Learning for Music-to-Music-Video Description Generation

Zhuoyuan Mao, Mengjie Zhao, Qiyu Wu, Zhi Zhong, Wei-Hsiang Liao, Hiromi Wakaki, Yuki Mitsufuji

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.MM

Comments Accepted by RepL4NLP 2025 @ NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07701 2025-02-18 cs.CV 77%

Magic 1-For-1: Generating One Minute Video Clips within One Minute

Hongwei Yi, Shitong Shao, Tian Ye, Jiantong Zhao, Qingyu Yin, Michael Lingelbach, Li Yuan, Yonghong Tian, Enze Xie, Daquan Zhou

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);long video(abstract);分类 cs.CV

Comments Serious updates are needed

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17225 2024-12-05 cs.CV 77%

4DGen: Grounded 4D Content Generation with Spatial-temporal Consistency

Yuyang Yin, Dejia Xu, Zhangyang Wang, Yao Zhao, Yunchao Wei

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments Project page: https://vita-group.github.io/4DGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02095 2024-12-02 cs.CV cs.AI cs.GR 77%

DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos

Wenbo Hu, Xiangjun Gao, Xiaoyu Li, Sijie Zhao, Xiaodong Cun, Yong Zhang, Long Quan, Ying Shan

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);long video(abstract);分类 cs.CV

Comments Project webpage: https://depthcrafter.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.07944 2024-03-14 cs.CV cs.AI 77%

WorldGPT: A Sora-Inspired Video AI Agent as Rich World Models from Text and Image Inputs

Deshun Yang, Luhui Hu, Yu Tian, Zihao Li, Chris Kelly, Bang Yang, Cindy Yang, Yuexian Zou

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments 11 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07531 2026-06-18 cs.CV cs.AI cs.LG cs.MM 版本更新 76%

VidCRAFT3: Camera, Object, and Lighting Control for Image-to-Video Generation

VidCRAFT3: 面向图像到视频生成的相机、物体与光照控制

Sixiao Zheng, Zimian Peng, Yanpeng Zhou, Yi Zhu, Hang Xu, Xiangru Huang, Yanwei Fu

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院) Zhejiang University(浙江大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Westlake University(西湖大学) School of Data Science and MOE Frontiers Center for Brain Science, Fudan University(复旦大学数据科学学院和脑科学前沿中心) Fudan ISTBI–ZJNU Algorithm Centre for Brain-inspired Intelligence, Zhejiang Normal University(复旦大学-浙江师范大学脑启发智能算法中心)

专题命中 视频生成 :video generation(title);分类 cs.CV、cs.MM

AI总结 提出VidCRAFT3框架,通过显式建模几何、运动与光照的跨因素交互,实现对相机运动、物体运动和光照方向的独立或联合控制,在控制精度和视觉一致性上达到最优。

Comments Accepted to TVCG 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09057 2026-04-17 cs.CV cs.MM cs.SD 76%

Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence

Tora3:基于轨迹的音频视频生成与物理一致性

Junchao Liao, Zhenghao Zhang, Xiangyu Meng, Litao Li, Ziying Zhang, Siyu Zhu, Long Qin, Weizhi Wang

机构 * Alibaba Cloud Computing(阿里巴巴云 computing) Fudan University(复旦大学)

专题命中 视频生成 :video generation(title);分类 cs.CV、cs.MM

AI总结 Tora3通过引入轨迹作为共享的运动先验,提升音频视频生成的物理一致性,采用轨迹对齐的运动表示和混合流匹配方案,改进运动真实性和运动-声音同步性。

Comments 12 pages, 5 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12196 2025-12-16 cs.MM cs.CV cs.SD eess.AS 76%

AutoMV: An Automatic Multi-Agent System for Music Video Generation

AutoMV: 一种自动多智能体系统用于音乐视频生成

Xiaoxuan Tang, Xinping Lei, Chaoran Zhu, Shiyun Chen, Ruibin Yuan, Yizhi Li, Changjae Oh, Ge Zhang, Wenhao Huang, Emmanouil Benetos, Yang Liu, Jiaheng Liu, Yinghao Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanjing University(南京大学) Queen Mary University of London(伦敦大学女王学院) Hong Kong University of Science and Technology(香港科技大学) University of Manchester(曼彻斯特大学)

专题命中 视频生成 :video generation(title);分类 cs.CV、cs.MM

AI总结 AutoMV通过多智能体协作生成完整音乐视频,优于现有方法并接近专业水准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03603 2025-06-13 cs.CV cs.MM 76%

A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation

S. Z. Zhou, Y. B. Wang, J. F. Wu, T. Hu, J. N. Zhang

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频生成 :video generation(title);分类 cs.CV、cs.MM

Comments revised

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20287 2025-05-27 cs.CV cs.MM 76%

MotionPro: A Precise Motion Controller for Image-to-Video Generation

Zhongwei Zhang, Fuchen Long, Zhaofan Qiu, Yingwei Pan, Wu Liu, Ting Yao, Tao Mei

机构 * University of Science and Technology of China(中国科学技术大学) HiDream.ai Inc.(HiDream.ai公司)

专题命中 视频生成 :video generation(title);分类 cs.CV、cs.MM

Comments CVPR 2025. Project page: https://zhw-zhang.github.io/MotionPro-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18552 2025-05-27 cs.CV cs.AI cs.MM 76%

EvAnimate: Event-conditioned Image-to-Video Generation for Human Animation

Qiang Qu, Ming Li, Xiaoming Chen, Tongliang Liu

专题命中 视频生成 :video generation(title);分类 cs.CV、cs.MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.09266 2024-12-02 cs.CV cs.AI cs.MM cs.SD eess.AS 76%

Dance Any Beat: Blending Beats with Visuals in Dance Video Generation

Xuanchen Wang, Heng Wang, Dongnan Liu, Weidong Cai

专题命中 视频生成 :video generation(title);分类 cs.CV、cs.MM

Comments WACV2025, 11 pages, 7 figures, demo page: https://DabFusion.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09787 2024-08-20 cs.CL cs.CV cs.MM 76%

Anim-Director: A Large Multimodal Model Powered Agent for Controllable Animation Video Generation

Yunxin Li, Haoyuan Shi, Baotian Hu, Longyue Wang, Jiashun Zhu, Jinyi Xu, Zhen Zhao, Min Zhang

专题命中 视频生成 :video generation(title);分类 cs.CV、cs.MM

Comments Accepted by SIGGRAPH Asia 2024, Project and Codes: https://github.com/HITsz-TMG/Anim-Director

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.10922 2024-03-18 cs.CV cs.LG eess.AS eess.IV 76%

StyleTalker: One-shot Style-based Audio-driven Talking Head Video Generation

Dongchan Min, Minyoung Song, Eunji Ko, Sung Ju Hwang

专题命中 视频生成 :video generation(title);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.07931 2023-08-15 cs.CV eess.IV 76%

DialogueNeRF: Towards Realistic Avatar Face-to-Face Conversation Video Generation

Yichao Yan, Zanwei Zhou, Zi Wang, Jingnan Gao, Xiaokang Yang

专题命中 视频生成 :video generation(title);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.09821 2023-07-20 cs.CV cs.MM 76%

Hierarchical Semantic Perceptual Listener Head Video Generation: A High-performance Pipeline

Zhigang Chang, Weitai Hu, Qing Yang, Shibao Zheng

专题命中 视频生成 :video generation(title);分类 cs.CV、cs.MM

Comments ACM MM 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.04435 2022-04-12 cs.CV eess.IV 76%

HSTR-Net: High Spatio-Temporal Resolution Video Generation For Wide Area Surveillance

H. Umut Suluhan, Hasan F. Ates, Bahadir K. Gunturk

专题命中 视频生成 :video generation(title);分类 cs.CV、eess.IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.03292 2021-09-09 cs.CV cs.LG eess.IV 76%

Simple Video Generation using Neural ODEs

David Kanaa, Vikram Voleti, Samira Ebrahimi Kahou, Christopher Pal

专题命中 视频生成 :video generation(title);分类 cs.CV、eess.IV

Comments 8 pages, 4 figures, NeurIPS 2019 workshop

Journal ref NeurIPS 2019 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15555 2026-08-18 cs.CV cs.LG 新提交 74%

RigidBench: Evaluating Rigid-Body Physics in Video Generation Models

RigidBench:评估视频生成模型中的刚体物理效果

Swarnim Jain, Shangzhe Wu

机构 * University of Cambridge(剑桥大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 该研究提出基于模拟器的RigidBench基准,评估视频生成模型的刚体物理效果,分析8个模型的表现,用5000个训练视频微调Wan 2.2 TI2V-5B并揭示其表征物体位置的机制。

Comments 30 pages, including appendices. Code: https://github.com/swarnim-j/RigidBench. Dataset: https://doi.org/10.5281/zenodo.21649156

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09355 2026-08-11 cs.CV 新提交 74%

Alpha as an Efficiency Signal: Visibility-Routed RGBA Image-to-Video Generation

Alpha作为效率信号:可见性路由的RGBA图像到视频生成

Zhe Li, Honghao Qiao, Zhixin Xu, Qijie Wang, Bo Peng, Dawei Li

机构 * ByteDance(字节跳动)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 针对游戏RGBA视频生成的数据集与效率问题,提出可见性路由的RGBA视频生成模型,实现了更低FVD与1.2倍推理加速,质量下降可忽略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05648 2026-08-07 cs.CV 新提交 74%

Vorch-IR: Long-Form Unified Multimodal Identity Replacement Video Generation

Vorch-IR:长视频统一多模态身份替换生成模型

Yaole Wang, Xiaoyu Chen, Xin Ma, Yang Ding, Gang Yue, Jingjing Chen, Lin Ma, Yaohui Wang

机构 * Vorch Team(Vorch团队) Fudan University(复旦大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 Vorch-IR是基于LTX2的统一多模态视频身份替换框架,支持单人、双人身份及可选背景替换,通过自动数据构建流水线与时间重叠推理策略,实现长视频生成,在身份保留、动作保真等方面表现出色。

Comments Project page: https://vorch-project.github.io/Vorch-IR-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19161 2026-08-06 cs.CV 版本更新 74%

Flash-VAED: Plug-and-Play VAE Decoders for Efficient Video Generation

Flash-VAED: 用于高效视频生成的即插即用VAE解码器

Lunjie Zhu, Yushi Huang, Xingtong Ge, Yufei Xue, Zhening Liu, Yumeng Zhang, Zehong Lin, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 Flash-VAED通过通道剪枝和分阶段运算优化,实现了高效视频生成的高质量与高速度平衡。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24013 2026-07-30 cs.CV 版本更新 74%

AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars

AptAvatar:用于生产就绪头像的快速且生动的长格式音频驱动视频生成

Hengyuan Zhang, Jingna Sun, Meiguang Jin, Junfeng Ma

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 研究生产就绪的音频驱动头像生成,提出AptAvatar框架,通过端点锚定分布蒸馏和自生成历史重放方法,实现快速且生动的长格式视频生成,仅用2次归一化流评估,加速60倍且保持视觉保真度和长跨度身份。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20247 2026-07-23 cs.CV 新提交 74%

Vera: Identity-Faithful Human Subject-to-Video Generation

Vera:身份忠实的人类主体到视频生成

Yulong Xu, Xinyue Liu, Shujuan Li, huafeng shi, Yan Zhou, Jiwen Liu, Xintao Wang, Yu Shen Liu, Huaibo Huang

机构 * Kuaishou Technology(快手科技) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 针对主体到视频生成中人类身份一致性不足问题,提出Vera框架,通过构建百万对身份对齐数据集,引入身份聚焦掩码监督和参考感知分层注意力两种设计,提升了身份一致性、主体绑定及运动自然性等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14189 2026-07-17 cs.CV cs.SD 新提交 74%

MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation

MultiRef-Compass:迈向多参考到音频-视频生成的综合评估

Xiaohan Zhang, Yuqing Wen, Junlin Chen, Yuqi Tang, Yiting He, Lizhuo Shao, Weiming Zhu, Tengfei Liu, Yang Shi, Jialu Chen, Yuanxing Zhang, Huaxiong Li

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 研究针对多参考到音频-视频生成设置,引入MultiRef-Compass基准。通过可扩展管道构建350个样本,定义含四个维度14个子指标的评估协议,集成自动指标与MLLM评判框架,实验表明该基准对MR2AV研究有重要意义。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05354 2026-07-07 cs.CV 新提交 74%

Geometric Reciprocity: Unlocking Self-Supervision for Stereoscopic Video Generation

几何互易性:解锁立体视频生成的自监督能力

Jingyi Lu, Kai Han

机构 * Visual AI Lab, The University of Hong Kong, Hong Kong, China(香港大学视觉人工智能实验室)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 针对单目转立体任务中立体修复依赖稀缺标注数据的问题,提出几何互易性定理,构建自监督框架,从海量单目视频学习,性能远超现有无监督、监督SOTA方法。

Comments Accepted to ICML 2026. Project page: https://visual-ai.github.io/grt/

详情

展开后加载摘要…

URL PDF HTML 收藏