arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2141 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2141 篇

2509.15496 2025-09-22 cs.CV 79%

Lynx: Towards High-Fidelity Personalized Video Generation

Shen Sang, Tiancheng Zhi, Tianpei Gu, Jing Liu, Linjie Luo

机构 * ByteDance(字节跳动)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Lynx Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15479 2025-09-22 cs.CV 79%

OpenViGA: Video Generation for Automotive Driving Scenes by Streamlining and Fine-Tuning Open Source Models with Public Data

Björn Möller, Zhengyang Li, Malte Stelzer, Thomas Graave, Fabian Bettels, Muaaz Ataya, Tim Fingscheidt

机构 * Technische Universität Braunschweig(布拉unsch维格技术大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06082 2025-09-18 cs.CV 79%

SwiftVideo: A Unified Framework for Few-Step Video Generation through Trajectory-Distribution Alignment

Yanxiao Sun, Jiafu Wu, Yun Cao, Chengming Xu, Yabiao Wang, Weijian Cao, Donghao Luo, Chengjie Wang, Yanwei Fu

机构 * Fudan University(复旦大学) Tencent Youtu Lab(腾讯优图实验室) Shanghai Innovation Institute(上海创新研究院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05677 2025-09-17 cs.CV cs.AI 79%

T2V-Turbo-v2: Enhancing Video Generation Model Post-Training through Data, Reward, and Conditional Guidance Design

Jiachen Li, Qian Long, Jian Zheng, Xiaofeng Gao, Robinson Piramuthu, Wenhu Chen, William Yang Wang

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) UC Los Angeles(加州大学洛杉矶分校) Amazon AGI(亚马逊人工智能实验室) University of Waterloo(滑铁卢大学)

专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV

Comments Accepted by ICLR 2025. Project Page: https://t2v-turbo-v2.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06155 2025-09-09 cs.CV 79%

UniVerse-1: Unified Audio-Video Generation via Stitching of Experts

Duomin Wang, Wei Zuo, Aojie Li, Ling-Hao Chen, Xinyao Liao, Deyu Zhou, Zixin Yin, Xili Dai, Daxin Jiang, Gang Yu

机构 * The Hong Kong University of Science and Technology(GuangZhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Project page: https://dorniwang.github.io/UniVerse-1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04773 2025-09-08 cs.CV 79%

Hybrid-Tower: Fine-grained Pseudo-query Interaction and Generation for Text-to-Video Retrieval

Bangxiang Lan, Ruobing Xie, Ruixiang Zhao, Xingwu Sun, Zhanhui Kang, Gang Yang, Xirong Li

机构 * Renmin University of China(中国人民大学) Large Language Model Department, Tencent(腾讯大语言模型部门)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

Comments Accepted to ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21721 2025-08-28 cs.CV 79%

Evaluating Text-to-Image and Text-to-Video Synthesis with a Conditional Fréchet Distance

Jaywon Koo, Jefferson Hernandez, Moayed Haji-Ali, Ziyan Yang, Vicente Ordonez

机构 * Rice University(里士大学)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

Comments Added new video experiments and more image experiments to validate the method

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18621 2025-08-27 cs.CV 79%

Wan-S2V: Audio-Driven Cinematic Video Generation

Xin Gao, Li Hu, Siqi Hu, Mingyang Huang, Chaonan Ji, Dechao Meng, Jinwei Qi, Penchong Qiao, Zhen Shen, Yafei Song, Ke Sun, Linrui Tian, Guangyuan Wang, Qi Wang, Zhongjian Wang, Jiayu Xiao, Sheng Xu, Bang Zhang, Peng Zhang, Xindi Zhang, Zhe Zhang, Jingren Zhou, Lian Zhuo

机构 * Tongyi Lab, Alibaba(通义实验室,阿里巴巴)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17062 2025-08-26 cs.CV cs.AI 79%

SSG-Dit: A Spatial Signal Guided Framework for Controllable Video Generation

Peng Hu, Yu Gu, Liang Luo, Fuji Ren

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(计算机科学与工程学院,电子科技大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14609 2025-08-21 cs.CV 79%

AnchorSync: Global Consistency Optimization for Long Video Editing

Zichi Liu, Yinggui Wang, Tao Wei, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence, AI Institute Shanghai Jiao Tong University Shanghai China(人工智能联合实验室,人工智能研究院,上海交通大学)

专题命中 视频生成 :long video(title,abstract);分类 cs.CV

Comments ACM MM 2025; Code is released at https://github.com/VISION-SJTU/AnchorSync

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13104 2025-08-19 cs.CV cs.RO 79%

Precise Action-to-Video Generation Through Visual Action Prompts

Yuang Wang, Chao Wen, Haoyu Guo, Sida Peng, Minghan Qin, Hujun Bao, Xiaowei Zhou, Ruizhen Hu

机构 * Xiangjiang Lab(湘江实验室) Zhejiang University(浙江大学) Fudan University(复旦大学) Tsinghua University(清华大学) Shenzhen University(深圳大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Accepted to ICCV 2025. Project page: https://zju3dv.github.io/VAP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08189 2025-08-18 cs.CV 79%

FancyVideo: Towards Dynamic and Consistent Video Generation via Cross-frame Textual Guidance

Jiasong Feng, Ao Ma, Jing Wang, Ke Cao, Zhanjie Zhang

机构 * AI Research(360人工智能研究院) Beijing University of Technology(北京理工大学) Wuhan University(武汉大学) Sun Yat-sen University(中山大学) University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学)

专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV

Comments Accepted by IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10858 2025-08-15 cs.CV 79%

Hierarchical Fine-grained Preference Optimization for Physically Plausible Video Generation

Harold Haodong Chen, Haojian Huang, Qifeng Chen, Harry Yang, Ser-Nam Lim

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Project Page: https://haroldchen19.github.io/PhysHPO-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00312 2025-08-04 cs.CV cs.AI 79%

GV-VAD : Exploring Video Generation for Weakly-Supervised Video Anomaly Detection

Suhang Cai, Xiaohao Peng, Chong Wang, Xiaojie Cai, Jiangbo Qian

机构 * China Telecom Corporation Limited Wenzhou Branch(中国电信有限公司温州支公司) Faculty of Electrical Engineering and Computer Science, Ningbo University(宁波大学电子工程与计算机科学学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15504 2025-07-25 cs.CV 79%

Quantifying and Narrowing the Unknown: Interactive Text-to-Video Retrieval via Uncertainty Minimization

Bingqing Zhang, Zhuo Cao, Heming Du, Yang Li, Xue Li, Jiajun Liu, Sen Wang

机构 * The University of Queensland, Australia(昆士兰大学) CSIRO Data61, Australia(澳大利亚CSIRO数据61)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15824 2025-07-22 cs.CV 79%

Can Your Model Separate Yolks with a Water Bottle? Benchmarking Physical Commonsense Understanding in Video Generation Models

Enes Sanli, Baris Sarper Tezcan, Aykut Erdem, Erkut Erdem

专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01425 2025-07-22 cs.CV 79%

Free-Form Motion Control: Controlling the 6D Poses of Camera and Objects in Video Generation

Xincheng Shuai, Henghui Ding, Zhenyuan Qin, Hao Luo, Xingjun Ma, Dacheng Tao

机构 * Fudan University(复旦大学) DAMO Academy, Alibaba group(阿里集团 DAMO 院) Hupan Lab(虎派实验室) Nanyang Technological University, Singapore(新加坡南洋理工大学)

专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV

Comments ICCV 2025, Project Page: https://henghuiding.github.io/SynFMC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13753 2025-07-21 cs.CV 79%

Encapsulated Composition of Text-to-Image and Text-to-Video Models for High-Quality Video Synthesis

Tongtong Su, Chengyu Wang, Bingyan Liu, Jun Huang, Dongming Lu

机构 * Zhejiang University(浙江大学) Alibaba Cloud Computing(阿里云计算) South China University of Technology(华南理工大学)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06812 2025-07-15 cs.CV cs.AI 79%

Democratizing High-Fidelity Co-Speech Gesture Video Generation

Xu Yang, Shaoli Huang, Shenbo Xie, Xuelin Chen, Yifei Liu, Changxing Ding

机构 * South China University of Technology(华南理工大学) Tencent AI Lab(腾讯AI实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10059 2025-07-15 cs.CV 79%

RealCam-I2V: Real-World Image-to-Video Generation with Interactive Complex Camera Control

Teng Li, Guangcong Zheng, Rui Jiang, Shuigen Zhan, Tao Wu, Yehao Lu, Yining Lin, Chuanyun Deng, Yepan Xiong, Min Chen, Lin Cheng, Xi Li

机构 * College of Computer Science & Technology, Zhejiang University(浙江大学计算机科学与技术学院) Central Media Technology Institute, 2012 Lab, Huawei(华为2012实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04189 2025-07-15 cs.CV 79%

HANDI: Hand-Centric Text-and-Image Conditioned Video Generation

Yayuan Li, Zhi Cao, Jason J. Corso

机构 * University of Michigan(密歇根大学) Voxel51 Project Page(Voxel51项目页面)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments 16 pages, 7 figures and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06830 2025-07-10 cs.CV cs.AI 79%

Physics-Grounded Motion Forecasting via Equation Discovery for Trajectory-Guided Image-to-Video Generation

Tao Feng, Xianbing Zhao, Zhenhua Chen, Tien Tsin Wong, Hamid Rezatofighi, Gholamreza Haffari, Lizhen Qu

机构 * Monash University(墨尔本大学) Harbin Institute of Technology(哈尔滨工业大学) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-罗quentcourt研究所) Rajiv Gandhi University(拉朱·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05963 2025-07-10 cs.CV 79%

Tora2: Motion and Appearance Customized Diffusion Transformer for Multi-Entity Video Generation

Zhenghao Zhang, Junchao Liao, Xiangyu Meng, Long Qin, Weizhi Wang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments ACM MM25 Conference Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05675 2025-07-09 cs.CV cs.AI 79%

MedGen: Unlocking Medical Video Generation by Scaling Granularly-annotated Medical Videos

Rongsheng Wang, Junying Chen, Ke Ji, Zhenyang Cai, Shunian Chen, Yunjin Yang, Benyou Wang

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02862 2025-07-04 cs.CV 79%

RefTok: Reference-Based Tokenization for Video Generation

Xiang Fan, Xiaohang Sun, Kushan Thakkar, Zhu Liu, Vimal Bhat, Ranjay Krishna, Xiang Hao

机构 * University of Washington(华盛顿大学) Amazon(亚马逊)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23513 2025-07-01 cs.CV 79%

ViewPoint: Panoramic Video Generation with Pretrained Diffusion Models

Zixun Fang, Kai Zhu, Zhiheng Liu, Yu Liu, Wei Zhai, Yang Cao, Zheng-Jun Zha

机构 * USTC(中国科学技术大学) TongYi Lab(通义实验室) HKU(香港大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments https://becauseimbatman0.github.io/ViewPoint

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21287 2025-06-27 cs.CV 79%

HieraSurg: Hierarchy-Aware Diffusion Model for Surgical Video Generation

Diego Biagini, Nassir Navab, Azade Farshad

机构 * Chair for Computer Aided Medical Procedures (CAMP), TU Munich, Germany(计算机辅助医疗程序研究所(CAMP),慕尼黑技术大学,德国) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Accepted at MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19833 2025-06-25 cs.CV 79%

Bind-Your-Avatar: Multi-Talking-Character Video Generation with Dynamic 3D-mask-based Embedding Router

Yubo Huang, Weiqiang Wang, Sirui Zhao, Tong Xu, Lin Liu, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Monash University(墨尔本大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10044 2025-06-25 cs.CV 79%

Aligning Anime Video Generation with Human Feedback

Bingwen Zhu, Yudong Jiang, Baohan Xu, Siqian Yang, Mingyu Yin, Yidi Wu, Huyang Sun, Zuxuan Wu

机构 * Fudan University(复旦大学) Bilibili Inc(哔哩哔哩公司)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments 10 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18851 2025-06-24 cs.CV 79%

Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset

Zhuowei Chen, Bingchuan Li, Tianxiang Ma, Lijie Liu, Mingcong Liu, Yi Zhang, Gen Li, Xinghui Li, Siyu Zhou, Qian He, Xinglong Wu

机构 * Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

Comments Project page:https://phantom-video.github.io/Phantom-Data/

详情

展开后加载摘要…

URL PDF HTML 收藏