arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2127 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2127 篇

2512.02457 2025-12-04 cs.CV 83%

Does Hearing Help Seeing? Investigating Audio-Video Joint Denoising for Video Generation

听觉有助于视觉吗?研究音频视频联合去噪用于视频生成

Jianzong Wu, Hao Lian, Dachao Hao, Ye Tian, Qingyu Shi, Biaolong Chen, Hao Jiang, Yunhai Tong

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出通过音频视频联合去噪提升视频生成质量,验证了跨模态训练对构建更物理基础的世界模型的潜力。

Comments Project page at https://jianzongwu.github.io/projects/does-hearing-help-seeing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02870 2025-12-03 cs.CV 83%

Taming Camera-Controlled Video Generation with Verifiable Geometry Reward

驯服受控摄像机视频生成的可验证几何奖励

Zhaoqing Wang, Xiaobo Xia, Zhuolin Bie, Jinlin Liu, Dongdong Yu, Jia-Wang Bian, Changhu Wang

机构 * AIsphere National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种在线强化学习框架,通过可验证的几何奖励提升摄像机控制的视频生成精度与一致性。

Comments 11 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00425 2025-12-02 cs.CV 83%

What about gravity in video generation? Post-Training Newton's Laws with Verifiable Rewards

视频生成中重力的作用:基于可验证奖励的后训练牛顿定律

Minh-Quan Le, Yuanzhi Zhu, Vicky Kalogeiton, Dimitris Samaras

机构 * Stony Brook University(石溪大学) LIX, École Polytechnique, CNRS, IPP(巴黎政治学院LIX研究所、法国国家科学研究中心、IPPP)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 NewtonRewards通过可验证奖励机制提升视频生成的物理合理性与运动流畅度。

Comments Project page: https://cvlab-stonybrook.github.io/NewtonRewards

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21780 2025-12-01 cs.MM cs.SD 83%

3MDiT: Unified Tri-Modal Diffusion Transformer for Text-Driven Synchronized Audio-Video Generation

3MDiT:用于文本驱动同步音频视频生成的统一三模态扩散变换器

Yaoru Li, Heyu Si, Federico Landi, Pilar Oplustil Gallegos, Ioannis Koutsoumpas, O. Ricardo Cortez Vazquez, Ruiju Fu, Qi Guo, Xin Jin, Shunyu Liu, Mingli Song

机构 * Zhejiang University(浙江大学) Huawei(华为) Nanyang Technological University(南洋理工大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.MM

AI总结 3MDiT提出了一种统一三模态扩散变换器,通过联合演变流实现文本驱动的同步音频视频生成,提升多模态对齐与同步性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20647 2025-11-26 cs.CV 83%

Diverse Video Generation with Determinantal Point Process-Guided Policy Optimization

多样视频生成与确定性点过程引导的策略优化

Tahira Kazimi, Connor Dunlop, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出DPP-GRPO框架,结合DPP和GRPO理论,通过显式奖励提升视频生成的多样性,同时保持高质量和提示一致性。

Comments Project webpage: https://diverse-video.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18173 2025-11-25 cs.CV 83%

EgoControl: Controllable Egocentric Video Generation via 3D Full-Body Poses

EgoControl: 通过3D全身姿态实现可控的目视视频生成

Enrico Pallotta, Sina Mokhtarzadeh Azar, Lars Doorenbos, Serdar Ozsoy, Umar Iqbal, Juergen Gall

机构 * University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉玛尔人工智能与机器学习研究所) NVIDIA(NVIDIA公司)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 EgoControl通过3D全身姿态控制生成高质量的目视视频,实现对动作的精细控制,推动具身AI的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17986 2025-11-25 cs.CV cs.AI 83%

Plan-X: Instruct Video Generation via Semantic Planning

Plan-X: 通过语义规划指导视频生成

Lun Huang, You Xie, Hongyi Xu, Tianpei Gu, Chenxu Zhang, Guoxian Song, Zenan Li, Xiaochen Zhao, Linjie Luo, Guillermo Sapiro

机构 * Duke University(杜克大学) Princeton University(普林斯顿大学) ByteDance Intelligent Creation(字节跳动智能创作) Apple(苹果公司)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 Plan-X通过语义规划框架减少视频生成中的视觉幻觉,实现与多模态上下文一致的精细指令对齐生成。

Comments The project page is at https://byteaigc.github.io/Plan-X

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12953 2025-11-25 cs.CV 83%

Frame-wise Conditioning Adaptation for Fine-Tuning Diffusion Models in Text-to-Video Prediction

基于帧级条件的微调扩散模型用于文本到视频预测

Zheyuan Liu, Junyan Wang, Zicheng Duan, Cristian Rodriguez-Opazo, Anton van den Hengel

专题命中 视频生成 :text-to-video(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本文提出帧级条件适应方法,通过引入帧级文本嵌入提升文本到视频预测的连续性与生成质量。

Comments Accepted by TMLR, 11/2025. 29 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16657 2025-11-17 cs.CV cs.AI cs.CL 83%

DreamRunner: Fine-Grained Compositional Story-to-Video Generation with Retrieval-Augmented Motion Adaptation

Zun Wang, Jialu Li, Han Lin, Jaehong Yoon, Mohit Bansal

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

Comments AAAI 2026, Project website: https://zunwang1.github.io/DreamRunner

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06055 2025-11-11 cs.CV 83%

Neodragon: Mobile Video Generation using Diffusion Transformer

Animesh Karnewar, Denis Korzhenkov, Ioannis Lelekas, Adil Karjauv, Noor Fathima, Hanwen Xiong, Vancheeswaran Vaidyanathan, Will Zeng, Rafael Esteves, Tushar Singhal, Fatih Porikli, Mohsen Ghafoorian, Amirhossein Habibian

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15980 2025-11-07 cs.CV cs.AI 83%

Advanced Sign Language Video Generation with Compressed and Quantized Multi-Condition Tokenization

Cong Wang, Zexuan Deng, Zhiwei Jiang, Yafeng Yin, Fei Shen, Zifeng Cheng, Shiping Ge, Shiwei Gan, Qing Gu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) National University of Singapore(新加坡国立大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22431 2025-10-28 cs.MA cs.CV 83%

Hollywood Town: Long-Video Generation via Cross-Modal Multi-Agent Orchestration

Zheng Wei, Mingchen Li, Zeqian Zhang, Ruibin Yuan, Pan Hui, Huamin Qu, James Evans, Maneesh Agrawala, Anyi Rao

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Chicago(芝加哥大学) Stanford University(斯坦福大学)

专题命中 视频生成 :video generation(title,abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21696 2025-10-27 cs.CV 83%

BachVid: Training-Free Video Generation with Consistent Background and Character

Han Yan, Xibin Song, Yifu Wang, Hongdong Li, Pan Ji, Chao Ma

机构 * MoE Key Lab of Artificial, AI Institute, Shanghai Jiao Tong University(人工智能研究院,上海交通大学) Vertex Lab(Vertex实验室) Australian National University(澳大利亚国立大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

Comments Project page: https://wolfball.github.io/bachvid

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16500 2025-10-27 cs.CV 83%

RLGF: Reinforcement Learning with Geometric Feedback for Autonomous Driving Video Generation

Tianyi Yan, Wencheng Han, Xia Zhou, Xueyang Zhang, Kun Zhan, Cheng-zhong Xu, Jianbing Shen

机构 * SKL-IOTSC, Computer and Information Science, University of Macau(澳门大学计算机与信息科学学院) Li Auto Inc(利汽车公司)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20888 2025-10-27 cs.CV cs.AI 83%

Video-As-Prompt: Unified Semantic Control for Video Generation

Yuxuan Bian, Xin Chen, Zenan Li, Tiancheng Zhi, Shen Sang, Linjie Luo, Qiang Xu

机构 * Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

Comments Website: https://bytedance.github.io/Video-As-Prompt

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21491 2025-10-27 cs.CV 83%

Frame In-N-Out: Unbounded Controllable Image-to-Video Generation

Boyang Wang, Xuweiyi Chen, Matheus Gadelha, Zezhou Cheng

机构 * University of Virginia(弗吉尼亚大学) Adobe Research(Adobe研究)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19193 2025-10-24 cs.CV 83%

Video Consistency Distance: Enhancing Temporal Consistency for Image-to-Video Generation via Reward-Based Fine-Tuning

Takehiro Aoshima, Yusuke Shinohara, Byeongseon Park

机构 * LY Corporation(LY公司)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03639 2025-10-24 cs.CV 83%

Towards Physical Understanding in Video Generation: A 3D Point Regularization Approach

Yunuo Chen, Junli Cao, Vidit Goel, Sergei Korolev, Chenfanfu Jiang, Jian Ren, Sergey Tulyakov, Anil Kag

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Snap Inc(Snap公司)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

Comments Project Page: \url{https://snap-research.github.io/PointVidGen/}

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15831 2025-10-20 cs.CV 83%

VISTA: A Test-Time Self-Improving Video Generation Agent

Do Xuan Long, Xingchen Wan, Hootan Nakhost, Chen-Yu Lee, Tomas Pfister, Sercan Ö. Arık

机构 * Google(谷歌)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15104 2025-10-20 cs.CV 83%

TGT: Text-Grounded Trajectories for Locally Controlled Video Generation

Guofeng Zhang, Angtian Wang, Jacob Zhiyuan Fang, Liming Jiang, Haotian Yang, Bo Liu, Yiding Yang, Guang Chen, Longyin Wen, Alan Yuille, Chongyang Ma

机构 * Johns Hopkins University(约翰霍普金斯大学) Bytedance, Intelligent Creation(字节跳动,智能创作)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03207 2025-10-16 cs.CV cs.GR 83%

MotionAgent: Fine-grained Controllable Video Generation via Motion Field Agent

Xinyao Liao, Xianfang Zeng, Liao Wang, Gang Yu, Guosheng Lin, Chi Zhang

机构 * Nanyang Technological University(南洋理工大学) StepFun Westlake University(西湖大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19495 2025-10-13 cs.CV 83%

The Role of Video Generation in Enhancing Data-Limited Action Understanding

Wei Li, Dezhao Luo, Dongbao Yang, Zhenhang Li, Weiping Wang, Yu Zhou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) VCIP & TMCC & DISSec, College of Computer Science, Nankai University(南开大学计算机学院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Queen Mary University of London(伦敦大学玛丽女王学院)

专题命中 视频生成 :video generation(title);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

Comments IJCAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05093 2025-10-07 cs.CV 83%

Character Mixing for Video Generation

Tingting Liao, Chongjian Ge, Guangyi Liu, Hao Li, Yi Zhou

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·宾·扎耶德人工智能大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03909 2025-10-07 cs.CV 83%

Generating Human Motion Videos using a Cascaded Text-to-Video Framework

Hyelin Nam, Hyojun Go, Byeongjun Park, Byung-Hoon Kim, Hyungjin Chung

机构 * EverEx University of Michigan(密歇根大学) ETH Zurich(苏黎世联邦理工学院) Yonsei University(延世大学)

专题命中 视频生成 :text-to-video(title);video generation(abstract);video diffusion(abstract);分类 cs.CV

Comments 18 pages, 7 figures, Project Page:https://hyelinnam.github.io/Cameo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11100 2025-10-07 cs.CV 83%

DynamicScaler: Seamless and Scalable Video Generation for Panoramic Scenes

Jinxiu Liu, Shaoheng Lin, Yinxiao Li, Ming-Hsuan Yang

机构 * South China University of Technology(南方科技大学) Google DeepMind(谷歌DeepMind) UC Merced(加州大学默塞德分校)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02283 2025-10-03 cs.CV cs.AI 83%

Self-Forcing++: Towards Minute-Scale High-Quality Video Generation

Justin Cui, Jie Wu, Ming Li, Tao Yang, Xiaojie Li, Rui Wang, Andrew Bai, Yuanhao Ban, Cho-Jui Hsieh

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 视频生成 :video generation(title,abstract);long video(abstract);分类 cs.CV

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26391 2025-10-01 cs.CV 83%

MotionRAG: Motion Retrieval-Augmented Image-to-Video Generation

Chenhui Zhu, Yilu Wu, Shuai Wang, Gangshan Wu, Limin Wang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25182 2025-09-30 cs.CV cs.AI 83%

DC-VideoGen: Efficient Video Generation with Deep Compression Video Autoencoder

Junyu Chen, Wenkun He, Yuchao Gu, Yuyang Zhao, Jincheng Yu, Junsong Chen, Dongyun Zou, Yujun Lin, Zhekai Zhang, Muyang Li, Haocheng Xi, Ligeng Zhu, Enze Xie, Song Han, Han Cai

机构 * NVIDIA(英伟达)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

Comments Tech Report. The first three authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10774 2025-09-30 cs.CV cs.AI cs.LG 83%

BLADE: Block-Sparse Attention Meets Step Distillation for Efficient Video Generation

Youping Gu, Xiaolong Li, Yuhao Hu, Minqi Chen, Bohan Zhuang

机构 * Zhejiang University(浙江大学) Central Media Technology Institute, Huawei Technologies(华为技术有限公司中央媒体技术研究所)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21893 2025-09-29 cs.CV 83%

Syncphony: Synchronized Audio-to-Video Generation with Diffusion Transformers

Jibin Song, Mingi Kwon, Jaeseok Jeong, Youngjung Uh

机构 * Yonsei University(延世大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

Comments Project page: https://jibin86.github.io/syncphony_project_page

详情

展开后加载摘要…

URL PDF HTML 收藏