arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2143 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2143 篇

2507.20855 2025-07-29 cs.CV 57%

Compositional Video Synthesis by Temporal Object-Centric Learning

Adil Kaan Akan, Yucel Yemez

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments 12+21 pages, submitted to IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18945 2025-07-29 cs.CV cs.AI cs.LG cs.RO 57%

Aether: Geometric-Aware Unified World Modeling

Aether Team, Haoyi Zhu, Yifan Wang, Jianjun Zhou, Wenzheng Chang, Yang Zhou, Zizun Li, Junyi Chen, Chunhua Shen, Jiangmiao Pang, Tong He

机构 * USTC Shanghai AI Lab(USTC上海人工智能实验室) SII SJTU(SJTU信息研究所) ZJU FDU(浙江大学福州大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Project Page: https://aether-world.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.06438 2025-07-29 cs.CV 57%

Qffusion: Controllable Portrait Video Editing via Quadrant-Grid Attention Learning

Maomao Li, Lijian Lin, Yunfei Liu, Ye Zhu, Yu Li

机构 * International Digital Economy Academy (IDEA)(国际数字经济学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments 19 pages

Journal ref TVCG 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12789 2025-07-29 cs.CV 57%

Efficient Physics Simulation for 3D Scenes via MLLM-Guided Gaussian Splatting

Haoyu Zhao, Hao Wang, Xingyue Zhao, Hao Fei, Hongqiu Wang, Chengjiang Long, Hua Zou

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Wuhan National Laboratory for Optoelectronics, Huazhong University of Science and Technology(华中科技大学光电研究院) Meta Reality Lab(Meta现实实验室) Xi’an Jiao Tong University(西安交通大学) National University of Singapore(新加坡国立大学) The Department of Systems Hub, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学系统枢纽部门(广州))

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14475 2025-07-28 cs.CV cs.AI 57%

MagicDrive3D: Controllable 3D Generation for Any-View Rendering in Street Scenes

Ruiyuan Gao, Kai Chen, Zhihao Li, Lanqing Hong, Zhenguo Li, Qiang Xu

机构 * CUHK(香港中文大学) HKUST(香港理工大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Project Page: https://flymin.github.io/magicdrive3d

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01729 2025-07-21 cs.CV 57%

PosePilot: Steering Camera Pose for Generative World Models with Self-supervised Depth

Bu Jin, Weize Li, Baihan Yang, Zhenxin Zhu, Junpeng Jiang, Huan-ang Gao, Haiyang Sun, Kun Zhan, Hengtong Hu, Xueyang Zhang, Peng Jia, Hao Zhao

机构 * The Hong Kong University of Science and Technology(香港科技大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Li Auto BAAI(北京人工智能研究院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Accepted at IEEE/RSJ IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08917 2025-07-15 cs.CV 57%

Detecting Deepfake Talking Heads from Facial Biometric Anomalies

Justin D. Norman, Hany Farid

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments 10 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06739 2025-07-10 cs.CV 57%

PromptTea: Let Prompts Tell TeaCache the Optimal Threshold

Zishen Huang, Chunyu Yang, Mengyuan Ren

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04559 2025-07-08 cs.CV 57%

MambaVideo for Discrete Video Tokenization with Channel-Split Quantization

Dawit Mureja Argaw, Xian Liu, Joon Son Chung, Ming-Yu Liu, Fitsum Reda

机构 * NVIDIA KAIST(韩国科学技术院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Project website: https://research.nvidia.com/labs/dir/mamba-tokenizer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14151 2025-07-03 cs.CV cs.AI 57%

Concat-ID: Towards Universal Identity-Preserving Video Synthesis

Yong Zhong, Zhuoyi Yang, Jiayan Teng, Xiaotao Gu, Chongxuan Li

机构 * Gaoling School of AI, Renmin University of China(中国人民大学人工智能学院) Tsinghua University(清华大学) Zhipu AI(智谱AI)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23135 2025-07-01 cs.CV cs.RO 57%

RoboScape: Physics-informed Embodied World Model

Yu Shang, Xin Zhang, Yinzhou Tang, Lei Jin, Chen Gao, Wei Wu, Yong Li

机构 * Tsinghua University(清华大学) Manifold AI

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22868 2025-07-01 cs.CV cs.AI 57%

STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing

Junsung Lee, Junoh Kang, Bohyung Han

机构 * Seoul National University(首尔国立大学)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

Comments 15 pages, 9 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01061 2025-07-01 cs.CV 57%

OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation Models

Gaojie Lin, Jianwen Jiang, Jiaqi Yang, Zerong Zheng, Chao Liang

机构 * ByteDance(字节跳动)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments ICCV 2025, Homepage: https://omnihuman-lab.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10718 2025-07-01 cs.CV 57%

Grid: Omni Visual Generation

Cong Wan, Xiangyang Luo, Hao Luo, Zijian Cai, Yiren Song, Yunlong Zhao, Yifan Bai, Fan Wang, Yuhang He, Yihong Gong

机构 * Xi’an Jiaotong University(西安交通大学) Tsinghua University(清华大学) DAMO Academy, Alibaba Group(阿里云实验室) Chinese Academy of Sciences(中国科学院) National University of Singapore(新加坡国立大学)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

Comments Codes: https://github.com/Should-AI-Lab/GRID

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20601 2025-06-26 cs.CV 57%

Video Perception Models for 3D Scene Synthesis

Rui Huang, Guangyao Zhai, Zuria Bauer, Marc Pollefeys, Federico Tombari, Leonidas Guibas, Gao Huang, Francis Engelmann

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18901 2025-06-24 cs.CV 57%

From Virtual Games to Real-World Play

Wenqiang Sun, Fangyun Wei, Jinjing Zhao, Xi Chen, Zilong Chen, Hongyang Zhang, Jun Zhang, Yan Lu

机构 * HKUST(香港科技大学) Microsoft Research(微软研究院) University of Sydney(悉尼大学) Tsinghua University(清华大学) University of Waterloo(滑铁卢大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Project page: https://wenqsun.github.io/RealPlay/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18899 2025-06-24 cs.CV 57%

FilMaster: Bridging Cinematic Principles and Generative AI for Automated Film Generation

Kaiyi Huang, Yukun Huang, Xintao Wang, Zinan Lin, Xuefei Ning, Pengfei Wan, Di Zhang, Yu Wang, Xihui Liu

机构 * The University of Hong Kong(香港大学) Kuaishou Technology(快手科技) Microsoft Research(微软研究院) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Project Page: https://filmaster-ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18701 2025-06-24 cs.CV cs.AI 57%

Matrix-Game: Interactive World Foundation Model

Yifan Zhang, Chunli Peng, Boyang Wang, Puyi Wang, Qingcheng Zhu, Fei Kang, Biao Jiang, Zedong Gao, Eric Li, Yang Liu, Yahui Zhou

机构 * Skywork AI

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19637 2025-06-24 cs.CV 57%

ReNeg: Learning Negative Embedding with Reward Guidance

Xiaomin Li, Yixuan Liu, Takashi Isobe, Xu Jia, Qinpeng Cui, Dong Zhou, Dong Li, You He, Huchuan Lu, Zhongdao Wang, Emad Barsoum

机构 * Advanced Micro Devices Inc.(先进微器件公司) Dalian University of Technology(大连理工大学) Tsinghua University(清华大学)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

Comments Code: https://github.com/AMD-AIG-AIMA/ReNeg

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16054 2025-06-23 cs.CV cs.GR 57%

PAROAttention: Pattern-Aware ReOrdering for Efficient Sparse and Quantized Attention in Visual Generation Models

Tianchen Zhao, Ke Hong, Xinhao Yang, Xuefeng Xiao, Huixia Li, Feng Ling, Ruiqi Xie, Siqi Chen, Hongyu Zhu, Yichong Zhang, Yu Wang

机构 * Tsinghua University(清华大学) ByteDance Seed(字节跳动种子)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments project page: https://a-suozhang.xyz/paroattn.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14168 2025-06-19 cs.CV cs.AI 57%

VideoMAR: Autoregressive Video Generatio with Continuous Tokens

Hu Yu, Biao Gong, Hangjie Yuan, DanDan Zheng, Weilong Chai, Jingdong Chen, Kecheng Zheng, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09042 2025-06-19 cs.CV 57%

Cosmos-Drive-Dreams: Scalable Synthetic Driving Data Generation with World Foundation Models

Xuanchi Ren, Yifan Lu, Tianshi Cao, Ruiyuan Gao, Shengyu Huang, Amirmojtaba Sabour, Tianchang Shen, Tobias Pfaff, Jay Zhangjie Wu, Runjian Chen, Seung Wook Kim, Jun Gao, Laura Leal-Taixe, Mike Chen, Sanja Fidler, Huan Ling

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Only the core contributors are listed. The full list of contributors can be found in Appendix A of this paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21264 2025-06-18 cs.CV cs.AI 57%

LARP: Tokenizing Videos with a Learned Autoregressive Generative Prior

Hanyu Wang, Saksham Suri, Yixuan Ren, Hao Chen, Abhinav Shrivastava

机构 * University of Maryland, College Park(马里兰大学 College Park 分校)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments ICLR 2025. Project page: https://hywang66.github.io/larp/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04746 2025-06-16 cs.CV 57%

Taming Rectified Flow for Inversion and Editing

Jiangshan Wang, Junfu Pu, Zhongang Qi, Jiayi Guo, Yue Ma, Nisha Huang, Yuxin Chen, Xiu Li, Ying Shan

机构 * Tsinghua University(清华大学) ARC Lab, Tencent PCG(腾讯ARC实验室)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments ICML 2025; GitHub: https://github.com/wangjiangshan0725/RF-Solver-Edit

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10975 2025-06-13 cs.CV 57%

GenWorld: Towards Detecting AI-generated Real-world Simulation Videos

Weiliang Chen, Wenzhao Zheng, Yu Zheng, Lei Chen, Jie Zhou, Jiwen Lu, Yueqi Duan

机构 * Department of Automation, Tsinghua University, China(自动化系,清华大学) Department of Electronic Engineering, Tsinghua University, China(电子工程系,清华大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08279 2025-06-11 cs.CV cs.AI cs.LG 57%

Seeing Voices: Generating A-Roll Video from Audio with Mirage

Aditi Sundararaman, Amogh Adishesha, Andrew Jaegle, Dan Bigioi, Hyoung-Kyu Song, Jon Kyl, Justin Mao, Kevin Lan, Mojtaba Komeili, ShahRukh Athar, Sheila Babayan, Stanislau Beliasau, William Buchwalter

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Technical report website: mirage.app/research/seeing-voices, product website: mirage.app

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07205 2025-06-10 cs.CV 57%

TV-LiVE: Training-Free, Text-Guided Video Editing via Layer Informed Vitality Exploitation

Min-Jung Kim, Dongjin Kim, Seokju Yun, Jaegul Choo

机构 * KAIST AI(韩国科学技术院人工智能研究所) University of Seoul(首尔大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21136 2025-06-09 cs.LG cs.AI cs.AR cs.CV 57%

SageAttention2++: A More Efficient Implementation of SageAttention2

Jintao Zhang, Xiaoming Xu, Jia Wei, Haofeng Huang, Pengle Zhang, Chendong Xiang, Jun Zhu, Jianfei Chen

机构 * Department of Computer Science, Tsinghua University(清华大学计算机科学系)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04590 2025-06-06 cs.CV 57%

Follow-Your-Creation: Empowering 4D Creation through Video Inpainting

Yue Ma, Kunyu Feng, Xinhua Zhang, Hongyu Liu, David Junhao Zhang, Jinbo Xing, Yinhan Zhang, Ayden Yang, Zeyu Wang, Qifeng Chen

机构 * HKUST(香港科技大学) HKUST(GZ)(香港科技大学(广州)) NUS(国立新加坡大学) Tsinghua Univerisity(清华大学) CUHK(香港中文大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Project Page: https://follow-your-creation.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02444 2025-06-06 cs.CV 57%

SViMo: Synchronized Diffusion for Video and Motion Generation in Hand-object Interaction Scenarios

Lingwei Dang, Ruizhi Shao, Hongwen Zhang, Wei Min, Yebin Liu, Qingyao Wu

机构 * School of Software Engineering, South China University of Technology(华南理工大学软件工程学院) Department of Automation, Tsinghua University(清华大学自动化系) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏