arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6771 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2143 篇

2508.15874 2025-11-19 cs.RO cs.AI cs.CV 57%

Spatial Policy: Guiding Visuomotor Robotic Manipulation with Spatial-Aware Modeling and Reasoning

Yijun Liu, Yuwei Liu, Yuan Meng, Jieheng Zhang, Yuwei Zhou, Ye Li, Jiacheng Jiang, Kangye Ji, Shijia Ge, Zhi Wang, Wenwu Zhu

机构 * Tsinghua University(清华大学) Beijing University of Technology(北京理工大学) Guangzhou University(广州大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01711 2025-11-19 cs.CV cs.AI 57%

GAIS: Frame-Level Gated Audio-Visual Integration with Semantic Variance-Scaled Perturbation for Text-Video Retrieval

Bowen Yang, Yun Cao, Chen He, Xiaosu Su

机构 * School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17685 2025-11-12 cs.CV 57%

FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving

Shuang Zeng, Xinyuan Chang, Mengwei Xie, Xinran Liu, Yifan Bai, Zheng Pan, Mu Xu, Xing Wei, Ning Guo

机构 * Xi’an Jiaotong University(西安交通大学) Amap, Alibaba Group(阿里巴巴集团) DAMO Academy, Alibaba Group(阿里巴巴达摩院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2025 as Spotlight Presentation. Code: https://github.com/MIV-XJTU/FSDrive

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07416 2025-11-11 cs.RO cs.AI cs.CV 57%

Robot Learning from a Physical World Model

Jiageng Mao, Sicheng He, Hao-Ning Wu, Yang You, Shuyang Sun, Zhicheng Wang, Yanan Bao, Huizhong Chen, Leonidas Guibas, Vitor Guizilini, Howard Zhou, Yue Wang

机构 * Google DeepMind(谷歌DeepMind) USC(美国斯克利普斯大学) Stanford(斯坦福大学) Toyota Research Institute(丰田研究机构)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Project page: https://pointscoder.github.io/PhysWorld_Web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05682 2025-11-11 cs.CV cs.LG 57%

VMDT: Decoding the Trustworthiness of Video Foundation Models

Yujin Potter, Zhun Wang, Nicholas Crispino, Kyle Montgomery, Alexander Xiong, Ethan Y. Chang, Francesco Pinto, Yuqi Chen, Rahul Gupta, Morteza Ziyadi, Christos Christodoulopoulos, Bo Li, Chenguang Wang, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) University of California, Santa Cruz(加州大学圣克ruz分校) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Chicago(芝加哥大学) Amazon(亚马逊) Information Commissioner’s Office(信息专员办公室)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

Comments NeurIPS 2025 Datasets & Benchmarks

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16802 2025-11-07 cs.CV 57%

Seeing What Matters: Generalizable AI-generated Video Detection with Forensic-Oriented Augmentation

Riccardo Corvi, Davide Cozzolino, Ekta Prashnani, Shalini De Mello, Koki Nagano, Luisa Verdoliva

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14799 2025-11-06 cs.CV cs.AI 57%

A Survey on Text-Driven 360-Degree Panorama Generation

Hai Wang, Xiaoyu Xiang, Weihao Xia, Jing-Hao Xue

机构 * Department of Statistical Science, University College London(统计科学系,伦敦大学学院) Core AI team at Meta Reality Labs(Meta Reality Labs人工智能核心团队)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Accepted by IEEE TCSVT, Code: https://github.com/littlewhitesea/Text-Driven-Pano-Gen

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00248 2025-11-04 cs.CV cs.GR 57%

Object-Aware 4D Human Motion Generation

Shurui Gui, Deep Anil Patel, Xiner Li, Martin Renqiang Min

机构 * Texas A&M University(德克萨斯A&M大学) NEC Laboratories America(NEC美国实验室)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25772 2025-10-30 cs.CV 57%

VFXMaster: Unlocking Dynamic Visual Effect Generation via In-Context Learning

Baolu Li, Yiming Zhang, Qinghe Wang, Liqian Ma, Xiaoyu Shi, Xintao Wang, Pengfei Wan, Zhenfei Yin, Yunzhi Zhuge, Huchuan Lu, Xu Jia

机构 * Dalian University of Technology(大连理工大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) ZMO AI Inc.(ZMO人工智能公司) Oxford University(牛津大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Project Page URL:https://libaolu312.github.io/VFXMaster/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24904 2025-10-30 cs.CV 57%

VividCam: Learning Unconventional Camera Motions from Virtual Synthetic Videos

Qiucheng Wu, Handong Zhao, Zhixin Shu, Jing Shi, Yang Zhang, Shiyu Chang

机构 * UC, Santa Barbara(加州大学圣芭芭拉分校) Adobe Research(Adobe研究院) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03520 2025-10-29 cs.CV 57%

Is Sora a World Simulator? A Comprehensive Survey on General World Models and Beyond

Zheng Zhu, Xiaofeng Wang, Wangbo Zhao, Chen Min, Bohan Li, Nianchen Deng, Min Dou, Yuqi Wang, Botian Shi, Kai Wang, Chi Zhang, Yang You, Zhaoxiang Zhang, Dawei Zhao, Liang Xiao, Jian Zhao, Jiwen Lu, Guan Huang

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments This survey will be regularly updated at: https://github.com/GigaAI-research/General-World-Models-Survey

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24211 2025-10-29 cs.CV 57%

MC-SJD : Maximal Coupling Speculative Jacobi Decoding for Autoregressive Visual Generation Acceleration

Junhyuk So, Hyunho Kook, Chaeyeon Jang, Eunhyeok Park

机构 * Department of Computer Science(计算机科学系) Graduate School of Artificial Intelligence, POSTECH, South Korea(人工智能研究生院,POSTECH,韩国)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14350 2025-10-28 cs.CV cs.AI cs.CL 57%

VEGGIE: Instructional Editing and Reasoning Video Concepts with Grounded Generation

Shoubin Yu, Difan Liu, Ziqiao Ma, Yicong Hong, Yang Zhou, Hao Tan, Joyce Chai, Mohit Bansal

机构 * Adobe Research(Adobe研究机构) University of Michigan(密歇根大学) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

Comments ICCV 2025; First three authors contributed equally. Project page: https://veggie-gen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19527 2025-10-23 cs.CV 57%

PoseCrafter: Extreme Pose Estimation with Hybrid Video Synthesis

Qing Mao, Tianxin Huang, Yu Zhu, Jinqiu Sun, Yanning Zhang, Gim Hee Lee

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Computing and Data Science, The University of Hong Kong(香港大学计算机与数据科学学院) School of Astronautics, Northwestern Polytechnical University(西北工业大学航天学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07670 2025-10-17 cs.CV cs.AI 57%

Ctrl-VI: Controllable Video Synthesis via Variational Inference

Haoyi Duan, Yunzhi Zhang, Yilun Du, Jiajun Wu

机构 * Stanford University(斯坦福大学) Harvard University(哈佛大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Project page: https://video-synthesis-variational.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14648 2025-10-17 cs.CV cs.AI 57%

In-Context Learning with Unpaired Clips for Instruction-based Video Editing

Xinyao Liao, Xianfang Zeng, Ziye Song, Zhoujie Fu, Gang Yu, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) StepFun

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10623 2025-10-17 cs.LG cs.CV 57%

Flows and Diffusions on the Neural Manifold

Daniel Saragih, Deyu Cao, Tejas Balaji

机构 * Queen’s University and Vector Institute(女王大学和向量研究所) University of Tokyo(东京大学) University of Toronto(多伦多大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments 43 pages, 11 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13652 2025-10-16 cs.CV 57%

EditCast3D: Single-Frame-Guided 3D Editing with Video Propagation and View Selection

Huaizhi Qu, Ruichen Zhang, Shuqing Luo, Luchao Qi, Zhihao Zhang, Xiaoming Liu, Roni Sengupta, Tianlong Chen

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Michigan State University(密歇根州立大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12283 2025-10-15 cs.CV 57%

Dual Learning with Dynamic Knowledge Distillation and Soft Alignment for Partially Relevant Video Retrieval

Jianfeng Dong, Lei Huang, Daizong Liu, Xianke Chen, Xun Yang, Changting Lin, Xun Wang, Meng Wang

机构 * College of Computer and Information Engineering, Zhejiang Gongshang University(浙江工商大学计算机与信息工程学院) Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院) Binjiang Institute of Zhejiang University(浙江大学滨江学院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12231 2025-10-15 cs.CV 57%

BIGFix: Bidirectional Image Generation with Token Fixing

Victor Besnier, David Hurych, Andrei Bursuc, Eduardo Valle

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08789 2025-10-14 cs.CV 57%

Q-Router: Agentic Video Quality Assessment with Expert Model Routing and Artifact Localization

Shuo Xing, Soumik Dey, Mingyang Wu, Ashirbad Mishra, Naveen Ravipati, Binbin Li, Hansi Wu, Zhengzhong Tu

机构 * Department of Computer Science(计算机科学系) Cranberry-Lemon University(Cranberry-Lemon 大学) Texas A&M University(德克萨斯A&M大学) eBay Inc.(eBay公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08561 2025-10-14 cs.CV 57%

MultiCOIN: Multi-Modal COntrollable Video INbetweening

Maham Tanveer, Yang Zhou, Simon Niklaus, Ali Mahdavi Amiri, Hao Zhang, Krishna Kumar Singh, Nanxuan Zhao

机构 * Simon Fraser University(西蒙弗雷泽大学) Adobe Research(Adobe研究院)

专题命中 视频生成 :long video(abstract);分类 cs.CV

Comments Project website: https://multicoinx.github.io/multicoin/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08799 2025-10-13 cs.CV cs.AI cs.LG 57%

SkipSR: Faster Super Resolution with Token Skipping

Rohan Choudhury, Shanchuan Lin, Jianyi Wang, Hao Chen, Qi Zhao, Feng Cheng, Lu Jiang, Kris Kitani, Laszlo A. Jeni

机构 * Carnegie Mellon University(卡内基梅隆大学) ByteDance Seed(字节跳动种子)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08568 2025-10-10 cs.RO cs.AI cs.CV 57%

NovaFlow: Zero-Shot Manipulation via Actionable Flow from Generated Videos

Hongyu Li, Lingfeng Sun, Yafei Hu, Duy Ta, Jennifer Barry, George Konidaris, Jiahui Fu

机构 * Robotics and AI Institute(机器人与人工智能研究所) Brown University(布朗大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07313 2025-10-09 cs.CV cs.RO 57%

WristWorld: Generating Wrist-Views via 4D World Models for Robotic Manipulation

Zezhong Qian, Xiaowei Chi, Yuming Li, Shizun Wang, Zhiyuan Qin, Xiaozhu Ju, Sirui Han, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,计算机学院,北京大学) Hong Kong University of Science and Technology(香港科技大学) National University of Singapore(新加坡国家大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06512 2025-10-09 cs.CV cs.AI 57%

LogSTOP: Temporal Scores over Prediction Sequences for Matching and Retrieval

Avishree Khare, Hideki Okamoto, Bardh Hoxha, Georgios Fainekos, Rajeev Alur

机构 * seas.upenn.edu(宾夕法尼亚大学塞as学院)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10575 2025-10-07 cs.CV 57%

A Survey of Defenses Against AI-Generated Visual Media: Detection,Disruption, and Authentication

Jingyi Deng, Chenhao Lin, Zhengyu Zhao, Shuai Liu, Zhe Peng, Qian Wang, Chao Shen

机构 * School of Cyber Science and Engineering, Xi'an Jiaotong University(西安交通大学计算机科学与工程学院) Interdisciplinary Research Center of Frontier science and technology, Xi'an Jiaotong University(西安交通大学前沿科学与技术交叉研究中心) School of Software Engineering, Xi'an Jiaotong University(西安交通大学软件工程学院) Department of Industrial and Systems Engineering, Hong Kong Polytechnic University(香港理工大学工业与系统工程系) School of Cyber Science and Engineering, Wuhan University(武汉大学计算机科学与工程学院)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Accepted by ACM Computing Surveys

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04390 2025-10-07 cs.CV cs.AI cs.CL 57%

MorphoSim: An Interactive, Controllable, and Editable Language-guided 4D World Simulator

Xuehai He, Shijie Zhou, Thivyanth Venkateswaran, Kaizhi Zheng, Ziyu Wan, Achuta Kadambi, Xin Eric Wang

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) University of California, Los Angeles(加州大学洛杉矶分校) IIT Bombay(印度理工学院班加罗尔) Microsoft(微软公司)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18406 2025-10-06 cs.CV cs.AI cs.CL 57%

RACCooN: A Versatile Instructional Video Editing Framework with Auto-Generated Narratives

Jaehong Yoon, Shoubin Yu, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Nanyang Technological University(南洋理工大学)

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

Comments EMNLP 2025 main; The first two authors contribute equally. Project Page: https://raccoon-mllm-gen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10540 2025-10-03 cs.MA cs.CV 57%

AniMaker: Multi-Agent Animated Storytelling with MCTS-Driven Clip Generation

Haoyuan Shi, Yunxin Li, Xinyu Chen, Longyue Wang, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校) Alibaba International Digital Commerce, Hangzhou(阿里巴巴国际数字商业)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏