arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2143 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2143 篇

2506.02875 2025-06-04 cs.CV 57%

NTIRE 2025 XGC Quality Assessment Challenge: Methods and Results

Xiaohong Liu, Xiongkuo Min, Qiang Hu, Xiaoyun Zhang, Jie Guo, Guangtao Zhai, Shushi Wang, Yingjie Zhou, Lu Liu, Jingxin Li, Liu Yang, Farong Wen, Li Xu, Yanwei Jiang, Xilei Zhu, Chunyi Li, Zicheng Zhang, Huiyu Duan, Xiele Wu, Yixuan Gao, Yuqin Cao, Jun Jia, Wei Sun, Jiezhang Cao, Radu Timofte, Baojun Li, Jiamian Huang, Dan Luo, Tao Liu, Weixia Zhang, Bingkun Zheng, Junlin Chen, Ruikai Zhou, Meiya Chen, Yu Wang, Hao Jiang, Xiantao Li, Yuxiang Jiang, Jun Tang, Yimeng Zhao, Bo Hu, Zelu Qi, Chaoyang Zhang, Fei Zhao, Ping Shi, Lingzhi Fu, Heng Cong, Shuai He, Rongyu Zhang, Jiarong He, Zongyao Hu, Wei Luo, Zihao Yu, Fengbin Guan, Yiting Lu, Xin Li, Zhibo Chen, Mengjing Su, Yi Wang, Tuo Chen, Chunxiao Li, Shuaiyu Zhao, Jiaxin Wen, Chuyi Lin, Sitong Liu, Ningxin Chu, Jing Wan, Yu Zhou, Baoying Chen, Jishen Zeng, Jiarui Liu, Xianjin Liu, Xin Chen, Lanzhi Zhou, Hangyu Li, You Han, Bibo Xiang, Zhenjie Liu, Jianzhang Lu, Jialin Gui, Renjie Lu, Shangfei Wang, Donghao Zhou, Jingyu Lin, Quanjian Song, Jiancheng Huang, Yufeng Yang, Changwei Wang, Shupeng Zhong, Yang Yang, Lihuo He, Jia Liu, Yuting Xing, Tida Fang, Yuchun Jin

机构 * The organizers of the NTIRE 2025 XGC Quality Challenge(NTIRE 2025 XGC质量评估挑战的组织者)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

Comments NTIRE 2025 XGC Quality Assessment Challenge Report. arXiv admin note: text overlap with arXiv:2404.16687

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05902 2025-06-03 cs.CV cs.CL 57%

Autoregressive Models in Vision: A Survey

Jing Xiong, Gongye Liu, Lun Huang, Chengyue Wu, Taiqiang Wu, Yao Mu, Yuan Yao, Hui Shen, Zhongwei Wan, Jinfa Huang, Chaofan Tao, Shen Yan, Huaxiu Yao, Lingpeng Kong, Hongxia Yang, Mi Zhang, Guillermo Sapiro, Jiebo Luo, Ping Luo, Ngai Wong

机构 * The University of Hong Kong(香港大学) Tsinghua University(清华大学) Duke University(杜克大学) University of Rochester(罗切斯特大学) The Ohio State University(俄亥俄州立大学) Bytedance(字节跳动) The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Apple(苹果公司) The Hong Kong Polytechnic University(香港理工大学) Princeton University(普林斯顿大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments The paper is accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24733 2025-06-02 cs.CV 57%

DreamDance: Animating Character Art via Inpainting Stable Gaussian Worlds

Jiaxu Zhang, Xianfang Zeng, Xin Chen, Wei Zuo, Gang Yu, Guosheng Lin, Zhigang Tu

机构 * Wuhan University(武汉大学) Nanyang Technological University(南洋理工大学) StepFun ByteDance(字节跳动)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24156 2025-06-02 cs.CV cs.RO 57%

Towards a Generalizable Bimanual Foundation Policy via Flow-based Video Prediction

Chenyou Fan, Fangzheng Yan, Chenjia Bai, Jiepeng Wang, Chi Zhang, Zhen Wang, Xuelong Li

机构 * Institute of Artificial intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) Northwestern Polytechnical University(西北工业大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17359 2025-05-30 cs.CV 57%

Position: Interactive Generative Video as Next-Generation Game Engine

Jiwen Yu, Yiran Qin, Haoxuan Che, Quande Liu, Xintao Wang, Pengfei Wan, Di Zhang, Xihui Liu

机构 * HKU(香港大学) HKUST(香港理工大学) Kuaishou Technology(快手科技)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14135 2025-05-29 cs.CV 57%

Hunyuan-Game: Industrial-grade Intelligent Game Creation Model

Ruihuang Li, Caijin Zhou, Shoujian Zheng, Jianxiang Lu, Jiabin Huang, Comi Chen, Junshu Tang, Guangzheng Xu, Jiale Tao, Hongmei Wang, Donghao Li, Wenqing Yu, Senbo Wang, Zhimin Li, Yetshuan Shi, Haoyu Yang, Yukun Wang, Wenxun Dai, Jiaqi Li, Linqing Wang, Qixun Wang, Zhiyong Xu, Yingfang Zhang, Jiangfeng Xiong, Weijie Kong, Chao Zhang, Hongxin Zhang, Qiaoling Zheng, Weiting Guo, Xinchi Deng, Yixuan Li, Renjia Wei, Yulin Jian, Duojun Huang, Xuhua Ren, Junkun Yuan, Zhengguang Zhou, Jiaxiang Cheng, Bing Ma, Shirui Huang, Jiawang Bai, Chao Li, Sihuan Lin, Yifu Sun, Yuan Zhou, Joey Wang, Qin Lin, Tianxiang Zheng, Jingmiao Yu, Jihong Zhang, Caesar Zhong, Di Wang, Yuhong Liu, Linus, Jie Jiang, Longhuang Wu, Shuai Shao, Qinglin Lu

机构 * Tencent(腾讯)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02492 2025-05-27 cs.CV 57%

VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models

Hila Chefer, Uriel Singer, Amit Zohar, Yuval Kirstain, Adam Polyak, Yaniv Taigman, Lior Wolf, Shelly Sheynin

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19692 2025-05-27 cs.CV 57%

DriveCamSim: Generalizable Camera Simulation via Explicit Camera Modeling for Autonomous Driving

Wenchao Sun, Xuewu Lin, Keyu Chen, Zixiang Pei, Yining Shi, Chuang Zhang, Sifa Zheng

机构 * Tsinghua University(清华大学) Horizon Horizon Continental Technology

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19017 2025-05-27 cs.RO cs.CV cs.LG 57%

WorldEval: World Model as Real-World Robot Policies Evaluator

Yaxuan Li, Yichen Zhu, Junjie Wen, Chaomin Shen, Yi Xu

机构 * Midea Group(美的集团) East China Normal University(华东师范大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments The project page is available at https://worldeval.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18650 2025-05-27 cs.CV 57%

ProphetDWM: A Driving World Model for Rolling Out Future Actions and Videos

Xiaodong Wang, Peixi Peng

机构 * Peking University(北京大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15863 2025-05-23 cs.CV cs.AI cs.RO 57%

Generative AI for Autonomous Driving: A Review

Katharina Winter, Abhishek Vivekanandan, Rupert Polley, Yinzhe Shen, Christian Schlauch, Mohamed-Khalil Bouzidi, Bojan Derajic, Natalie Grabowsky, Annajoyce Mariani, Dennis Rochau, Giovanni Lucente, Harsh Yadav, Firas Mualla, Adam Molin, Sebastian Bernhard, Christian Wirth, Ömer Şahin Taş, Nadja Klein, Fabian B. Flohr, Hanno Gottschalk

机构 * Munich University of Applied Sciences, Intelligent Vehicles Lab (IVL)(慕尼黑应用技术大学,智能车辆实验室) FZI Research Center for Information Technology(弗劳恩霍夫信息技术研究中心) Continental Automotive Technologies GmbH(大陆汽车技术有限公司) Technical University of Berlin, Institute of Mathematics(柏林技术大学,数学系) German Aerospace Center (DLR), Institute of Transportation Systems(德国航空航天中心(DLR),交通运输系统研究所) Aptiv Services Deutschland GmbH(Aptiv 德国服务有限公司) AI Lab, ZF Friedrichshafen AG(ZF弗劳恩霍夫汽车有限公司人工智能实验室) DENSO AUTOMOTIVE Deutschland GmbH(DENSO 汽车德国有限公司) Karlsruhe Institute of Technology, Scientific Computing Center(卡尔斯鲁厄理工学院,科学计算中心)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12237 2025-05-20 cs.CV 57%

From Shots to Stories: LLM-Assisted Video Editing with Unified Language Representations

Yuzhi Li, Haojun Xu, Feng Tian

机构 * Shanghai University(上海大学)

专题命中 视频生成 :video understanding(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07057 2025-05-13 cs.CV 57%

DAPE: Dual-Stage Parameter-Efficient Fine-Tuning for Consistent Video Editing with Diffusion Models

Junhao Xia, Chaoyang Zhang, Yecheng Zhang, Chengyang Zhou, Zhichang Wang, Bochun Liu, Dongshuo Yin

机构 * Tsinghua University(清华大学) Duke University(杜克大学) Peking University(北京大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00975 2025-05-05 cs.CV 57%

Generating Animated Layouts as Structured Text Representations

Yeonsang Shin, Jihwan Kim, Yumin Song, Kyungseung Lee, Hyunhee Chung, Taeyoung Na

机构 * Seoul National University(首尔国立大学) SK telecom(SK电信)

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

Comments AI for Content Creation (AI4CC) Workshop at CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20995 2025-04-30 cs.CV cs.RO 57%

TesserAct: Learning 4D Embodied World Models

Haoyu Zhen, Qiao Sun, Hongxin Zhang, Junyan Li, Siyuan Zhou, Yilun Du, Chuang Gan

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) HKUST(香港科技大学) Harvard University(哈佛大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Project Page: https://tesseractworld.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17828 2025-04-28 cs.CV cs.AI 57%

VEU-Bench: Towards Comprehensive Understanding of Video Editing

Bozheng Li, Yongliang Wu, Yi Lu, Jiashuo Yu, Licheng Tang, Jiawang Cao, Wenqing Zhu, Yuyang Sun, Jay Wu, Wenbo Zhu

机构 * Opus AI Research(Opus AI研究机构) Brown University(布朗大学) Southeast University(东南大学) University of Toronto(多伦多大学) Fudan University(复旦大学)

专题命中 视频生成 :video understanding(abstract);分类 cs.CV

Comments Accepted to CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17788 2025-04-25 cs.CV 57%

Dynamic Camera Poses and Where to Find Them

Chris Rockwell, Joseph Tung, Tsung-Yi Lin, Ming-Yu Liu, David F. Fouhey, Chen-Hsuan Lin

机构 * NVIDIA University of Michigan(密歇根大学) New York University(纽约大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Accepted to CVPR 2025. Project Page: https://research.nvidia.com/labs/dir/dynpose-100k

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16016 2025-04-23 cs.CV 57%

Efficient Temporal Consistency in Diffusion-Based Video Editing with Adaptor Modules: A Theoretical Framework

Xinyuan Song, Yangfan He, Sida Li, Jianhui Wang, Hongyang He, Xinhang Yuan, Ruoyu Wang, Jiaqi Chen, Keqin Li, Kuan Lu, Menghao Huo, Binxu Li, Pei Liu

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments arXiv admin note: substantial text overlap with arXiv:2501.04606

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13074 2025-04-22 cs.CV 57%

SkyReels-V2: Infinite-length Film Generative Model

Guibin Chen, Dixuan Lin, Jiangping Yang, Chunze Lin, Junchen Zhu, Mingyuan Fan, Hao Zhang, Sheng Chen, Zheng Chen, Chengcheng Ma, Weiming Xiong, Wei Wang, Nuo Pang, Kang Kang, Zhiheng Xu, Yuzhe Jin, Yupeng Liang, Yubing Song, Peng Zhao, Boyuan Xu, Di Qiu, Debang Li, Zhengcong Fei, Yang Li, Yahui Zhou

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments 31 pages,10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02085 2025-04-22 cs.CV cs.AI 57%

Detecting AI-Generated Video via Frame Consistency

Long Ma, Zhiyuan Yan, Qinglang Guo, Yong Liao, Haiyang Yu, Pengyuan Zhou

机构 * University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) Zhejiang University(浙江大学) Aarhus University(阿鲁斯大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14470 2025-04-22 cs.CV 57%

Turbo2K: Towards Ultra-Efficient and High-Quality 2K Video Synthesis

Jingjing Ren, Wenbo Li, Zhongdao Wang, Haoze Sun, Bangzhen Liu, Haoyu Chen, Jiaqi Xu, Aoxue Li, Shifeng Zhang, Bin Shao, Yong Guo, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Huawei Noah’s Ark Lab(华为诺亚实验室) South China University of Technology(华南理工大学) Max Planck Institute for Informatics(马克斯·普朗克研究所(信息学)) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Webpage at https://jingjingrenabc.github.io/turbo2k/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20314 2025-04-22 cs.CV 57%

Wan: Open and Advanced Large-Scale Video Generative Models

Team Wan, Ang Wang, Baole Ai, Bin Wen, Chaojie Mao, Chen-Wei Xie, Di Chen, Feiwu Yu, Haiming Zhao, Jianxiao Yang, Jianyuan Zeng, Jiayu Wang, Jingfeng Zhang, Jingren Zhou, Jinkai Wang, Jixuan Chen, Kai Zhu, Kang Zhao, Keyu Yan, Lianghua Huang, Mengyang Feng, Ningyi Zhang, Pandeng Li, Pingyu Wu, Ruihang Chu, Ruili Feng, Shiwei Zhang, Siyang Sun, Tao Fang, Tianxing Wang, Tianyi Gui, Tingyu Weng, Tong Shen, Wei Lin, Wei Wang, Wei Wang, Wenmeng Zhou, Wente Wang, Wenting Shen, Wenyuan Yu, Xianzhong Shi, Xiaoming Huang, Xin Xu, Yan Kou, Yangyu Lv, Yifei Li, Yijing Liu, Yiming Wang, Yingya Zhang, Yitong Huang, Yong Li, You Wu, Yu Liu, Yulin Pan, Yun Zheng, Yuntao Hong, Yupeng Shi, Yutong Feng, Zeyinzi Jiang, Zhen Han, Zhi-Fan Wu, Ziyu Liu

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments 60 pages, 33 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03572 2025-04-15 cs.CV cs.AI cs.LG cs.RO 57%

Navigation World Models

Amir Bar, Gaoyue Zhou, Danny Tran, Trevor Darrell, Yann LeCun

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments CVPR 2025. Project page: https://www.amirbar.net/nwm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16199 2025-04-09 cs.CV 57%

VIRES: Video Instance Repainting via Sketch and Text Guided Generation

Shuchen Weng, Haojie Zheng, Peixuan Zhang, Yuchen Hong, Han Jiang, Si Li, Boxin Shi

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04153 2025-04-08 cs.GR cs.CV 57%

Video4DGen: Enhancing Video and 4D Generation through Mutual Optimization

Yikai Wang, Guangce Liu, Xinzhou Wang, Zilong Chen, Jiafang Li, Xin Liang, Fuchun Sun, Jun Zhu

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Published in TPAMI 2025. Code: https://github.com/yikaiw/Vidu4D, Project page: https://video4dgen.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02541 2025-04-08 cs.CV 57%

Enhancing Temporal Consistency in Video Editing by Reconstructing Videos with 3D Gaussian Splatting

Inkyu Shin, Qihang Yu, Xiaohui Shen, In So Kweon, Kuk-Jin Yoon, Liang-Chieh Chen

专题命中 视频生成 :video diffusion(abstract);分类 cs.CV

Comments Accepted to TMLR 2025. Project page at https://video-3dgs-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03041 2025-04-07 cs.CV 57%

VIP: Video Inpainting Pipeline for Real World Human Removal

Huiming Sun, Yikang Li, Kangning Yang, Ruineng Li, Daitao Xing, Yangbo Xie, Lan Fu, Kaiyu Zhang, Ming Chen, Jiaming Ding, Jiang Geng, Jie Cai, Zibo Meng, Chiuman Ho

专题命中 视频生成 :text-to-video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15119 2025-04-04 cs.CV 57%

Parallelized Autoregressive Visual Generation

Yuqing Wang, Shuhuai Ren, Zhijie Lin, Yujin Han, Haoyuan Guo, Zhenheng Yang, Difan Zou, Jiashi Feng, Xihui Liu

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments CVPR 2025 Accepted - Project Page: https://yuqingwang1029.github.io/PAR-project

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23307 2025-04-01 cs.CV 57%

MoCha: Towards Movie-Grade Talking Character Synthesis

Cong Wei, Bo Sun, Haoyu Ma, Ji Hou, Felix Juefei-Xu, Zecheng He, Xiaoliang Dai, Luxin Zhang, Kunpeng Li, Tingbo Hou, Animesh Sinha, Peter Vajda, Wenhu Chen

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments https://congwei1230.github.io/MoCha/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17726 2025-03-31 cs.CV cs.AI cs.LG 57%

VidTwin: Video VAE with Decoupled Structure and Dynamics

Yuchi Wang, Junliang Guo, Xinyi Xie, Tianyu He, Xu Sun, Jiang Bian

专题命中 视频生成 :video generation(abstract);分类 cs.CV

Comments Accepted by CVPR 2025; Project page: https://vidtwin.github.io/; Code: https://github.com/microsoft/VidTok/tree/main/vidtwin

详情

展开后加载摘要…

URL PDF HTML 收藏