arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2141 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2141 篇

2605.26918 2026-05-27 cs.CL 78%

Are Video Models Zero-Shot Learners and Reasoners in Education? EduVideoBench, A Knowledge-Skills-Attitude Benchmark for Educational Video Generation

视频模型是教育领域的零样本学习者和推理者吗?EduVideoBench:面向教育视频生成的知识-技能-态度基准

Unggi Lee, Hoyoung Ahn, Yoon Choi, Seonmin Eun, Jahyun Jeong, Seonmin Jin, Harmony Jung, Hye Jin Kim, Chaerin Lee, Hyunji Lee, Jeongjin Lee, Soohwan Lee, Young-Seok Oh, Jaehyeon Park, Sun-ok Ryu, Sunyoung Shin, Yoorim Son, Haeun Park, Yeil Jeong

机构 * Korea University Sejong Campus(韩国大学世宗校区) Cardiff Metropolitan University(卡迪夫 Metropolitan 大学) Seoul National University(首尔国立大学) Bugil Academy(Bugil 学院) Gyeonggi Provincial Office of Education(京畿省教育厅) Loughborough University(洛桑大学) Korea National University of Education(韩国教育大学) Korea University(韩国大学) Korean Educational Development Institute(韩国教育发展院) Sungshin Women’s University(顺天堂女子大学) Seoul National University of Education(首尔国立教育大学) Korea Institute for Curriculum and Evaluation(韩国课程评价院) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 视频生成 :video generation(title,abstract)

AI总结 提出基于知识-技能-态度框架的教育视频生成基准EduVideoBench,评估五个前沿视频生成模型在教育有效性上的不足,并发现教育有效性是多维度的,单一元素不匹配即可使视频失效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21002 2026-05-19 cs.GR 78%

SURF: Signature-Retained Fast Video Generation

SURF: 保留特征的快速视频生成

Kaixin Ding, Xi Chen, Sihui Ji, Yuan Gao, Liang Hou, Xin Tao, Hengshuang Zhao

专题命中 视频生成 :video generation(title,abstract)

AI总结 本文提出SURF框架,通过保留原始模型的显著特征,高效生成高分辨率视频,同时减少计算步骤,提升生成速度。

Comments Project Website: https://kxding.github.io/project/SURF/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27711 2026-05-01 cs.RO 78%

ExoActor: Exocentric Video Generation as Generalizable Interactive Humanoid Control

ExoActor:作为可泛化的交互人形控制的外向视频生成

Yanghao Zhou, Jingyu Ma, Yibo Peng, Zhenguo Sun, Yu Bai, Börje F. Karlsson

机构 * Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院)

专题命中 视频生成 :video generation(title,abstract)

AI总结 本文提出ExoActor框架,利用大规模视频生成模型的泛化能力,通过第三人称视频生成统一接口建模交互动态,将任务指令和场景上下文转化为可执行的人形行为序列,展示了其在新场景中的泛化能力。

Comments Work in progress. Project page: https://baai-agents.github.io/ExoActor/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01264 2026-04-14 cs.RO cs.AI 78%

LLM-based Realistic Safety-Critical Driving Video Generation

基于LLM的现实安全关键驾驶视频生成

Yongjie Fu, Ruijian Zha, Pei Tian, Xuan Di

机构 * Department of Civil Engineering and Engineering Mechanics, Columbia University(哥伦比亚大学土木工程与工程力学系) Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系)

专题命中 视频生成 :video generation(title,abstract)

AI总结 本文提出利用LLM生成少样本代码实现安全关键驾驶场景生成,结合CARLA模拟器与Cosmos-Transfer1和ControlNet生成真实驾驶视频,提升自动驾驶测试效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27469 2026-03-31 cs.LG cs.AI 78%

KV Cache Quantization for Self-Forcing Video Generation: A 33-Method Empirical Study

KV缓存量化用于自驱动视频生成:一项33种方法的实证研究

Suraj Ranganath, Vaishak Menon, Anish Patnaik

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 视频生成 :video generation(title,abstract)

AI总结 本文通过33种量化和缓存策略变体,研究自驱动视频生成中KV缓存压缩的影响,发现FlowCache启发的INT4软剪枝方法在压缩率和内存使用上表现优异,但高保真方法存在运行时或内存成本问题,需结合实际需求选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18811 2026-03-20 cs.RO 78%

V-Dreamer: Automating Robotic Simulation and Trajectory Synthesis via Video Generation Priors

V-Dreamer:通过视频生成先验自动机器人仿真与轨迹合成

Songjia He, Zixuan Chen, Hongyu Ding, Dian Shao, Jieqi Shi, Chenxu Li, Jing Huo, Yang Gao

机构 * Nanjing University(南京大学) Northwestern Polytechnical University(西北工业大学)

专题命中 视频生成 :video generation(title,abstract)

AI总结 V-Dreamer通过视频生成先验自动构建仿真环境和可执行轨迹,利用大语言模型和3D生成模型生成物理合理的3D场景,并通过Sim-to-Gen模块实现高效轨迹合成。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09642 2026-03-03 cs.GR cs.AI 78%

Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k

Open-Sora 2.0:在20万美元内训练一个商业级视频生成模型

Zangwei Zheng, Xiangyu Peng, Yuxuan Lou, Chenhui Shen, Tom Young, Xinying Guo, Binluo Wang, Hang Xu, Hongxin Liu, Mingyan Jiang, Wenjun Li, Yuhui Wang, Anbang Ye, Gang Ren, Qianran Ma, Wanying Liang, Xiang Lian, Xiwen Wu, Yuting Zhong, Zhuangyan Li, Chaoyu Gong, Guojun Lei, Leijun Cheng, Limin Zhang, Minghao Li, Ruijie Zhang, Silan Hu, Shijie Huang, Xiaokang Wang, Yuanheng Zhao, Yuqi Wang, Ziang Wei, Yang You

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 视频生成 :video generation(title,abstract)

AI总结 Open-Sora 2.0通过低成本训练实现了商业级视频生成模型,展示了训练成本的可控性,并开源促进视频生成技术的普及与创新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07823 2026-01-13 eess.SY cs.RO cs.SY 78%

Video Generation Models in Robotics -- Applications, Research Challenges, Future Directions

机器人中的视频生成模型——应用、研究挑战与未来方向

Zhiting Mei, Tenny Yin, Ola Shorinwa, Apurva Badithela, Zhonghe Zheng, Joseph Bruno, Madison Bland, Lihan Zha, Asher Hancock, Jaime Fernández Fisac, Philip Dames, Anirudha Majumdar

机构 * Princeton University(普林斯顿大学) Temple University(Temple 大学)

专题命中 视频生成 :video generation(title,abstract)

AI总结 本文综述了视频生成模型在机器人学中的应用、研究挑战及未来方向,探讨了其在物理模拟、动作预测和策略评估中的作用及面临的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00996 2026-01-06 cs.CY cs.AI 78%

VEAT Quantifies Implicit Associations in Text-to-Video Generator Sora and Reveals Challenges in Bias Mitigation

VEAT量化文本到视频生成器Sora中的隐含关联并揭示缓解偏见的挑战

Yongxu Sun, Michael Saxon, Ian Yang, Anna-Maria Gueorguieva, Aylin Caliskan

机构 * University of Washington(华盛顿大学)

专题命中 视频生成 :text-to-video(title,abstract)

AI总结 VEAT量化Sora视频生成器中隐含的种族和性别关联,揭示去偏提示可能反噬的问题,强调T2V生成器需严格评估以避免代表性伤害。

Comments The International Association for Safe & Ethical AI (IASEAI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17883 2025-12-22 cs.HC 78%

Map2Video: Street View Imagery Driven AI Video Generation

Map2Video: 基于街景图像的AI视频生成

Hye-Young Jo, Mose Sakashita, Aditi Mishra, Ryo Suzuki, Koichiro Niinuma, Aakar Gupta

专题命中 视频生成 :video generation(title,abstract)

AI总结 Map2Video通过整合现实地理数据和AI视频生成技术,帮助电影制作者更高效地创建空间一致的视频内容。

Comments 15 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17756 2025-12-16 cs.LG cs.SY eess.SY 78%

SuperGen: An Efficient Ultra-high-resolution Video Generation System with Sketching and Tiling

SuperGen: 一种高效的超高清视频生成系统,支持草图和分块

Fanjiang Ye, Zepeng Zhao, Yi Mu, Jucheng Shen, Renjie Li, Kaijian Wang, Saurabh Agarwal, Myungjin Lee, Triston Cao, Aditya Akella, Arvind Krishnamurthy, T. S. Eugene Ng, Zhengzhong Tu, Yuke Wang

机构 * Rice University(里士满大学) Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Texas A&M University(德克萨斯农工大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Cisco(思科公司) NVIDIA(英伟达公司) University of Washington(华盛顿大学)

专题命中 视频生成 :video generation(title,abstract)

AI总结 SuperGen通过分块技术实现高效超高清视频生成,无需额外训练,降低计算和内存成本,提升生成速度和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10678 2025-09-30 cs.GR 78%

T2Bs: Text-to-Character Blendshapes via Video Generation

Jiahao Luo, Chaoyang Wang, Michael Vasilkovsky, Vladislav Shakhrai, Di Liu, Peiye Zhuang, Sergey Tulyakov, Peter Wonka, Hsin-Ying Lee, James Davis, Jian Wang

专题命中 视频生成 :video generation(title);video diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19222 2025-09-24 cs.LG 78%

Video Killed the Energy Budget: Characterizing the Latency and Power Regimes of Open Text-to-Video Models

Julien Delavande, Regis Pierrard, Sasha Luccioni

机构 * Hugging Face

专题命中 视频生成 :text-to-video(title,abstract)

Comments 10 pages. Accepted as an oral presentation at the NeurIPS 2025 NextVid Workshop (San Diego, December 6, 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10255 2025-05-23 cs.GR cs.AI 78%

AniSora: Exploring the Frontiers of Animation Video Generation in the Sora Era

Yudong Jiang, Baohan Xu, Siqian Yang, Mingyu Yin, Jing Liu, Chao Xu, Siqi Wang, Yidi Wu, Bingwen Zhu, Xinwen Zhang, Xingyu Zheng, Jixuan Xu, Yue Zhang, Jinlong Hou, Huyang Sun

机构 * Bilibili Inc.(哔哩哔哩公司)

专题命中 视频生成 :video generation(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19455 2025-04-24 cs.GR 78%

FLAP: Fully-controllable Audio-driven Portrait Video Generation through 3D head conditioned diffusion model

Lingzhou Mu, Baiji Liu, Ruonan Zhang, Guiming Mo, Jiawei Jin, Kai Zhang, Haozhi Huang

专题命中 视频生成 :video generation(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09268 2025-02-17 cs.RO cs.LG 78%

GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation

Hongyin Zhang, Pengxiang Ding, Shangke Lyu, Ying Peng, Donglin Wang

专题命中 视频生成 :video generation(title,abstract)

Comments Published as a conference paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10076 2025-02-11 cs.AI cs.LG 78%

VideoAgent: Self-Improving Video Generation

Achint Soni, Sreyas Venkataraman, Abhranil Chandra, Sebastian Fischmeister, Percy Liang, Bo Dai, Sherry Yang

专题命中 视频生成 :video generation(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15456 2025-01-28 cs.HC 78%

"See What I Imagine, Imagine What I See": Human-AI Co-Creation System for 360$^\circ$ Panoramic Video Generation in VR

Yunge Wen

专题命中 视频生成 :video generation(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13071 2024-07-19 cs.CY cs.CL cs.IR cs.LG cs.SI 78%

Analysing the Public Discourse around OpenAI's Text-To-Video Model 'Sora' using Topic Modeling

Vatsal Vinay Parikh

专题命中 视频生成 :text-to-video(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02873 2024-07-04 cs.RO 78%

Robot Shape and Location Retention in Video Generation Using Diffusion Models

Peng Wang, Zhihao Guo, Abdul Latheef Sait, Minh Huy Pham

专题命中 视频生成 :video generation(title,abstract)

Comments 8 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16155 2024-06-25 cs.SD cs.GR eess.AS 78%

Listen and Move: Improving GANs Coherency in Agnostic Sound-to-Video Generation

Rafael Redondo

专题命中 视频生成 :video generation(title,abstract)

Comments Full paper of the homonym paper published in the ICCV 2023 workshop "AV4D: Visual Learning of Sounds in Spaces"

Journal ref Abstract version published in the ICCV 2023 workshop "AV4D: Visual Learning of Sounds in Spaces"

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11859 2024-06-19 cs.CY cs.AI cs.ET cs.HC 78%

"Sora is Incredible and Scary": Emerging Governance Challenges of Text-to-Video Generative AI Models

Kyrie Zhixuan Zhou, Abhinav Choudhry, Ece Gumusel, Madelyn Rose Sanfilippo

专题命中 视频生成 :text-to-video(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14665 2024-03-27 cs.CY cs.HC 78%

Sora OpenAI's Prelude: Social Media Perspectives on Sora OpenAI and the Future of AI Video Generation

Reza Hadi Mogavi, Derrick Wang, Joseph Tu, Hilda Hadan, Sabrina A. Sgandurra, Pan Hui, Lennart E. Nacke

专题命中 视频生成 :video generation(title,abstract)

Journal ref Workshop at ACM CHI 2024 (HCI and Human Factors Joining Forces to Meet the AI Interaction Challenge)

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.00111 2023-11-21 cs.AI 78%

Learning Universal Policies via Text-Guided Video Generation

Yilun Du, Mengjiao Yang, Bo Dai, Hanjun Dai, Ofir Nachum, Joshua B. Tenenbaum, Dale Schuurmans, Pieter Abbeel

专题命中 视频生成 :video generation(title,abstract)

Comments NeurIPS 2023, Project Website: https://universal-policy.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06287 2026-04-30 cs.CV 77%

Perception Test 2025: Challenge Summary and a Unified VQA Extension

2025感知测试挑战:挑战总结及统一视觉问答扩展

Joseph Heyward, Nikhil Parthasarathy, Tyler Zhu, Aravindh Mahendran, João Carreira, Dima Damen, Andrew Zisserman, Viorica Pătrăucean

机构 * Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学) University of Bristol(布里斯托大学) University of Oxford(牛津大学)

专题命中 视频生成 :video generation(abstract);video-language(abstract);long video(abstract);分类 cs.CV

AI总结 2025年感知测试挑战旨在评估最新视频模型并衡量多模态感知的进步,通过统一任务测试揭示现有模型在统一接口下处理多样化感知任务的困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12887 2026-04-15 cs.CV cs.LG 77%

VideoFlexTok: Flexible-Length Coarse-to-Fine Video Tokenization

VideoFlexTok: 可变长度粗到细视频标记化

Andrei Atanov, Jesse Allardice, Roman Bachmann, Oğuzhan Fatih Kar, R Devon Hjelm, David Griffiths, Peter Fu, Afshin Dehghan, Amir Zamir

机构 * Apple(苹果公司) Swiss Federal Institute of Technology Lausanne (EPFL)(瑞士联邦理工学院洛桑分校(EPFL))

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);long video(abstract);分类 cs.CV

AI总结 VideoFlexTok通过可变长度粗到细标记化结构,实现更高效的视频生成,相比传统3D网格标记化,模型更小且生成质量相近。

Comments project page at https://videoflextok.epfl.ch/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18359 2026-04-08 cs.CV 77%

TRANSPORTER: Transferring Visual Semantics from VLM Manifolds

TRANSPORTER:从VLM流形转移视觉语义

Alexandros Stergiou

机构 * University of Twente, NL(荷兰特温特大学)

专题命中 视频生成 :video generation(abstract);video understanding(abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出TRANSPORTER方法,通过logits-to-video任务生成视频,揭示VLM预测背后的规则,为模型可解释性提供新方向。

Comments Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026, Project page: https://alexandrosstergiou.github.io/TRANSPORTER

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12090 2026-04-02 cs.CV cs.CR cs.LG 77%

SPDMark: Selective Parameter Displacement for Robust Video Watermarking

SPDMark:基于选择性参数位移的鲁棒视频水印技术

Samar Fares, Nurbek Tastan, Karthik Nandakumar

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Michigan State University (MSU)(密歇根州立大学)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 SPDMark通过在视频扩散模型中选择性位移参数,在生成视频时嵌入不可见水印,实现高鲁棒性和计算效率的平衡。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00978 2026-03-03 cs.CV cs.AI 77%

EraseAnything++: Enabling Concept Erasure in Rectified Flow Transformers Leveraging Multi-Object Optimization

EraseAnything++: 通过多对象优化实现Rectified Flow Transformers中的概念擦除

Zhaoxin Fan, Nanxiang Jiang, Daiheng Gao, Shiji Zhou, Wenjun Wu

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京未来区块链与隐私计算先进创新中心,人工智能学院,北航) University of Science and Technology of China(中国科学技术大学)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 EraseAnything++通过多目标优化实现图像和视频扩散模型中的概念擦除,提升生成质量与时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03233 2026-01-07 cs.CV 77%

LTX-2: Efficient Joint Audio-Visual Foundation Model

LTX-2:高效的音频-视觉联合基础模型

Yoav HaCohen, Benny Brazowski, Nisan Chiprut, Yaki Bitterman, Andrew Kvochko, Avishai Berkowitz, Daniel Shalem, Daphna Lifschitz, Dudu Moshe, Eitan Porat, Eitan Richardson, Guy Shiran, Itay Chachy, Jonathan Chetboun, Michael Finkelson, Michael Kupchick, Nir Zabari, Nitzan Guetta, Noa Kotler, Ofir Bibi, Ori Gordon, Poriya Panet, Roi Benita, Shahar Armon, Victor Kulikov, Yaron Inger, Yonatan Shiftan, Zeev Melumian, Zeev Farbman

机构 * Lightricks(利光科技)

专题命中 视频生成 :video generation(abstract);video diffusion(abstract);text-to-video(abstract);分类 cs.CV

AI总结 LTX-2是一种高效的音频-视觉联合基础模型,通过统一的双流变压器架构生成高质量的音频视觉内容,支持多语言提示和模态感知的可控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏