arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2143 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2143 篇

2505.03205 2026-05-19 cs.LG cs.NA math.NA math.ST stat.TH 50%

Transformers for Learning on Noisy and Task-Level Manifolds: Approximation and Generalization Insights

用于噪声和任务级流形学习的Transformer:近似和泛化见解

Zhaiming Shen, Alex Havrilla, Rongjie Lai, Alexander Cloninger, Wenjing Liao

机构 * School of Mathematics, Georgia Institute of Technology(佐治亚理工学院数学系) Department of Mathematics, Purdue University(普渡大学数学系) Department of Mathematics and Halicioğlu Data Science Institute, University of California, San Diego(加州大学圣地亚哥分校数学系和Halicioğlu数据科学研究所)

专题命中 视频生成 :video generation(abstract)

AI总结 本文研究了Transformer在噪声和任务级流形上的学习性能,证明了其在低维结构中泛化能力与任务级流形的内在维度密切相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04204 2026-04-28 cs.CY cs.AI cs.CL cs.HC cs.MA 50%

TeachMaster: Generative Teaching via Code

TeachMaster: 通过代码生成教学内容

Yuheng Wang, Runde Yang, Lin Wu, Jie Zhang, Jingru Fan, Tianle Zhou, Ruoyu Fu, Huatao Li, Ruijie Shi, Siheng Chen, Weinan E, Chen Qian

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 视频生成 :video generation(abstract)

AI总结 本文提出Generative Teaching paradigm,通过多智能体框架TeachMaster实现教学内容的自动化生成,提升生产效率并降低教育视频制作成本。

Comments Accepted to ACL 2026; https://www.teachmaster.cn/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19734 2026-04-22 cs.RO cs.AI 50%

UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling

UniT:迈向人类到人形机器人政策学习和世界建模的统一物理语言

Boyu Chen, Yi Chen, Lu Qiu, Jerry Bai, Yuying Ge, Yixiao Ge

机构 * XPENG Robotics(小鹏机器人) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 视频生成 :video generation(abstract)

AI总结 UniT通过三分支交叉重建机制建立统一物理语言,实现人类到人形机器人的跨身体迁移,提升政策学习和世界建模的效率与鲁棒性。

Comments Project page: https://xpeng-robotics.github.io/unit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19194 2026-04-22 cs.GR 50%

sumo3Dviz: A three dimensional traffic visualisation

sumo3Dviz: 一种三维交通可视化

Kevin Riehl, Julius Schlapbach, Anastasios Kouvelas, Michail A. Makridis

专题命中 视频生成 :video generation(abstract)

AI总结 sumo3Dviz提供轻量级开源3D可视化工具,用于SUMO交通模拟,支持外部视角和第一人称视角,优化批量视频生成,适用于大规模场景可视化和教育演示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17820 2026-04-21 cs.SE 50%

Raven: Rethinking Automated Assessment for Scratch Programs via Video-Grounded Evaluation

Raven: 通过视频基础评估重新思考Scratch程序的自动化评估

Donglin Li, Daming Li, Hanyuan Shi, Jialu Zhang

专题命中 视频生成 :video generation(abstract)

AI总结 Raven通过视频生成规则替代传统断言,实现Scratch程序的自动化评估,提升评估的一致性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10367 2026-04-14 cs.AI cs.SD 50%

Beyond Monologue: Interactive Talking-Listening Avatar Generation with Conversational Audio Context-Aware Kernels

超越独白:基于对话音频上下文感知核的交互式谈话-倾听虚拟角色生成

Yuzhe Weng, Haotian Wang, Xinyi Yu, Xiaoyan Wu, Haoran Xu, Shan He, Jun Du

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK(科大讯飞)

专题命中 视频生成 :video generation(abstract)

AI总结 本文提出基于对话音频上下文感知核的交互式虚拟角色生成方法,通过引入多头高斯核解决谈话与倾听行为的时间尺度差异问题,构建了能同时处理双流音频输入的全双工虚拟代理,并在VoxHear数据集上验证了其在生成自然响应的全双工数字人类方面的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07721 2026-04-10 cs.MA 50%

Sima 1.0: A Collaborative Multi-Agent Framework for Documentary Video Production

Sima 1.0:一种用于纪录片视频制作的协作多智能体框架

Zhao Song

专题命中 视频生成 :video generation(abstract)

AI总结 Sima 1.0通过多智能体系统优化纪录片视频制作流程,将任务分解为11个步骤,利用人类操作基础创作和录制,AI代理处理编辑、字幕优化等任务,减少生产负担,提升制作效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07517 2026-04-10 cs.RO 50%

Grasp as You Dream: Imitating Functional Grasping from Generated Human Demonstrations

抓取如梦:从生成的人类示范中模仿功能抓取

Chao Tang, Jiacheng Xu, Haofei Lu, Bolin Zou, Wenlong Dong, Hong Zhang, Danica Kragic

机构 * Department of Robotics, Perception and Learning, KTH Royal Institute of Technology(KTH皇家理工学院机器人、感知与学习系) Shenzhen Key Laboratory of Robotics and Computer Vision, Southern University of Science and Technology(南方科技大学深圳市机器人视觉与感知重点实验室)

专题命中 视频生成 :video generation(abstract)

AI总结 本文提出GraspDreamer方法,利用视觉生成模型合成的人类示范实现零样本功能抓取,通过隐含的通用先验知识和动作优化,提升数据效率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24587 2026-04-02 cs.LG cs.RO 50%

DreamerAD: Efficient Reinforcement Learning via Latent World Model for Autonomous Driving

DreamerAD:通过潜在世界模型实现高效的强化学习用于自动驾驶

Pengxuan Yang, Yupeng Zheng, Deheng Qian, Zebin Xing, Qichao Zhang, Linbo Wang, Yichen Zhang, Shaoyu Guo, Zhongpu Xia, Qiang Chen, Junyu Han, Lingyun Xu, Yifeng Pan, Dongbin Zhao

机构 * Institute of Automation, CAS(中国科学院自动化研究所) Chongqing Chang’an Technology Co., Ltd(重庆长安科技有限公司) School of Advanced Interdisciplinary Sciences, UCAS(中国科学院大学先进交叉科学学院) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院)

专题命中 视频生成 :video generation(abstract)

AI总结 DreamerAD通过压缩扩散采样将步骤从100步减少到1步,实现80倍加速并保持视觉可解释性,解决了自动驾驶中真实世界数据训练成本高和安全风险大的问题。

Comments authors update

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00319 2026-04-02 cs.AI cs.MA 50%

Collaborative AI Agents and Critics for Fault Detection and Cause Analysis in Network Telemetry

协同AI代理与批评者用于网络遥测中的故障检测与原因分析

Syed Eqbal Alam, Zhan Shu

机构 * Department of Electrical and Computer Engineering, University of Alberta(阿尔伯塔大学电气与计算机工程系) SheQAI Research(SheQAI研究)

专题命中 视频生成 :video generation(abstract)

AI总结 本文提出一种多代理联邦系统,通过AI代理与批评者协作完成网络遥测中的故障检测、严重性和原因分析等多模态任务,利用多时间尺度随机逼近技术保证收敛性,通信开销低且隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17808 2026-03-25 cs.RO cs.AI 50%

EVA: Aligning Video World Models with Executable Robot Actions via Inverse Dynamics Rewards

EVA:通过逆动力学奖励对齐视频世界模型与可执行机器人动作

Ruixiang Wang, Qingming Liu, Yueci Deng, Guiliang Liu, Zhen Liu, Kui Jia

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) DexForce Technology Co., Ltd.(DexForce技术有限公司)

专题命中 视频生成 :video generation(abstract)

AI总结 本文提出EVA框架,通过逆动力学奖励对齐视频世界模型与可执行动作,减少生成动作中的体感约束违规,提升下游任务执行成功率。

Comments Project page: https://eva-project-page.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19709 2026-03-25 cs.RO 50%

Morphology-Consistent Humanoid Interaction through Robot-Centric Video Synthesis

通过机器人中心视频合成实现形态一致的人形交互

Weisheng Xu, Jian Li, Yi Gu, Bin Yang, Haodong Chen, Shuyi Lin, Mingqian Zhou, Jing Tan, Qiwei Wu, Xiangrui Jiang, Taowen Wang, Jiawen Wen, Qiwei Liang, Jiaxi Zhang, Renjing Xu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen University(深圳大学) University of Cambridge(剑桥大学)

专题命中 视频生成 :video generation(abstract)

AI总结 本文提出Dream2Act框架,通过生成视频合成实现零样本人形机器人交互,避免传统retargeting的形态差距问题,提升任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16860 2026-03-18 cs.RO 50%

DreamPlan: Efficient Reinforcement Fine-Tuning of Vision-Language Planners via Video World Models

DreamPlan: 通过视频世界模型高效强化微调视觉语言规划器

Emily Yue-Ting Jia, Weiduo Yuan, Tianheng Shi, Vitor Guizilini, Jiageng Mao, Yue Wang

机构 * USC Physical Superintelligence Lab(USC物理超智能实验室) Toyota Research Institute(丰田研究院)

专题命中 视频生成 :video generation(abstract)

AI总结 DreamPlan通过视频世界模型高效强化微调视觉语言规划器,利用零样本VLM生成探索数据训练动作条件视频生成模型,再通过ORPO在虚拟环境中微调VLM,提升物体 manipulation 成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22407 2026-03-17 cs.AI cs.RO 50%

EMMA: Generalizing Real-World Robot Manipulation via Generative Visual Transfer

EMMA: 通过生成性视觉迁移实现现实世界机器人操作的泛化

Zhehao Dong, Xiaofeng Wang, Zheng Zhu, Yirui Wang, Yang Wang, Yukun Zhou, Boyuan Wang, Chaojun Ni, Runqi Ouyang, Wenkang Qin, Xinze Chen, Yun Ye, Guan Huang, Zhen Lu, Yue Yang

专题命中 视频生成 :video generation(abstract)

AI总结 EMMA通过生成性视觉迁移框架提升机器人操作的泛化能力,结合生成数据引擎与高效训练流程,实现多视角一致性和几何精度的提升,实验证明其在零样本场景下的显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00481 2026-03-10 cs.HC 50%

From Performers to Creators: Understanding Retired Women's Perceptions of Technology-Enhanced Dance Performance

从表演者到创作者:理解退休女性对技术增强舞蹈表演的认知

Danlin Zheng, Xiaoying Wei, Chao Liu, Quanyu Zhang, Jingling Zhang, Shihui Guo, Mingming Fan

专题命中 视频生成 :video generation(abstract)

AI总结 本文通过交互式舞蹈技术与AI生成内容,帮助退休女性克服年龄相关限制,提升舞台表现并成为表演共创者。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06190 2026-03-09 cs.RO 50%

DreamToNav: Generalizable Navigation for Robots via Generative Video Planning

DreamToNav: 通过生成式视频规划实现通用机器人导航

Valerii Serpiva, Jeffrin Sam, Chidera Simon, Hajira Amjad, Iana Zhura, Artem Lykov, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Skolkovo Institute of Science and Technology(智能空间机器人实验室,斯克尔科夫科学与技术研究所)

专题命中 视频生成 :video generation(abstract)

AI总结 DreamToNav通过生成式视频规划实现通用机器人导航,利用自然语言提示生成精确运动路径,实现目标导向的自主导航。

Comments Submitted to conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00110 2026-03-03 cs.RO 50%

Learning Physics from Pretrained Video Models: A Multimodal Continuous and Sequential World Interaction Models for Robotic Manipulation

从预训练视频模型中学习物理:一种多模态连续和序列世界交互模型用于机器人操作

Zijian Song, Qichang Li, Sihan Qin, Yuhao Chen, Tianshui Chen, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室) Guangdong University of Technology(广东工业大学)

专题命中 视频生成 :video generation(abstract)

AI总结 PhysGen通过预训练视频模型学习物理知识,实现机器人操作的连续和序列世界交互,优于现有基线方法。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06559 2026-02-24 cs.GT 50%

GenAI vs. Human Creators: Procurement Mechanism Design in Two-/Three-Layer Markets

生成式AI与人类创作者:跨域市场中的采购机制设计

Rui Ai, David Simchi-Levi, Haifeng Xu

专题命中 视频生成 :video generation(abstract)

AI总结 本文研究了生成式AI与人类创作者在跨域市场中的采购机制设计,揭示了数据中介带来的影响及对社会福利的负面影响,提出需政府监管以优化数据生态系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12636 2026-02-16 cs.LG cs.RO 50%

Dual-Granularity Contrastive Reward via Generated Episodic Guidance for Efficient Embodied RL

双粒度对比奖励 via 生成 episodic 引导 为高效 embodied RL

Xin Liu, Yixuan Li, Yuhui Chen, Yuxing Qin, Haoran Li, Dongbin Zhao

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)

专题命中 视频生成 :video generation(abstract)

AI总结 本文提出DEG方法,通过生成episodic引导实现高效具身RL,无需人工标注,提升样本效率和任务完成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12128 2026-02-13 cs.AI 50%

HLA: Hadamard Linear Attention

HLA: Hadamard线性注意力

Hanno Ackermann, Hong Cai, Mohsen Ghafoorian, Amirhossein Habibian

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 视频生成 :video generation(abstract)

AI总结 HLA通过在计算成对相似性后应用非线性,提高线性注意力对softmax的近似精度,无需张量重塑,适用于大规模视频生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10717 2026-02-12 cs.RO 50%

Say, Dream, and Act: Learning Video World Models for Instruction-Driven Robot Manipulation

说、梦、做:学习视频世界模型以驱动指令式机器人操作

Songen Gu, Yunuo Cai, Tianyu Wang, Simo Wu, Yanwei Fu

机构 * Fudan University(复旦大学)

专题命中 视频生成 :video generation(abstract)

AI总结 本文提出一种视频条件动作框架,通过生成稳健的视频模型和对抗性蒸馏,提升机器人操作中的预测能力和空间准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10105 2026-02-11 cs.RO 50%

DexImit: Learning Bimanual Dexterous Manipulation from Monocular Human Videos

DexImit:从单目人类视频中学习双臂灵巧操作

Juncheng Mu, Sizhe Yang, Yiming Bao, Hojin Bae, Tianming Wei, Linning Xu, Boyi Li, Huazhe Xu, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) NVIDIA(英伟达)

专题命中 视频生成 :video generation(abstract)

AI总结 DexImit通过四阶段生成流程,将单目人类视频转化为物理合理的机器人数据,以解决双臂灵巧操作的泛化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11261 2026-02-10 cs.CL 50%

Kahaani: A Multimodal Co-Creative Storytelling System

Kahaani:一种多模态协同创作叙事系统

Samee Arif, Muhammad Saad Haroon, Aamina Jamal Khan, Taimoor Arif, Agha Ali Raza, Awais Athar

机构 * Lahore University of Management Sciences(拉瓦尔大学管理科学学院) University of Michigan(密歇根大学) Strategize Labs(战略实验室)

专题命中 视频生成 :text-to-video(abstract)

AI总结 Kahaani通过多模态技术帮助儿童提升英语能力、学习生活教训并理解故事结构,采用协同创作方式提供沉浸式教育体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02725 2026-02-02 cs.AI 50%

Advances in Artificial Intelligence: A Review for the Creative Industries

人工智能进展:面向创意产业的综述

Nantheera Anantrasirichai, Fan Zhang, David Bull

机构 * Visual Information Laboratory, University of Bristol, Bristol, UK(布里斯托大学视觉信息实验室)

专题命中 视频生成 :video generation(abstract)

AI总结 本文综述了自2022年以来人工智能在创意产业中的进展,探讨了生成式AI、大语言模型和扩散模型等技术对创意生产流程的影响,并分析了人类与AI协作的新趋势及面临的挑战。

Comments This is an updated review of our previous paper (see https://doi.org/10.1007/s10462-021-10039-7), and has been accepted by Artificial Intelligence Review journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20655 2026-01-29 cs.DC 50%

OnePiece: A Large-Scale Distributed Inference System with RDMA for Complex AI-Generated Content (AIGC) Workflows

OnePiece:一种基于RDMA的大型分布式推理系统,用于复杂AI生成内容(AIGC)工作流

June Chen, Neal Xu, Gragas Huang, Bok Zhou, Stephen Liu

专题命中 视频生成 :video generation(abstract)

AI总结 OnePiece通过RDMA优化和微服务分解,提升AIGC工作流的吞吐量和资源利用率,减少GPU资源消耗16倍。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20622 2026-01-29 cs.HC 50%

SketchDynamics: Exploring Free-Form Sketches for Dynamic Intent Expression in Animation Generation

SketchDynamics: 探索自由形式草图用于动画生成中的动态意图表达

Boyu Li, Lin-Ping Yuan, Zeyu Wang, Hongbo Fu

专题命中 视频生成 :video generation(abstract)

AI总结 SketchDynamics通过自由形式草图与AI交互,探索动态意图表达在动画生成中的应用,展示草图如何有效传达运动意图并指导视频生成。

Comments conditionally accepted by CHI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12128 2026-01-16 cs.LG cs.AI 50%

LaM-SLidE: Latent Space Modeling of Spatial Dynamical Systems via Linked Entities

通过链接实体进行空间动态系统的潜在空间建模:LaM-SLidE

Florian Sestak, Artur Toshev, Andreas Fürst, Günter Klambauer, Andreas Mayr, Johannes Brandstetter

机构 * ELLIS Unit, LIT AI Lab, Institute for Machine Learning, JKU Linz(ELLIS单位、LIT AI实验室、机器学习研究所、JKU林茨) Department of Engineering Physics and Computation, TUM(工程物理与计算系、技术大学慕尼黑) Emmi AI GmbH(Emmi AI公司) Clinical Research Institute for Medical AI, JKU Linz(医学人工智能临床研究所、JKU林茨)

专题命中 视频生成 :video generation(abstract)

AI总结 LaM-SLidE通过引入标识符表示,实现对空间动态系统潜在空间的建模,提升轨迹生成的效率与准确性。

Comments Project page: https://ml-jku.github.io/LaM-SLidE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23003 2026-01-15 cs.LG cs.AI cs.SY eess.SY 50%

Physically Plausible Multi-System Trajectory Generation and Symmetry Discovery

物理合理多系统轨迹生成与对称性发现

Jiayin Liu, Yulong Yang, Vineet Bansal, Christine Allen-Blanchette

机构 * Princeton University(普林斯顿大学) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(abstract)

AI总结 本文提出SPS-GAN,通过辛相空间GAN架构实现多系统轨迹生成与对称性发现,无需先验配置空间知识,通过物理动机项优化实现配置空间的稀疏表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02125 2026-01-06 cs.RO cs.AI 50%

SingingBot: An Avatar-Driven System for Robotic Face Singing Performance

SingingBot: 一种由虚拟角色驱动的机器人面部歌唱表演系统

Zhuoxiong Xu, Xuanchen Li, Yuhao Cheng, Fei Xu, Yichao Yan, Xiaokang Yang

专题命中 视频生成 :video generation(abstract)

AI总结 SingingBot通过虚拟角色驱动框架实现机器人面部歌唱的丰富情感表达,提出情感动态范围指标评估情感广度,实验表明其在情感表现和同步性方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15607 2025-11-18 cs.RO 50%

GRIM: Task-Oriented Grasping with Conditioning on Generative Examples

Shailesh, Alok Raj, Nayan Kumar, Priya Shukla, Andrew Melnik, Michael Beetz, Gora Chand Nandi

专题命中 视频生成 :video generation(abstract)

Comments Accepted to AAAI-26 (Oral). Project website: https://grim-tog.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏