arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-05-04 至 2026-05-04 共收录 9 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 3 篇

2603.22285 2026-05-04 cs.CV 88%

VideoDetective: Clue Hunting via both Extrinsic Query and Intrinsic Relevance for Long Video Understanding

VideoDetective:通过外在查询和内在相关性进行长视频理解的线索搜索

Ruoliu Yang, Chu Wu, Caifeng Shan, Ran He, Chaoyou Fu

机构 * Nanjing University(南京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 本文提出VideoDetective框架,通过结合查询与片段的相关性及片段间亲和力,有效定位长视频问答中的关键片段,提升多模态大语言模型在长视频理解中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00444 2026-05-04 cs.CV 79%

Scaling Video Understanding via Compact Latent Multi-Agent Collaboration

通过紧凑潜在多智能体协作实现视频理解的扩展

Kerui Chen, Jinglu Wang, Jianrong Zhang, Ming Li, Yan Lu, Hehe Fan

机构 * Microsoft Research Asia(微软亚洲研究院) Zhejiang University(浙江大学) Guanming Lab(冠明实验室)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出MACF框架,通过解耦智能体感知预算与全局视频复杂度,实现可扩展的视频理解,保持视觉保真度,并在多种视频理解基准上优于现有方法。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02327 2026-05-04 cs.CV 77%

PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance

PPLLaVA:通过提示引导的视频序列理解

Shangkun Sun, Ruyang Liu, Haoran Tang, Yixiao Ge, Haibo Lu, Wei Gao, Jiankun Yang, Chen Li

机构 * Peng Cheng Laboratory(鹏城实验室) Peking University(北京大学) XPeng Inc.(小鹏汽车有限公司) Ministry of Industry and Information Technology of the People’s Republic of China, China Electronics Standardization Institute, Beijing, China(中华人民共和国工业和信息化部,中国电子标准化研究院,北京,中国)

专题命中 视频理解 :video understanding(abstract);video reasoning(abstract);long video(abstract);分类 cs.CV

AI总结 PPLLaVA通过提示引导的池化策略实现视频序列高效理解,减少18倍token,提升推理效率并在多种视频理解任务中取得最佳性能。

Comments Accepted to ICLR' 26

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 4 篇

2605.00658 2026-05-04 cs.CV 83%

UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors

UniVidX:一种基于扩散先验的统一多模态框架,用于 versatile 视频生成

Houyuan Chen, Hong Li, Xianghao Kong, Tianrui Zhu, Shaocong Xu, Weiqing Xiao, Yuwei Guo, Chongjie Ye, Lvmin Zhang, Hao Zhao, Anyi Rao

机构 * Beihang University(北京航空航天大学) Nanjing University(南京大学) Stanford University(斯坦福大学) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 UniVidX 提出一种统一多模态框架,通过扩散先验实现 versatile 视频生成,采用随机条件掩码、解耦门控LoRA和跨模态自注意力等设计,提升多模态一致性与生成性能。

Comments Project page: https://houyuanchen111.github.io/UniVidX.github.io/ Accepted to ACM Transactions on Graphics (Proceedings of SIGGRAPH 2026)

Journal ref ACM Trans. Graph. 45, 4, Article 51 (July 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28980 2026-05-04 cs.CV 57%

Stepper: Stepwise Immersive Scene Generation with Multiview Panoramas

Stepper:基于多视角全景图的分步沉浸式场景生成

Felix Wimbauer, Fabian Manhardt, Michael Oechsle, Nikolai Kalischek, Christian Rupprecht, Daniel Cremers, Federico Tombari

机构 * Google(谷歌) University of Oxford(牛津大学) MCML Technical University of Munich(慕尼黑技术大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 Stepper通过分步扩展多视角全景图,解决传统方法在视觉保真度与可探索性之间的权衡问题,实现高质量沉浸式3D场景生成。

Comments Accepted at CVPR 2026 Findings; Find our project page under https://fwmb.github.io/stepper/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00244 2026-05-04 cs.RO cs.CV 57%

Lucid-XR: An Extended-Reality Data Engine for Robotic Manipulation

Lucid-XR:一种用于机器人操控的扩展现实数据引擎

Yajvan Ravan, Adam Rashid, Alan Yu, Kai McClennen, Gio Huh, Kevin Yang, Zhutian Yang, Qinxi Yu, Xiaolong Wang, Phillip Isola, Ge Yang

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) FortyFive Labs(FortyFive实验室) Caltech(加州理工学院) Harvard University(哈佛大学) UC San Diego(南加州大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 Lucid-XR通过XR头显直接运行的物理模拟环境生成多模态数据,实现零样本迁移至复杂环境,支持软材料、松散颗粒和刚体接触的精细操控任务。

Comments Project website: https://lucidxr.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00080 2026-05-04 cs.RO cs.CV 57%

World Model for Robot Learning: A Comprehensive Survey

机器人学习的世界模型:全面综述

Bohan Hou, Gen Li, Jindou Jia, Tuo An, Xinying Guo, Sicong Leng, Haoran Geng, Yanjie Ze, Tatsuya Harada, Philip Torr, Oier Mees, Marc Pollefeys, Zhuang Liu, Jiajun Wu, Pieter Abbeel, Jitendra Malik, Yilun Du, Jianfei Yang

机构 * Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) The University of Tokyo(东京大学) University of Oxford(牛津大学) Microsoft(微软公司) ETH Zurich(苏黎世联邦理工学院) Princeton University(普林斯顿大学) Harvard University(哈佛大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 综述从机器人学习角度系统回顾世界模型的快速发展,探讨其与机器人策略的耦合、作为强化学习模拟器的作用以及机器人视频世界模型的发展,总结关键范式与挑战。

Comments 43 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 动作与事件理解 1 篇

2605.00496 2026-05-04 cs.CV cs.RO 57%

High-Speed Vision Improves Zero-Shot Semantic Understanding of Human Actions

高速视觉提升人类动作的零样本语义理解

Yongpeng Cao, Yuji Yamakawa

机构 * Institute of Industrial Science, The University of Tokyo(东京大学工业科学研究所) Interfaculty Initiative in Information Studies, Graduate School of Interdisciplinary Information Studies, The University of Tokyo(东京大学跨学科信息研究 graduate school)

专题命中 动作与事件理解 :video-language(abstract);分类 cs.CV

AI总结 本文研究高速视觉对人类动作零样本语义理解的影响,提出无需训练的管道结合预训练视频-语言模型与大语言模型进行动作比较,实验显示高帧率提升语义分离度,验证了高速感知对语义理解的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他视频模型 1 篇

2604.16243 2026-05-04 cs.CV 79%

Find, Fix, Reason: Context Repair for Video Reasoning

寻找、修复、推理:视频推理中的上下文修复

Haojian Huang, Chuanyu Qin, Yinchuan Li, Yingcong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 其他视频模型 :video reasoning(title,abstract);分类 cs.CV

AI总结 本文提出了一种上下文修复方法,通过冻结的教师模型提供最小证据补丁,帮助学生模型在保持问题不变的情况下快速定位目标区域,提升视频推理的准确性和泛化能力。

Comments 22 pages, 7 figures, 17 tables. Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏