arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-05-19 至 2026-05-19 共收录 6 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 6 篇

2605.16481 2026-05-19 cs.CV cs.AI 88%

Visual Agentic Memory: Enabling Online Long Video Understanding via Online Indexing, Hierarchical Memory, and Agentic Retrieval

视觉代理记忆:通过在线索引、分层记忆和代理检索实现在线长视频理解

Aiden Yiliu Li, Nels Numan, Anthony Steed

机构 * University College London(伦敦大学学院)

专题命中 长视频与时序推理 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 本文提出视觉代理记忆框架,通过在线索引、分层记忆和代理检索实现长视频理解,实验显示其在OVO-Bench和MM-Lifelong数据集上均取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18233 2026-05-19 cs.CV 87%

Enhancing Train-Free Infinite-Frame Generation for Consistent Long Videos

增强无列车无限帧生成以实现一致的长视频

X. Feng, J. Zhu, M. Wu, C. Chen, F. Mao, H. Guo, J. Wu, X. Chu, K. Huang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院,北京,中国) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China(复杂系统认知与决策智能重点实验室,中国科学院自动化研究所,北京,中国) AMAP, Alibaba Group, Beijing, China(AMAP,阿里巴巴集团,北京,中国)

专题命中 长视频与时序推理 :long video(title,abstract);video generation(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出MIGA方法,通过两阶段对齐机制和双一致性增强机制,解决训练与推理不匹配和长时一致性维持的问题,从而提升长视频生成效果。

Comments Accepted by ICML 2026~

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18733 2026-05-19 cs.CV 86%

Advancing Narrative Long Video Generation via Training-Free Identity-Aware Memory

通过无训练的身份感知记忆推进叙事长视频生成

Jinzhuo Liu, Jiangning Zhang, Wencan Jiang, Yabiao Wang, Dingkang Liang, Zhucun Xue, Ran Yi, Yong Liu

机构 * Zhejiang University(浙江大学) Tencent Youtu Lab(腾讯云智实验室) Huazhong University of Science and Technology(华中科技大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 长视频与时序推理 :video generation(title,abstract);long video(title);分类 cs.CV

AI总结 本文提出了一种无训练的身份感知记忆框架IAMFlow,通过显式建模和跟踪持久实体身份,实现一致的生成,同时引入NarraStream-Bench基准测试,在叙事流视频生成中取得最佳性能。

Comments Project page: https://eddie0521.github.io/projects/iamflow/ Code: https://github.com/Eddie0521/IAMFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17065 2026-05-19 cs.MA 82%

PyraVid: Hierarchical Multimodal Memory for Long-Horizon Video Reasoning

PyraVid: 用于长时间视频推理的分层多模态记忆

Sikuan Yan, Sicheng Dong, Haotong Wang, Ercong Nie, Yilun Liu, Jinhe Bi, Yingjie Xu, Susanna Schwarzmann, Riccardo Trivisonno, Volker Tresp, Yunpu Ma

专题命中 长视频与时序推理 :video reasoning(title);video understanding(abstract);long video(abstract)

AI总结 本文提出PyraVid,一种分层多模态记忆框架,通过事件分割理论启发,解决长视频中多模态信息整合、人本信息对齐和证据聚合等挑战,提升长时间视频推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18176 2026-05-19 cs.CV cs.AI 57%

MARS: Technical Report for the CASTLE Challenge at EgoVis 2026

MARS:EgoVis 2026 CASTLE挑战的技术报告

Haoyu Zhang, Qiaohui Chu, Yisen Feng, Meng Liu, Weili Guan, Yaowei Wang, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室) Shandong Jianzhu University(山东建筑大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 本文提出MARS系统,用于EgoVis 2026的CASTLE挑战,通过多模态代理推理解决需要多源信息的复杂问题,核心方法是多模态证据选择,主要贡献是实现了在多源数据上的有效推理。

Comments The Runner-up Solution for CASTLE Challenge @ EgoVis 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17303 2026-05-19 cs.CV 57%

LongDPM: Overlap-Aware 4D Reconstruction from Long Monocular Videos

LongDPM: 长视频中基于重叠意识的4D重建

Chenyi Xu, Yihao Wu, Liqi Yan, Chao Yang, Jianhui Zhang, Fangli Guan, Pan Li

机构 * Hangzhou Dianzi University(杭州电子科技大学)

专题命中 长视频与时序推理 :long video(abstract);分类 cs.CV

AI总结 本文提出LongDPM,一种基于重叠意识的长视频单目动态重建框架,通过分块处理、重登记和动态身份关联,实现长距离的3D重建和跟踪,提升了PointOdyssey、Kubric-F和Kubric-G等数据集上的密集跟踪精度和相机姿态估计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏