arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 646 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 646 篇

2606.31734 2026-07-01 cs.CV 新提交 70%

MemLearner: Learning to Query Context memory for Video World Models

MemLearner: 学习查询上下文记忆用于视频世界模型

Jiwen Yu, Jianxiong Gao, Jianhong Bai, Yiran Qin, Kaiyi Huang, Quande Liu, Xintao Wang, Pengfei Wan, Kun Gai, Xihui Liu

机构 * The University of Hong Kong(香港大学) Fudan University(复旦大学) Zhejiang University(浙江大学) Kuaishou Technology(快手科技)

专题命中 长视频与时序推理 :video generation(abstract);long video(abstract);分类 cs.CV

AI总结 提出基于学习的自适应上下文查询方法MemLearner,利用视频生成模型自身进行上下文记忆查询,解决视频世界模型在遮挡和动态场景下的场景一致性问题。

Comments ECCV 2026, Project Page: https://yujiwen.github.io/memlearner/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00793 2026-06-09 cs.CV 版本更新 70%

MBench: A Comprehensive Benchmark on Memory Capability for Video World Models

MBench: 视频世界模型记忆能力的综合基准

Shengjun Zhang, Zhang Zhang, Simin Huang, Zhenyu Tang, Hanyang Wang, Chensheng Dai, Min Chen, Yifan Li, Yuxin Li, Yingjie Chen, Hao Liu, Chen Li, Jing Lyu, Yueqi Duan

机构 * Tsinghua University(清华大学) WeChat Vision, Tecent Inc.(微信视觉,腾讯公司) Peking University(北京大学)

专题命中 长视频与时序推理 :video generation(abstract);long video(abstract);分类 cs.CV

AI总结 提出MBench基准,通过实体一致性、环境一致性和因果一致性三个核心维度及其12个子维度,系统评估视频世界模型的长期记忆能力,并揭示现有方法在长期状态保持上的关键局限。

Comments Project Page: https://peanutup.github.io/MBench-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05677 2026-06-05 cs.CV cs.AI cs.CL 70%

LongSpace: Exploring Long-Horizon Spatial Memory from Perception to Recall in Video

LongSpace: 从感知到回忆的视频长程空间记忆探索

Shiqiang Lang, Jing Liu, Haoyang He, Peiwen Sun, Yuanteng Chen, Tao Liu, Lan Yang, Longteng Guo, Honggang Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Zhongguancun Academy(中关村学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) The Chinese University of Hong Kong(香港中文大学) Xi’an Jiaotong University(西安交通大学)

专题命中 长视频与时序推理 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 针对长视频中空间记忆的挑战,提出LongSpace框架,通过分块建模、3D结构线索注入和层级感知记忆实现长程空间推理,并在LongSpace-Bench等基准上验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31336 2026-06-01 cs.CV 70%

DecMem: Towards Minute-Long Consistent World Generation with Decoupled Memory

DecMem:基于解耦记忆的分钟级一致世界生成

Zhenhao Yang, Xiaoshi Wu, Zhengyao Lv, Xiaoyu Shi, Xintao Wang, Pengfei Wan, Kun Gai, Kwan-Yee K. Wong

机构 * The University of Hong Kong(香港大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 长视频与时序推理 :video generation(abstract);long video(abstract);分类 cs.CV

AI总结 提出解耦记忆架构DecMem,通过稀疏全局记忆和锚定局部记忆解决长程视频生成中的时空一致性问题,实现分钟级可控长视频生成。

Comments Project page is available at https://jeffreyyzh.github.io/DecMem-Page

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13009 2026-04-08 cs.CV 70%

Matrix-game 2.0: An open-source real-time and streaming interactive world model

矩阵游戏2.0:一个开源的实时和流式交互世界模型

Xianglong He, Chunli Peng, Zexiang Liu, Boyang Wang, Yifan Zhang, Qi Cui, Fei Kang, Biao Jiang, Mengyin An, Yangyang Ren, Baixin Xu, Hao-Xiang Guo, Kaixiong Gong, Size Wu, Wei Li, Xuchen Song, Yang Liu, Yangguang Li, Yahui Zhou

机构 * Skywork AI(天工AI)

专题命中 长视频与时序推理 :video generation(abstract);long video(abstract);分类 cs.CV

AI总结 本文提出Matrix-Game 2.0,通过少步自回归扩散生成长视频,解决传统交互世界模型实时性差的问题,实现25FPS高速生成。

Comments Project Page: https://matrix-game-v2.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20354 2026-03-24 cs.MM cs.AI 70%

Leum-VL Technical Report

Leum-VL 技术报告

Yuxuan He, Chaiming Huang, Yifan Wu, Hongjun Wang, Chenkui Shen, Jifan Zhang, Long Li

机构 * Hainan Sihe Data Technology Co., Ltd.(海南世和数据技术有限公司)

专题命中 长视频与时序推理 :video understanding(abstract);video-language(abstract);分类 cs.MM

AI总结 本文提出SV6D框架,通过六维结构化表示解析视频内容,构建Leum-VL-8B模型,在多个基准测试中取得优异成绩,强调视频AI需关注结构表示而非像素生成。

Comments 27 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20185 2026-03-23 cs.CV cs.AI cs.CL 70%

VideoSeek: Long-Horizon Video Agent with Tool-Guided Seeking

VideoSeek: 长时程视频代理与工具引导的搜索

Jingyang Lin, Jialian Wu, Jiang Liu, Ximeng Sun, Ze Wang, Xiaodong Yu, Jiebo Luo, Zicheng Liu, Emad Barsoum

机构 * AMD(AMD公司) University of Rochester(罗切斯特大学)

专题命中 长视频与时序推理 :video understanding(abstract);video-language(abstract);分类 cs.CV

AI总结 VideoSeek通过视频逻辑流程主动寻找关键证据,减少帧数使用,提升视频理解能力,实验显示其在视频理解和推理任务中表现优异。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17312 2026-03-19 cs.CV cs.AI 70%

Recurrent Reasoning with Vision-Language Models for Estimating Long-Horizon Embodied Task Progress

基于视觉语言模型的递归推理用于估计长周期具身任务进度

Yuelin Zhang, Sijie Cheng, Chen Li, Zongzhao Li, Yuxin Huang, Yang Liu, Wenbing Huang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(教育部下一代智能搜索与推荐工程研究中心) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 长视频与时序推理 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 本文提出R²VLM模型,通过递归推理框架处理局部视频片段,维护全局上下文,实现复杂时间依赖推理,提升长周期任务进度估计性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11910 2026-02-26 cs.CV 70%

Seeing the Forest and the Trees: Query-Aware Tokenizer for Long-Video Multimodal Language Models

看清森林与树木:面向长视频多模态语言模型的查询感知分词器

Siyou Li, Huanan Wu, Juexi Shao, Yinghao Ma, Yujian Gan, Yihao Luo, Yuwei Wang, Dong Nie, Lu Wang, Wenqing Wu, Le Zhang, Massimo Poesio, Juntao Yu

机构 * Queen Mary University of London(伦敦女王学院) University of Sheffield(谢菲尔德大学) Imperial College London(伦敦帝国学院) Pengcheng Laboratory(鹏城实验室) Meta Inc(Meta公司) Meituan Inc(美团公司) Nanjing University of Science(南京理工大学) University of Birmingham(伯明翰大学) Utrecht University(乌得勒支大学)

专题命中 长视频与时序推理 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 QTSplus是一种轻量高效的视觉token选择模块,通过动态选择重要视觉证据提升长视频多模态语言模型的性能,显著降低计算成本并提高处理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05829 2026-02-06 cs.CV 70%

Weaver: End-to-End Agentic System Training for Video Interleaved Reasoning

Weaver:用于视频交织推理的端到端代理系统训练

Yudi Shi, Shangzhe Di, Qirui Chen, Qinian Wang, Jiayin Cai, Xiaolong Jiang, Yao Hu, Weidi Xie

专题命中 长视频与时序推理 :video reasoning(abstract);long video(abstract);分类 cs.CV

AI总结 Weaver通过端到端训练多模态推理代理系统,提升视频推理任务在长视频处理上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11129 2026-02-04 cs.CV cs.AI 70%

video-SALMONN S: Memory-Enhanced Streaming Audio-Visual LLM

视频-SALMONN S:内存增强的流式音频视觉大语言模型

Guangzhi Sun, Yixuan Li, Xiaodong Wu, Yudong Yang, Wei Li, Zejun Ma, Chao Zhang

机构 * Tsinghua University(清华大学) University of Cambridge(剑桥大学)

专题命中 长视频与时序推理 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 视频-SALMONN S通过引入测试时训练机制,实现高效流式视频理解,显著提升长视频任务的性能和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06176 2026-01-13 cs.CV 70%

TIR-Flow: Active Video Search and Reasoning with Frozen VLMs

TIR-Flow:基于冻结视频语言模型的主动视频搜索与推理

Hongbo Jin, Siyi Xie, Jiayu Ding, Kuanwei Lin, Ge Li

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学)

专题命中 长视频与时序推理 :video reasoning(abstract);video-language(abstract);分类 cs.CV

AI总结 TIR-Flow通过三个协同模块实现冻结视频语言模型的主动视频搜索与推理,显著提升性能并拓展长视界视频推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07720 2025-12-10 cs.CV 70%

ViSA: 3D-Aware Video Shading for Real-Time Upper-Body Avatar Creation

ViSA: 一种3D感知的视频着色方法用于实时上半身数字人生成

Fan Yang, Heyuan Li, Peihao Li, Weihao Yuan, Lingteng Qiu, Chaoyue Song, Cheng Chen, Yisheng He, Shifeng Zhang, Xiaoguang Han, Steven Hoi, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tongyi Lab, Alibaba Group(阿里云实验室)

专题命中 长视频与时序推理 :video generation(abstract);video diffusion(abstract);分类 cs.CV

AI总结 ViSA结合3D重建与视频生成技术,实时生成高质量上半身数字人,减少模糊和僵硬问题,提升视觉质量。

Comments Project page: \url{https://lhyfst.github.io/visa}

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19261 2025-11-25 cs.CV 70%

LAST: LeArning to Think in Space and Time for Generalist Vision-Language Models

LAST: 为通用视觉-语言模型学习在空间和时间中的思考

Shuai Wang, Daoan Zhang, Tianyi Bai, Shitong Shao, Jiebo Luo, Jiaheng Wei

机构 * HKUST(GZ)(香港科技大学(广州)) University of Rochester(罗切斯特大学)

专题命中 长视频与时序推理 :video understanding(abstract);long video(abstract);分类 cs.CV

AI总结 LAST通过学习在空间和时间上思考,提升通用视觉-语言模型对3D空间和长视频的理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09057 2025-11-18 cs.CV cs.AI cs.CL cs.LG 70%

PAN: A World Model for General, Interactable, and Long-Horizon World Simulation

PAN Team, Jiannan Xiang, Yi Gu, Zihan Liu, Zeyu Feng, Qiyue Gao, Yiyan Hu, Benhao Huang, Guangyi Liu, Yichi Yang, Kun Zhou, Davit Abrahamyan, Arif Ahmad, Ganesh Bannur, Junrong Chen, Kimi Chen, Mingkai Deng, Ruobing Han, Xinqi Huang, Haoqiang Kang, Zheqi Liu, Enze Ma, Hector Ren, Yashowardhan Shinde, Rohan Shingre, Ramsundar Tanikella, Kaiming Tao, Dequan Yang, Xinle Yu, Cong Zeng, Binglin Zhou, Zhengzhong Liu, Zhiting Hu, Eric P. Xing

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 长视频与时序推理 :video generation(abstract);video diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08521 2025-11-12 cs.CV 70%

UniVA: Universal Video Agent towards Open-Source Next-Generation Video Generalist

Zhengyang Liang, Daoan Zhang, Huichi Zhou, Rui Huang, Bobo Li, Yuechen Zhang, Shengqiong Wu, Xiaohan Wang, Jiebo Luo, Lizi Liao, Hao Fei

机构 * Singapore Management University(新加坡管理大学) University of Rochester(罗切斯特大学) University College London(伦敦大学学院) National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Stanford University(斯坦福大学)

专题命中 长视频与时序推理 :video understanding(abstract);video-language(abstract);分类 cs.CV

Comments Technical Report. 24 figures, 37 pages. Website: https://univa.online/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00254 2025-11-03 cs.CV cs.AI 70%

AVA: Towards Agentic Video Analytics with Vision Language Models

Yuxuan Yan, Shiqi Jiang, Ting Cao, Yifan Yang, Qianqian Yang, Yuanchao Shu, Yuqing Yang, Lili Qiu

机构 * Zhejiang University(浙江大学) Microsoft Research(微软研究院) Tsinghua University(清华大学)

专题命中 长视频与时序推理 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments Accepted to NDSI 2026, 19pages, 12 figures, complementary evaluations and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16421 2025-09-26 cs.CV cs.AI 70%

AHA -- Predicting What Matters Next: Online Highlight Detection Without Looking Ahead

Aiden Chang, Celso De Melo, Stephanie M. Lukin

机构 * University of Southern California(南加州大学) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 长视频与时序推理 :video understanding(abstract);video-language(abstract);分类 cs.CV

Comments Accepted at NeurIPS 2025, 32 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03426 2025-09-04 cs.CV 70%

Time-Scaling State-Space Models for Dense Video Captioning

AJ Piergiovanni, Ganesh Satish Mallya, Dahun Kim, Anelia Angelova

机构 * Google Deepmind(谷歌DeepMind)

专题命中 长视频与时序推理 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments BMVC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15720 2025-08-22 cs.CV 70%

WorldWeaver: Generating Long-Horizon Video Worlds via Rich Perception

Zhiheng Liu, Xueqing Deng, Shoufa Chen, Angtian Wang, Qiushan Guo, Mingfei Han, Zeyue Xue, Mengzhao Chen, Ping Luo, Linjie Yang

机构 * The University of Hong Kong(香港大学) ByteDance Seed(字节跳动种子)

专题命中 长视频与时序推理 :video generation(abstract);long video(abstract);分类 cs.CV

Comments Project page: https://johanan528.github.io/worldweaver_web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19951 2025-07-23 cs.CV cs.CL cs.LG 70%

Sparrow: Data-Efficient Video-LLM with Text-to-Image Augmentation

Shukang Yin, Chaoyou Fu, Sirui Zhao, Chunjiang Ge, Yan Yang, Yuhan Dai, Yongdong Luo, Tong Xu, Caifeng Shan, Enhong Chen

机构 * USTC(中国科学技术大学) NJU(南京大学) THU(清华大学) XMU(厦门大学)

专题命中 长视频与时序推理 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments Project page: https://github.com/VITA-MLLM/Sparrow

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07202 2025-07-11 cs.CV 70%

A Survey on Long-Video Storytelling Generation: Architectures, Consistency, and Cinematic Quality

Mohamed Elmoghany, Ryan Rossi, Seunghyun Yoon, Subhojyoti Mukherjee, Eslam Bakr, Puneet Mathur, Gang Wu, Viet Dac Lai, Nedim Lipka, Ruiyi Zhang, Varun Manjunatha, Chien Nguyen, Daksh Dangi, Abel Salinas, Mohammad Taesiri, Hongjie Chen, Xiaolei Huang, Joe Barrow, Nesreen Ahmed, Hoda Eldardiry, Namyong Park, Yu Wang, Jaemin Cho, Anh Totti Nguyen, Zhengzhong Tu, Thien Nguyen, Dinesh Manocha, Mohamed Elhoseiny, Franck Dernoncourt

专题命中 长视频与时序推理 :video generation(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05874 2025-05-30 cs.CV cs.AI cs.CL cs.IR cs.LG 70%

VideoRAG: Retrieval-Augmented Generation over Video Corpus

Soyeong Jeong, Kangsan Kim, Jinheon Baek, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

专题命中 长视频与时序推理 :video language model(abstract);long video(abstract);分类 cs.CV

Comments ACL Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12593 2025-04-07 cs.CV cs.AI 70%

AdaCM$^2$: On Understanding Extremely Long-Term Video with Adaptive Cross-Modality Memory Reduction

Yuanbin Man, Ying Huang, Chengming Zhang, Bingzhe Li, Wei Niu, Miao Yin

专题命中 长视频与时序推理 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments CVPR 2025 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11495 2025-03-17 cs.CV 70%

V-STaR: Benchmarking Video-LLMs on Video Spatio-Temporal Reasoning

Zixu Cheng, Jian Hu, Ziquan Liu, Chenyang Si, Wei Li, Shaogang Gong

专题命中 长视频与时序推理 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

Comments A benchmark for Video Spatio-Temporal Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.21080 2024-12-31 cs.CV 70%

Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model

Yifei Huang, Jilan Xu, Baoqi Pei, Yuping He, Guo Chen, Lijin Yang, Xinyuan Chen, Yaohui Wang, Zheng Nie, Jinyao Liu, Guoshun Fan, Dechen Lin, Fang Fang, Kunpeng Li, Chang Yuan, Yali Wang, Yu Qiao, Limin Wang

专题命中 长视频与时序推理 :video generation(abstract);long video(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10917 2024-09-18 cs.CV 70%

AMEGO: Active Memory from long EGOcentric videos

Gabriele Goletto, Tushar Nagarajan, Giuseppe Averta, Dima Damen

专题命中 长视频与时序推理 :video understanding(abstract);video reasoning(abstract);分类 cs.CV

Comments Accepted to ECCV 2024. Project webpage: https://gabrielegoletto.github.io/AMEGO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02336 2024-08-07 cs.CV cs.LG 70%

Infusing Environmental Captions for Long-Form Video Language Grounding

Hyogun Lee, Soyeon Hong, Mujeen Sung, Jinwoo Choi

专题命中 长视频与时序推理 :video-language(abstract);long video(abstract);分类 cs.CV

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.01692 2023-01-05 cs.CV 70%

Long Movie Clip Classification with State-Space Video Models

Md Mohaiminul Islam, Gedas Bertasius

专题命中 长视频与时序推理 :video understanding(abstract);long video(abstract);分类 cs.CV

Comments Accepted by ECCV 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.02874 2022-08-03 cs.CV cs.AI cs.CL cs.SD eess.AS 70%

ECLIPSE: Efficient Long-range Video Retrieval using Sight and Sound

Yan-Bo Lin, Jie Lei, Mohit Bansal, Gedas Bertasius

专题命中 长视频与时序推理 :text-to-video(abstract);long video(abstract);分类 cs.CV

Comments ECCV 2022 Oral project page: https://yanbo.ml/project_page/eclipse/

详情

展开后加载摘要…

URL PDF HTML 收藏