StreamMem: Query-Agnostic KV Cache Memory for Streaming Video Understanding
机构 * Meta AI ; New York University(纽约大学)
专题命中 长视频与时序推理 :video understanding(title,abstract);long video(abstract);分类 cs.CV
Comments 15 pages, 3 figures
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
机构 * Meta AI ; New York University(纽约大学)
专题命中 长视频与时序推理 :video understanding(title,abstract);long video(abstract);分类 cs.CV
Comments 15 pages, 3 figures
机构 * University of Waterloo(滑铁卢大学) ; University of Toronto(多伦多大学) ; Kuaishou Technology(快手科技) ; Vector Institute(向量研究所) ; M-A-P
专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV
Comments ICCV 2025 Camera Ready Version. Project Page: https://tiger-ai-lab.github.io/Vamba/
机构 * ByteDance(字节跳动)
专题命中 长视频与时序推理 :long video(title,abstract);video generation(abstract);分类 cs.CV
Comments Project page: https://videodepthanything.github.io/
机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) ; Baidu Inc.(百度公司) ; University of Sydney(悉尼大学)
专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV
机构 * Queen Mary University of London(伦敦玛丽女王大学) ; Spotify
专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV
专题命中 长视频与时序推理 :video-language(title,abstract);long video(abstract);分类 cs.CV
Comments CVPRW 2025. Project Page: https://chaitanya100100.github.io/AdaVid/
专题命中 长视频与时序推理 :long video(title,abstract);video generation(abstract);分类 cs.CV
Comments Project page: https://yuqingwang1029.github.io/Loong-video
专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV
专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV
专题命中 长视频与时序推理 :long video(title,abstract);text-to-video(abstract);分类 cs.CV
专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV
Comments Code and models are available at https://github.com/NVlabs/VILA/tree/main/longvila
专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV
Comments The publication has some processing errors (language short-cuts in synthetic data are not avoided) that invalidate some of the conclusions
专题命中 长视频与时序推理 :long video(title,abstract);video language model(abstract);分类 cs.CV
Comments 17 pages, 16 tables, 8 figures. To appear at WACV 2025
专题命中 长视频与时序推理 :long video(title,abstract);video generation(abstract);分类 cs.CV
专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV
Comments 25 pages, 11 figures, accepted by ECCV 2024
专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV
Comments Accepted at CVPR 2024 as a poster highlight
专题命中 长视频与时序推理 :long video(title,abstract);video understanding(abstract);分类 cs.CV
专题命中 长视频与时序推理 :video-language(title,abstract);long video(abstract);分类 cs.CV
Comments Accepted by ICLR 2024
专题命中 长视频与时序推理 :long video(title,abstract);video generation(abstract);分类 cs.CV
专题命中 长视频与时序推理 :video-language(title,abstract);video understanding(abstract);分类 cs.CV
Comments Accepted for publication at CVPR 2023. Project page: https://bpiyush.github.io/testoftime-website/index.html
PyraVid: 用于长时间视频推理的分层多模态记忆
专题命中 长视频与时序推理 :video reasoning(title);video understanding(abstract);long video(abstract)
AI总结 本文提出PyraVid,一种分层多模态记忆框架,通过事件分割理论启发,解决长视频中多模态信息整合、人本信息对齐和证据聚合等挑战,提升长时间视频推理性能。
NARU:用于理解日语超长视频中叙事演变与文化细微差别的基准
机构 * The University of Tokyo(东京大学) ; Kyushu University(九州大学) ; Macau University of Science and Technology(澳门科技大学) ; Infinimind Japan Inc.(Infinimind日本公司) ; University of Alberta(阿尔伯塔大学)
专题命中 长视频与时序推理 :long video(title);video understanding(abstract);分类 cs.CV、cs.MM
AI总结 该研究推出NARU基准,涵盖155个146.8小时日语视频的1481个问题,评估模型在长程叙事整合与文化推理上的局限,为MLLM开发提供测试平台。
Comments Yuheng Huang and Jianlang Chen contributed equally to this work. More details available on the project's website https://ma-labo.github.io/naru/ and https://infinimind.io/en/company/news/2026/narubench-release
TTOM:测试时优化与记忆化用于组合视频生成
机构 * National University of Singapore(国立新加坡大学) ; University of Science and Technology of China(中国科学技术大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
专题命中 长视频与时序推理 :video generation(title,abstract);分类 cs.CV、cs.MM
AI总结 TTOM通过测试时优化与记忆化机制,提升组合视频生成的跨模态对齐能力,实现高效且可扩展的实时生成。
Comments ICLR 2026 Camera-ready. Project page: https://ttom-t2v.github.io/
专题命中 长视频与时序推理 :video-language(title,abstract);分类 cs.CV、cs.MM
专题命中 长视频与时序推理 :long video(title,abstract);分类 cs.CV、cs.MM
Comments Accepted for publication in ICIP2021. 9 pages, including 3 pages of supplemental notes
专题命中 长视频与时序推理 :long video(title,abstract);分类 cs.CV、eess.IV
Comments 7 pages, 4 figures and 3 tables
专题命中 长视频与时序推理 :long video(title,abstract);分类 cs.CV
Comments The Runner-up Solution for YouTube-VIS Long Video Challenge 2022, ECCV 2022 Workshop. arXiv admin note: text overlap with arXiv:2207.10661
基于注意力的MLLM选择器在测试时对长视频进行高效帧选择
机构 * ZJU(浙江大学) ; NJU(南京大学) ; CSU(中南大学) ; Microsoft(微软公司) ; NJUST(南京理工大学)
专题命中 长视频与时序推理 :long video(title,abstract);分类 cs.CV
AI总结 研究利用MLLMs中验证选择提取层的跨模态注意力构建无训练的DAFS帧选择器,通过查询条件聚合提取帧级证据,将候选池大小和每帧令牌预算联合分配问题用动态规划解决,在Video-MME上表现出色,且无需重新训练即可跨多种模型和任务泛化。
CoVStream: 面向长视频流的边缘-云协作理解
机构 * The State Key Lab of Brain-Machine Intelligence, Zhejiang University(浙江大学脑机智能国家重点实验室) ; vivo Mobile Communication Co., Ltd., Shenzhen, China(深圳 vivo 通信有限公司)
专题命中 长视频与时序推理 :long video(title,abstract);分类 cs.CV
AI总结 提出边缘-云协作框架CoVStream,边缘节点将视频流压缩为视觉特征和语义描述传输至云端,云服务器构建实体图与全局视觉上下文,仅在用户查询时激活大模型,在LVBench上带宽降低87.6%且准确率保持99.2%。
Comments 9 pages
遗忘、预期与适应:长视频的测试时训练
机构 * University of Central Florida(中佛罗里达大学)
专题命中 长视频与时序推理 :long video(title,abstract);分类 cs.CV
AI总结 提出帧遗忘网络(FFN),通过仅处理滑动窗口中的三帧并定义惊奇度量自适应调整窗口,实现长视频的高效测试时训练。
Comments ECCV 2026