arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 533 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 116 篇

2607.24794 2026-07-29 cs.AI cs.CV 新提交 89%

Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding

利用记忆进行推理:一种用于免训练长视频理解的时间粒度自适应框架

Linghao Meng, Qiankun Li, Junyuan Mao, Pujin Liao, Zhicheng He, Enbo Zhang, Kun Wang, Yang Liu, Huazhu Fu, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(高性能计算研究所,科学、技术与研究机构(A*STAR)) Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) Jilin University(吉林大学)

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);video reasoning(abstract);分类 cs.CV

AI总结 研究针对多模态大语言模型长视频理解受限问题,提出ReMem框架,通过双级记忆增强自适应,在查询和视频级别分别处理,能适应不同时间粒度,经实验验证在多个基准测试中实现高效零样本性能,提升模型长视频推理能力。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15778 2026-07-20 cs.CV cs.AI 新提交 89%

Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding

用于多事件长视频理解的模块化动态粒度视频语言模型

Wei Feng, Xin Wang, Yu-Wei Zhan, Yuwei Zhou, Wenwu Zhu

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);video reasoning(abstract);分类 cs.CV

AI总结 针对长视频理解中视觉令牌预算与多事件捕捉的矛盾问题,提出MoD-VLLM框架,含正-负视频片段定位和模块化动态粒度反射模块,结合动态粒度强化学习策略,在多事件长视频基准测试中显著优于现有基线。

Comments Accepted by 2026 IEEE International Conference on Multimedia and Expo (ICME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05780 2026-08-07 cs.CV 新提交 88%

Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding

用于高效长视频理解的证据驱动型动态视觉选择器

Bo Zhang, Wenxin Wang, Feng Chen, Zhihao Zhang, Zixuan Wang, Changsheng Li, Yinjie Lei

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 本文提出基于目标MLLM内部注意力证据的动态视觉选择框架EviSelect,通过GRPO优化的随机策略实现高效长视频理解,在三个基准上性能更优,视觉token减少约50%、端到端加速3.9倍。

Comments Project Page: https://zhangbo135.github.io/EviSelect/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28463 2026-07-31 cs.CV 新提交 88%

VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding

VisualRouter:面向长视频理解的查询驱动视觉采样

Haiyue Zhang, Yi Bin, Xun Jiang, Zeyu Ma, Duo Peng, Guoqing Wang, Yang Yang, Heng Tao Shen

机构 * Tongji University(同济大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 本文提出无训练即插即用框架VisualRouter,通过将查询分为全局或局部并采用对应采样策略,提升了大型视觉语言模型的长视频理解性能,在多个基准数据集上优于均匀采样及现有无训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12557 2026-07-15 cs.CV 新提交 88%

Gaussian Mixture Modeling for Event-Aware Visual Allocation in Long Video Understanding

用于长视频理解中事件感知视觉分配的高斯混合模型

Yifan Lu, Ziqi Zhang, Chunfeng Yuan, Jun Gao, Bing Li, Weiming Hu

机构 * Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information, CASIA(中国科学院自动化所多模态信息超智能安全北京市重点实验室) State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(中国科学院自动化所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Hello Group(未知(保留英文)) School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院)

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 针对长视频理解中视觉分配问题,提出GMM-EVA方法,利用高斯混合模型建模事件级结构,采用差异化分配策略,在多个长视频基准实验中显著优于均匀采样,以约一半视觉令牌预算达可比性能,凸显高效性。

Comments accepted at PRCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00983 2026-07-02 cs.CV 新提交 88%

QCA: Query- and Content-Aware Keyframe Selection for Long Video Understanding

QCA:面向长视频理解的查询与内容感知关键帧选择

Jun Peng, Baiyang Song, Jie Li, Hui Li, Yiyi Zhou, Rongrong Ji, Yonghong Tian

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) Peng Cheng Laboratory(鹏城实验室)

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 提出QCA框架,通过联合建模查询相关性和内容偏差动态分配关键帧预算,无需额外训练即可集成到Video-LLMs,在长视频理解基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27922 2026-07-01 cs.CV cs.AI 新提交 88%

Reflect-R1: Evidence-Driven Reflection for Self-Correction in Long Video Understanding

Reflect-R1:长视频理解中基于证据驱动的自纠正反思

Shuimu Chen, Yuteng Chen, Yuanshen Guan, Zebang Cheng, Zeyu Zhang, Shengqian Qin, Bin Xia, Jiaran Li, Wenming Yang, Fei Ma

机构 * Tsinghua University(清华大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) Shenzhen University(深圳大学) University of California(加利福尼亚大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 提出Reflect-R1框架,通过直觉、验证、仲裁三阶段管道动态检索客观视觉证据,并设计阶段解耦强化学习算法SD-GRPO解决策略耦合,在长视频理解基准上达到最优性能。

Comments 2026 ECCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24187 2026-06-25 cs.CV 新提交 88%

Towards Fast and Effective Long Video Understanding of Multimodal Large Language Models via Adaptive Quasi-Gaussian Sampling

面向多模态大语言模型的长视频快速有效理解:自适应准高斯采样

Kun Zhang, Chenxin Fang, Tao Chen, Baiyang Song, Yunhang Shen, Yiyi Zhou, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室)

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 提出自适应无训练帧采样方法AdaQ,基于高斯分布3-σ规则动态调整采样区间,在仅用64帧下使Qwen3-VL-8B平均超越GPT4o 15.8%,显著提升长视频理解的鲁棒性和效率。

Comments NeurIPS 2026 submission. 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07512 2026-06-25 cs.CV cs.AI cs.CL 新提交 88%

MemDreamer: Decoupling Perception and Reasoning for Long Video Understanding via Hierarchical Graph Memory and Agentic Retrieval Mechanism

MemDreamer: 通过分层图记忆和智能体检索机制解耦感知与推理以实现长视频理解

Cong Chen, Guo Gan, Kaixiang Ji, ZhaoYang Zhang, Zhen Yang, Guangming Yao, Hao Chen, Jingdong Chen, Yi Yuan, Chunhua Shen

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学) Central South University(中南大学) HKUST(GZ)(香港科技大学(广州))

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 提出MemDreamer框架,通过分层图记忆和智能体检索机制解耦感知与推理,将长视频理解转化为智能体探索过程,在四个基准上达到SOTA,推理上下文窗口仅占全量2%且准确率提升12.5点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21734 2026-06-23 cs.CV cs.AI 新提交 88%

HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning

HPP:通过解耦感知与推理的分层程序化探测用于长视频理解

Awais Rauf, Ahmed Hasssan, Greg Slabaugh

机构 * Queen’s University Belfast(贝尔法斯特女王大学) AMD(AMD公司) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 提出HPP框架,通过将长视频理解重构为分层视频的迭代程序化探索,解耦语义感知与高阶时序推理,在LongVideoBench等基准上取得显著提升。

Comments Project page: https://awaisrauf.com/HPP

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20726 2026-06-23 cs.CV 新提交 88%

How Well Can Your Video Model Remember? Measuring Memory-Budget Trade-offs in Long Video Understanding

你的视频模型记忆能力如何?衡量长视频理解中的记忆-预算权衡

Yixian Tian

机构 * Fudan University(复旦大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 提出一个经验模型,量化帧预算B和时间距离D对长视频理解准确率的影响,发现准确率与log预算呈线性关系,且距离相关指数α(D)可衡量不同模型的长距离记忆效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12125 2026-06-11 cs.CV 新提交 88%

Q-Fold: Query-Aware Focus-Context Spatio-Temporal Folding for Long Video Understanding

Q-Fold: 查询感知的焦点-上下文时空折叠用于长视频理解

Biao Tang, Xu Chen, Shuxiang Gou, Jingyi Yuan, Yuhan Zhang, Chenqiang Gao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(电子科技大学深圳高等研究院)

专题命中 视频理解 :video understanding(title,abstract);long video(title,abstract);分类 cs.CV

AI总结 提出Q-Fold,一种无需训练的长视频输入构建框架,通过查询引导将相关片段保留为高保真焦点帧,不相关片段折叠为上下文布局,在固定预算下提升多模态大模型的长视频理解性能。

Comments 10 pages, 5 figures, 8 tables. Code will be made publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06991 2026-06-08 cs.CV cs.AI 新提交 88%

Don't Pause: Streaming Video-Language Synchrony for Online Video Understanding

不要暂停:面向在线视频理解的流式视频-语言同步

Zhenyu Yang, Kairui Zhang, Shengsheng Qian, Weiming Dong, Changsheng Xu

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 视频理解 :video understanding(title,abstract);video-language(title,abstract);分类 cs.CV

AI总结 提出流式视频-语言同步(SVLS)范式,通过帧驱动转换控制器和流式令牌调节器实现视频帧与语言生成的细粒度同步,在不中断感知的情况下进行实时交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03918 2026-08-05 cs.CV cs.AI 新提交 86%

When and Where to Look: Adaptive Visual Evidence Scheduling for Efficient Long Video Understanding

何时与何地查看:用于高效长视频理解的自适应视觉证据调度

Ke Li, Jiayu Chen, Maoliang Li, Zihao Zheng, Hailong Zou, Hengyi Zhang, Xuanzhe Liu, Xiang Chen

专题命中 视频理解 :video understanding(title,abstract);long video(title);分类 cs.CV

AI总结 提出无需训练的EcoFrame框架,通过熵门控预算调度和注意力引导候选提议实现高效视觉证据调度,在多个长视频理解基准上实现精度与效率的更优权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09064 2026-06-09 cs.CV cs.AI 新提交 86%

See More, Think Deeper: Query-Expanded Visual Evidence and Answer-Clue Guided Reflection for Long Video Understanding

看得更多,思考更深:面向长视频理解的查询扩展视觉证据与答案线索引导反思

Shuning Wang, Zhiheng Wu, YiNuo Lu, Naiming Liu, Chen Jia, Bowen Liu, Shuo Nie, Weijie Zhu, Yumeng Zhang

机构 * Baidu Inc.(百度公司) Harbin Institute of Technology(哈尔滨工业大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 视频理解 :video understanding(title,abstract);long video(title);分类 cs.CV

AI总结 提出CoVER框架,通过动态收集查询扩展视觉证据和答案特定视觉反馈验证草稿答案,实现从答案中心生成到证据中心和视觉可验证推理的转变,在长视频理解任务上超越同规模模型及部分闭源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04676 2026-08-06 cs.CV 新提交 83%

SurgNarrator: A Generative Retrieval Framework for Surgical Video Understanding

SurgNarrator:面向手术视频理解的生成式检索框架

Yuqing Feng, Jiawei Ma, Kevin Qinghong Lin, Kun Yuan, Nicolas Padoy, Daniel S. Elson, Anh Nguyen, Stamatia Giannarou, Baoru Huang

机构 * University of Liverpool(利物浦大学) City University of Hong Kong(香港城市大学) University of Oxford(牛津大学) University of Strasbourg(斯特拉斯堡大学) IHU Strasbourg(斯特拉斯堡大学医院研究所) Imperial College London(帝国理工学院)

专题命中 视频理解 :video understanding(title,abstract);video-language(abstract);分类 cs.CV

AI总结 SurgNarrator是专为手术视频理解设计的生成式检索框架,通过构建手术词汇表、适配Qwen3-VL-Embedding-8B并采用分层检索策略,在零样本设置下于12个基准上实现性能提升且延迟大幅降低。

Comments This work has been submitted to the IEEE for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24582 2026-07-28 cs.CV cs.AI 新提交 83%

CADER: Confidence-Aware Dynamic Evidence Reasoning for Long-Video Understanding

CADER:用于长视频理解的置信度感知动态证据推理

Jinlong Yang, Wenhao Zhang, Kuanwei Lin, Sijie Cheng

专题命中 视频理解 :video understanding(title,abstract);video reasoning(abstract);分类 cs.CV

AI总结 针对长视频理解中现有系统推理过程不考虑难度的问题,提出CADER框架。它先全局推理估计置信度让高置信度示例提前退出,对不确定示例激活第二阶段工具增强循环定位证据,实验证明其能提升长视频推理能力并提供实用推理路线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14935 2026-07-17 cs.CV 新提交 83%

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

VideoChat3:用于高效通用视频理解的全开放视频多模态语言模型

Xinhao Li, Yuhan Zhu, Xiangyu Zeng, Yuhao Dong, Haoning Wu, Zhiqiu Zhang, Yuandong Yang, Changlian Ma, Qingyu Zhang, Yansong Shi, Xinyu Chen, Haoran Chen, Zizheng Huang, Jun Zhang, Kun Ouyang, Lin Sui, Ziang Yan, Yicheng Xu, Chenting Wang, Yinan He, Hongjie Zhang, Yi Wang, Yu Qiao, Yali Wang, Ziwei Liu, Kai Chen, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) Peking University(北京大学)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 研究针对视频理解开源模型局限,提出VideoChat3。通过I3D-ViT等提升效率,利用可扩展视频数据合成管道生成训练数据集提升泛化性,以4B参数在多基准测试中超越同等或更多参数的开源模型,实现泛化与计算效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31326 2026-07-01 cs.CV 新提交 83%

Bridging Video Understanding and Generation in a Unified Framework

桥接视频理解与生成的统一框架

Yuqi Wang, Runyi Li, Ruoyu Feng, Renjie Chen, Wenfeng Lin, Mingyu Guo

专题命中 视频理解 :video understanding(title,abstract);video generation(abstract);分类 cs.CV

AI总结 提出Vega统一框架,通过共享词汇表联合建模文本与视觉表示,结合自回归预测关键帧语义令牌与扩散模型渲染密集视频帧,在视频生成和理解基准上均取得强性能。

Comments technical blog

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26904 2026-06-26 cs.CV cs.AI 新提交 83%

Confidence-Aware Tool Orchestration for Robust Video Understanding

置信度感知的工具编排用于鲁棒视频理解

Yangfan He, Yujin Choi, Jaehong Yoon

专题命中 视频理解 :video understanding(title,abstract);video reasoning(abstract);分类 cs.CV

AI总结 针对视频推理模型盲目信任所有帧的问题,提出Robust-TO框架,通过每帧可信度评分、统一证据接口和三阶段合成机制,在八项任务上实现56.4%准确率,超越最强开源基线10.6%,并在五种真实扰动下保持54.3%准确率。

Comments Project page: https://rova-v2.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22870 2026-06-23 cs.CV cs.AI 新提交 83%

VideoLatent: Video-Language Learning via Latent Self-Forcing

VideoLatent: 通过潜在自强制进行视频-语言学习

Zi-Yuan Hu, Zicong Tang, Shijia Huang, Yanyang Li, Michael R. Lyu, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Weitu AI(微图AI)

专题命中 视频理解 :video-language(title);video understanding(abstract);video reasoning(abstract);分类 cs.CV

AI总结 提出VideoLatent,一种通过潜在自强制训练范式(包括潜在对齐和潜在多样性目标)进行视觉潜在推理的多模态大语言模型,仅依赖标准视频-问答三元组,在14个基准上优于现有模型,并大幅降低训练/推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11913 2026-06-11 cs.CV 新提交 83%

From Content to Knowledge: Lightning Fast Long-Video Understanding with Neural Knowledge Representations

从内容到知识:基于神经知识表示的闪电般快速长视频理解

Yuchen Guan, Xiao Li, Zongyu Guo, Xiaoyi Zhang, Xiulian Peng, Chun Yuan, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 提出将长视频编码为神经知识表示(NKR),通过智能体知识蒸馏(AKD)自动合成描述和问答对,将视频知识嵌入VLM骨干网络的少量权重中,实现轻量级、可复用的视频理解,推理时无需重新加载视频,大幅降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06532 2026-06-08 cs.CV 新提交 83%

GOPAgen: Motion-Aware and Efficient Agentic Long-Video Understanding with Structural Memory and Hierarchical Reasoning

GOPAgen: 基于结构记忆与层次推理的运动感知高效智能长视频理解

Haozhe Chi, Yang Jin, Yadong Mu

机构 * Peking University(北京大学)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 提出GOPAgen方法,通过视频编解码的GOP运动代理、GOP树推理算法和结构记忆机制,实现高效长视频理解,在多个VQA基准上取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07433 2026-06-08 cs.CV cs.AI cs.MM 新提交 81%

Watch, Remember, Reason: Human-View Video Understanding with MLLMs

Watch, Remember, Reason: 基于多模态大语言模型的人类视角视频理解

Jiahao Meng, Yue Tan, Qi Xu, Kuan Gao, Weisong Liu, Yanwei Li, Jason Li, Lingdong Kong, Haochen Wang, Qianyu Zhou, Jiangning Zhang, Guangliang Cheng, Yunhai Tong, Lu Qi, Minghsuan Yang

机构 * School of Intelligence Science and Technology, Peking University(北京理工大学智能科学与技术学院) Wuhan University(武汉大学) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) CASIA(中国科学院自动化研究所) University of Tokyo(东京大学) University of Liverpool(利物浦大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) UC Merced(加州大学默塞德分校)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV、cs.MM

AI总结 提出人类视角下视频理解的三个功能能力(观看、记忆、推理),构建统一框架分析视频MLLM的感知、记忆、推理和预测,并总结挑战、方法、应用及未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13031 2026-08-14 cs.CV cs.AI 新提交 79%

UniTraffic-Agent: Unified Traffic Video Reasoning for AI City Challenge 2026 Track 3 with Two Out-of-Domain Evaluations

UniTraffic-Agent:面向2026年AI城市挑战赛第3赛道的统一交通视频推理,含两项域外评估

Peng Li, Qianqian Xu, Shilong Bao, Yangbangyan Jiang, Qingming Huang

机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences (UCAS)(中国科学院大学计算机科学与技术学院) Institute of Computing Technology (ICT), Chinese Academy of Sciences (CAS)(中国科学院计算技术研究所) Beijing Academy of Artificial Intelligence (BAAI)(北京智源人工智能研究院) School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院)

专题命中 视频理解 :video reasoning(title);video understanding(abstract);分类 cs.CV

AI总结 UniTraffic-Agent是第10届AI城市挑战赛第3赛道的MR-CAS解决方案,采用观察-推理-行动-验证工作流,在TAR、FETV、PSI-VQA三项任务中取得相应排名,为交通视频推理提供了新方案。

Comments This paper has been accepted to ECCV 2026 AI City Challenge Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10949 2026-08-12 cs.CV cs.CL 新提交 79%

StreamFlow: Dynamic Memory Flows for Streaming Video Understanding

StreamFlow:用于流视频理解的动态内存流

Muxin Fu, Yifan Zhang, Wentao Zhang, Fangming Guo, Qian Chen, Guibin Zhang, Shuicheng Yan, Bo An

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 StreamFlow是一种动态视觉内存框架,通过中期内存过滤冗余、长期内存整合潜变量及注意力检索,在流视频理解任务中实现最优性能,同时提升视觉依据性并降低延迟与内存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10764 2026-08-12 cs.CV 新提交 79%

FADE: From Passive Verification to Active Discovery in Counterfactual Video Understanding

FADE:从被动验证到反事实视频理解中的主动发现

Fufangchen Zhao, Jinhu Fu, Jiachen Lei, Jiahong Wu, Xiangxiang Chu, Danfeng Yan

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 本文提出FADE框架,解决现有反事实视频理解基准泄露目标事件的问题,通过两阶段训练实现主动发现,在三项任务上性能优于GPT-5.6,为相关研究提供坚实基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05707 2026-08-07 cs.CV 新提交 79%

One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding

单一排序,任意预算:用于长视频理解的套娃式证据到上下文帧选择框架

Wang Chen, Yu Chen, Xiang Wang, Shuai Li, Jinfa Huang, Xiawu Zheng

专题命中 视频理解 :video understanding(title);long video(abstract);分类 cs.CV

AI总结 本文提出MEC帧选择框架,将长视频帧选择建模为套娃式排序问题,构建单一可复用排序适配任意预算,提升了长视频理解的准确率并降低了选择延迟。

Comments 21 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05703 2026-08-07 cs.CV 新提交 79%

StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding

StreamArena:面向连续、交互式且长视界的智能体流媒体视频理解

Xichen Zhang, Guankai Li, Yinghao Zhu, Shijian Wang, Sitong Wu, Shaozuo Yu, Meng Chu, Yuan Lu, Jiaya Jia

机构 * The Hong Kong University of Science and Technology(香港科技大学) Xiaohongshu Inc.(小红书公司) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 针对当前智能体流媒体视频理解评估的缺陷,提出StreamArena基准,设计StreamMind架构解决连续交互与长视界理解的张力,在四项能力上优于现有基线并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05592 2026-08-07 cs.CV 新提交 79%

Beyond Frame Selection: Rethinking Long-Video Understanding with MLLMs

超越帧选择:用多模态大语言模型重新思考长视频理解

Ziling Huang, Shin'ichi Satoh

机构 * National Institute of Informatics(信息学研究所)

专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV

AI总结 针对 MLLMs 长视频理解的帧选择策略难以兼顾全局与局部信息的问题,提出 VideoRouter 模型,通过时间层次结构和验证引导路由器协调全局与局部推理,在 VideoMME 数据集上实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏