Can't Fool Me: Adversarially Robust Transformer for Video Understanding
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV、cs.MM
Comments arXiv admin note: substantial text overlap with arXiv:2103.10043
AI 大模型
视频理解、视频生成、视频语言模型和时序视觉推理。
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV、cs.MM
Comments arXiv admin note: substantial text overlap with arXiv:2103.10043
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV、cs.MM
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV、cs.MM
Comments Submitted to ECCV 2018. 17 pages, 7 figures, Supplementary Material, https://github.com/mzolfaghari/ECO-efficient-video-understanding
视频理解:从几何与语义到统一模型
机构 * Department of Computer Science(计算机科学系) ; University of Copenhagen(哥本哈根大学) ; College of Computer Science(计算机科学学院) ; Nankai University(南开大学) ; School of Computer and Communication Sciences(计算机与通信科学学校) ; EPFL(苏黎世联邦理工学院) ; Department of Computer Science & Engineering(计算机科学与工程系) ; Washington University in St. Louis(圣路易斯华盛顿大学) ; Computer Vision Lab(计算机视觉实验室) ; University of Würzburg(乌尔姆大学) ; Computer Science Research Centre(计算机科学研究中心) ; University of Surrey(萨里大学) ; School of Electrical, Computer and Telecommunications Engineering(电气、计算机和电信工程学院) ; University of Wollongong(沃林根大学) ; Language Technology Lab(语言技术实验室) ; University of Cambridge(剑桥大学) ; School of Artificial Intelligence(人工智能学院) ; Beijing Institute of Technology(北京理工大学) ; Institute for Computer Science(计算机科学研究所) ; INSAIT
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 本文综述了视频理解的发展,从低层几何理解到高层语义理解和统一模型,探讨了时间动态和视觉上下文建模的重要性,并总结了当前研究趋势和挑战。
Comments A comprehensive survey of video understanding, spanning low-level geometry, high-level semantics, and unified understanding models
Journal ref Machine Intelligence Research 2026
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
Comments 8-page extended version of our challenge paper in ACM MM 2021. It presents the overview of grand challenge "Multi-modal Ads Video Understanding" in ACM MM 2021. Our grand challenge is also the Tencent Advertising Algorithm Competition (TAAC) 2021
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
Comments Submitted to the CVPR 2017 Workshop on YouTube-8M Large-Scale Video Understanding
UniTraffic-Agent:面向2026年AI城市挑战赛第3赛道的统一交通视频推理,含两项域外评估
机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences (UCAS)(中国科学院大学计算机科学与技术学院) ; Institute of Computing Technology (ICT), Chinese Academy of Sciences (CAS)(中国科学院计算技术研究所) ; Beijing Academy of Artificial Intelligence (BAAI)(北京智源人工智能研究院) ; School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院)
专题命中 视频理解 :video reasoning(title);video understanding(abstract);分类 cs.CV
AI总结 UniTraffic-Agent是第10届AI城市挑战赛第3赛道的MR-CAS解决方案,采用观察-推理-行动-验证工作流,在TAR、FETV、PSI-VQA三项任务中取得相应排名,为交通视频推理提供了新方案。
Comments This paper has been accepted to ECCV 2026 AI City Challenge Workshop
StreamFlow:用于流视频理解的动态内存流
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 StreamFlow是一种动态视觉内存框架,通过中期内存过滤冗余、长期内存整合潜变量及注意力检索,在流视频理解任务中实现最优性能,同时提升视觉依据性并降低延迟与内存。
FADE:从被动验证到反事实视频理解中的主动发现
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 本文提出FADE框架,解决现有反事实视频理解基准泄露目标事件的问题,通过两阶段训练实现主动发现,在三项任务上性能优于GPT-5.6,为相关研究提供坚实基线。
单一排序,任意预算:用于长视频理解的套娃式证据到上下文帧选择框架
专题命中 视频理解 :video understanding(title);long video(abstract);分类 cs.CV
AI总结 本文提出MEC帧选择框架,将长视频帧选择建模为套娃式排序问题,构建单一可复用排序适配任意预算,提升了长视频理解的准确率并降低了选择延迟。
Comments 21 pages, 7 figures, 7 tables
StreamArena:面向连续、交互式且长视界的智能体流媒体视频理解
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Xiaohongshu Inc.(小红书公司) ; The University of Hong Kong(香港大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 针对当前智能体流媒体视频理解评估的缺陷,提出StreamArena基准,设计StreamMind架构解决连续交互与长视界理解的张力,在四项能力上优于现有基线并降低延迟。
超越帧选择:用多模态大语言模型重新思考长视频理解
机构 * National Institute of Informatics(信息学研究所)
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 针对 MLLMs 长视频理解的帧选择策略难以兼顾全局与局部信息的问题,提出 VideoRouter 模型,通过时间层次结构和验证引导路由器协调全局与局部推理,在 VideoMME 数据集上实现性能提升。
用于令牌高效视频语言模型的持久对象叙事
专题命中 视频理解 :video language model(title);video understanding(abstract);分类 cs.CV
AI总结 本文提出SlotNarrative,一种用于Video-LLM的紧凑结构化视觉接口,通过持久对象叙事减少视觉令牌数量,在多数据集上实现准确率与令牌数的良好权衡。
MetaVideoAgent:面向长视频理解的自动视频智能体进化框架
机构 * Alibaba Group(阿里巴巴集团) ; Zhejiang University(浙江大学) ; Beihang University(北京航空航天大学) ; ByteDance(字节跳动)
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 MetaVideoAgent是自动进化视频智能体的框架,在VA-EvoBench上经4次迭代后将宏平均准确率从38.44%提至51.47%,性能优于现有最优固定设计智能体且成本更低。
Comments 16 pages, 7 figures. Code: https://github.com/Alibaba-VELLDEPTH/MetaVideoAgent
用于视频-语言模型高效推理的自适应两阶段视觉令牌剪枝
专题命中 视频理解 :video-language(title);video understanding(abstract);分类 cs.CV
AI总结 针对视频-语言模型推理延迟高的问题,提出两阶段自适应令牌剪枝策略,先剪去视频冗余帧,再根据视频内容自适应剪去保留帧中的冗余令牌,无需额外训练微调,在10%令牌保留率下提升准确率7%并降低95%计算量。
超越单摄像头:体育视频理解中的智能多视角推理
机构 * Zhejiang University(浙江大学) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 针对体育视频多视角理解缺乏评估基准及MLLMs难以利用多视角信息的问题,引入SportMV - Bench基准,分析瓶颈所在,并提出SportMV - Agent框架,通过迭代循环实现主动视角选择等,相比最强MLLM基线有显著提升。
面向视频理解的覆盖驱动型自适应关键帧选择
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 本文针对视频理解中LVLM处理大量帧计算开销大的问题,提出无需训练的CSES关键帧选择器,通过覆盖驱动的自适应策略减少需评分和选择的帧数量,同时保持准确率并提升选择速度。
ObjectStream:将潜在对象作为记忆锚点用于流视频理解
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 提出无需训练的 ObjectStream 框架,以潜在对象为记忆锚点组织流视频证据,使 Video-LLMs 无需改动即可推理对象相关内容,在多基准上实现性能提升且内存与推理效率显著优化。
FORGE:用于长视频理解的相关几何中的帧正交性
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Center for Signal and Information Processing (CSIP)(信号与信息处理中心 (CSIP)) ; School of Electrical and Computer Engineering(电气与计算机工程学院)
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 研究长视频理解中推理时最大化查询相关信息问题,提出FORGE模型无关方法,通过在预训练嵌入空间引入查询条件几何统一相关性和多样性,实验证明该方法在关键帧选择和问答上有显著提升。
Comments Under Review
CREST: 曲率调节的事件中心采样用于高效长视频理解
机构 * Dept. of CSE, University of Dhaka(达卡大学计算机科学与工程系) ; Dept. of CSE, University of Central Florida(中央佛罗里达大学计算机科学与工程系)
专题命中 视频理解 :video understanding(title);long video(abstract);分类 cs.CV
AI总结 提出一种无训练帧选择方法CREST,利用查询-帧相关性的时间几何(局部曲率)来指导采样,在固定预算下实现高效长视频理解。
超越帧选择:用于长视频理解的生成式潜在证据聚合
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Baidu Inc.(百度公司) ; Alibaba Group(阿里巴巴集团) ; Xidian University(西安电子科技大学)
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 该研究针对长视频理解的帧选择局限,提出GenEvA框架,通过查询条件化分布聚合跨帧潜在证据,在四个基准和两个视频多模态大语言模型主干上显著提升性能且开销极低。
MarineEVT:通过视觉工具推理推进以事件为中心的海洋视频理解
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校) ; University of Electronic Science and Technology of China(电子科技大学)
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 针对海洋视频理解面临的挑战,构建MarineEVT数据集,将其理解分解为EVT-R1过程,利用视觉工具驱动模型。实验显示EVT-R1优于多个SOTA VLMs,为海洋相关发展奠定基础并推动VLMs进步。
Comments Accepted to The 19th European Conference on Computer Vision (ECCV) 2026
Cambrian-P: 基于姿态的视频理解
机构 * New York University(纽约大学) ; UC Berkeley(加州大学伯克利分校) ; Meta FAIR
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 该研究提出Cambrian-P,一种增强的视频多模态大语言模型,通过引入可学习的相机令牌和姿态回归头,利用姿态作为轻量级监督信号,显著提升了空间推理能力,并在多个视频问答基准上实现了SOTA表现。
Comments Project Page: https://cambrian-mllm.github.io/
SkyVLaM:用于遥感中无人机视频理解的多模态大语言模型
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Peking University(北京大学) ; Beijing Wuzi University(北京物资学院)
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 针对无人机视频理解任务,提出多模态大语言模型SkyVLaM,通过时间基感知器构建稀疏令牌,正则化稀疏基,自适应选择密集段,联合大语言模型处理,还构建SkyVid,实验证明其能有效分配视觉令牌预算,提升语言条件视频分割效果。
Comments Accepted by WAICA 2026
VideoSEMA:用于视频理解的一种可扩展且高效的类曼巴注意力机制
机构 * University of California, Irvine(加利福尼亚大学欧文分校) ; Qualcomm AI Research(高通人工智能研究中心) ; Qualcomm Technologies, Inc.(高通技术公司)
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 研究针对视频理解提出VideoSEMA模型,核心方法是采用时空注意力分割,包含空间类曼巴注意力模块和时间注意力。主要贡献是在多数据集上表现优异,参数规模相当时准确率领先,分辨率提升时退化更平缓,扩展到长视频也有前景。
Comments 15 pages, 3 figures
FOLIO:用于流视频理解的聚焦语义记忆
机构 * University of Southern California (USC)(南加州大学) ; Intel Labs(英特尔实验室) ; DEVCOM Army Research Office(陆军研究办公室)
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 研究在线流视频理解中如何保留信息及组织历史记录的挑战,提出FOLIO聚焦语义记忆系统,通过动态聚焦状态更新记忆,结合短期视觉缓冲区与长期语义记忆,实现轻量级混合检索,提升性能并降低流记忆维护成本。
Comments 28 pages, 5 figures
TreeSoc:用于足球视频理解的树状结构动态推理与工具协同
机构 * University of Science, VNU-HCM(胡志明市越南国立大学科学大学)
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 针对当代视觉语言模型理解足球视频的挑战,提出TreeSoc框架,通过动态深度优先搜索机制分解查询,支持自适应工具路由,在多个数据集上取得优异成绩,证明其为视频理解的有效范式。
Comments Accepted to ICMV 2026
以自我为中心的视频-语言模型是否捕捉了以手和物体为中心的线索?
机构 * The University of Tokyo(东京大学) ; University of Twente(特温特大学) ; University of Bristol(布里斯托大学)
专题命中 视频理解 :video-language(title,abstract);分类 cs.CV
AI总结 研究手部-物体交互识别中现有视频-语言模型的局限,提出结合手部-物体掩码训练与HOI-动态感知解码器的新范式,构建DEHOI测试平台评估,证明该方法更有效利用相关信息,在多方面优于现有模型,提升HOI理解。
video-SALMONN-R$^3$: 学习重看、重问和重答以实现高效视频理解
机构 * Tsinghua University(清华大学) ; ByteDance(字节跳动) ; University of Cambridge(剑桥大学)
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 提出video-SALMONN-R$^3$,首个通过强化学习实现重看机制的视频大语言模型,无需链式思维冷启动,采用重答和重问策略提升视频问答效率与准确性。
Light-Omni:基于长期记忆的智能视频理解中的反射优于推理
机构 * Nanjing University(南京大学)
专题命中 视频理解 :video understanding(title,abstract);分类 cs.CV
AI总结 研究针对智能视频理解中先进智能体依赖迭代推理成本高的问题,提出Light-Omni框架,通过双重上下文状态实现反射式轻量级视频理解,经实验验证其有效性,性能优于M3-Agent且能增强现有MLLMs。
Comments Project Page: https://clare-nie.github.io/Light-Omni