Seeing What You're Told: Sentence-Guided Activity Recognition In Video
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments To appear in CVPR 2014
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments To appear in CVPR 2014
无交互行动:通过接触-释放检测探测视频LMMs的物理基础
机构 * Weizmann Institute of Science(魏茨曼科学研究所) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI;multimodal(journal_ref)
AI总结 研究探讨了视频LMMs在实际视觉输入中语义理解的深度,通过接触-释放检测发现模型在物理基础方面的不足。
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026 workshop on Cognitive Foundations for Multimodal Models (CogVL)
TTSD-FAR:用于大视频语言模型中缺失模态情感识别的带Fisher锚定恢复的测试时自蒸馏
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 针对大视频语言模型测试时的模态缺失问题,提出带Fisher锚定恢复的测试时自蒸馏框架,在多数据集模态缺失场景下性能优于基线方法且保持稳定。
AVA-Encoder:面向智能体原生的视频表示学习
机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问业务部) ; ShanghaiTech University(上海科技大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; Institute of Computing Technology(中国科学院计算技术研究所) ; Southeast University(东南大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 针对创意智能体缺乏从高质量电影学习的有效方式的问题,提出AVA-Encoder框架,其视频表示经重构优化后,在相关基准上性能优于现有方法,还发布了配套框架、基准及数据集。
VideoGAIA:面向通用人工智能助手的智能体视频理解基准
机构 * The Chinese University of Hong Kong(香港中文大学) ; Ant Group(蚂蚁集团) ; Tsinghua University(清华大学) ; Tongji University(同济大学) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 VideoGAIA是面向通用AI助手的智能体视频理解基准,构建多轮工具增强交互任务,现有MLLMs在其上准确率不足60%,可评估下一代模型并推动相关转型。
追踪真相:面向视频大语言模型的物体感知时空监控
机构 * National University of Singapore(新加坡国立大学) ; VinUniversity(文大学) ; Nanyang Technological University(南洋理工大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出STEMO-Bench基准测试,通过分解查询验证时空监控能力,改进视频大语言模型的时空推理一致性。
Comments The authors are withdrawing this manuscript due to errors identified in the experimental evaluation and result aggregation, which affect several reported quantitative results and some conclusions. These issues require substantial re-evaluation of the experiments and analysis
层次间推理:通过层选择性融合恢复视频-语言模型中的时间推理
机构 * National University of Singapore(新加坡国立大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 本文提出MERIT框架,通过层选择性融合提升视频-语言模型的时间推理能力,同时保持时间感知能力,优于全模型融合和随机层选择。
EgoMonth:面向长期时空记忆的月级自我中心视频基准
机构 * Nanjing University(南京大学) ; Huawei Technologies Co., Ltd.(华为技术有限公司) ; Tianjin University(天津大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 研究人员推出首个月级自我中心视频基准EgoMonth,评估发现当前主流MLLMs的长期时空记忆能力远逊于人类,仅为有损总结器而非忠实记忆器。
Comments 21 pages, 4 figures, 6 tables, including appendices
扫视、审视与思考:将视频异常检测从无训练推进到智能体推理
机构 * Beijing Jiaotong University(北京交通大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对视频异常检测的“何时-何事”脱节问题,提出无训练框架GtS及工具增强型智能体方法,扩展基准并引入联合评估指标,实现了更高的异常检测准确性与推理速度。
Comments 34 pages, 8 figures, 8 tables. Journal extension of our AAAI 2026 paper (arXiv:2507.21507)
StreamFlow:用于流视频理解的动态内存流
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 StreamFlow是一种动态视觉内存框架,通过中期内存过滤冗余、长期内存整合潜变量及注意力检索,在流视频理解任务中实现最优性能,同时提升视觉依据性并降低延迟与内存。
基于几何知识蒸馏的时序锚定组合式相机运动理解
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Tencent(腾讯)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本研究提出CamDistill方法,通过几何知识蒸馏实现时序锚定的组合式相机运动理解,推出含4229个片段的CamChoreo基准,提升了相机运动识别的细粒度与效率。
顺序很重要:LVLMs作为图像序列时间推理的评判者
机构 * University of Bologna(博洛尼亚大学) ; NOVA School of Science and Technology(NOVA科技学院) ; NOVA Laboratory for Computer Science and Informatics(NOVA计算机科学与信息实验室)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 本研究发现大视觉语言模型(LVLMs)作为多模态评判者存在时间顺序判别缺陷,受首因、近因等结构性偏差影响,呼吁构建时间感知的视觉序列评估范式。
Comments 34 pages, camera-ready
REVEAL:用于长视频问答的基于 rubric(评分标准)的显式证据充分性验证智能体
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对长视频问答中现有方法割裂事件、忽略证据充分性的问题,提出REVEAL框架,通过自适应分块的结构化记忆与rubric引导的证据验证,实现更可靠的推理且性能优于现有SOTA方法。
你的视觉语言模型(VLM)已经知道时间:通过提问“是/否”实现无需训练的时间定位
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM
AI总结 针对VLM时间定位任务的自信错误问题,提出无需训练的FV-Action方法,通过从粗到细的二元问题扫描替代时间戳回归,在多个基准数据集上大幅提升了时间定位性能。
EgoBrain:协同心智与视觉以实现人类行为理解
机构 * The University of Tokyo(东京大学) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 研究人员构建了全球首个同步脑电与第一人称视觉的大规模多模态数据集EgoBrain,开发多模态学习框架实现行为理解,跨参与者与环境验证达66.70%准确率,为脑机接口研究提供新范式。
Comments Accepted to ICLR 2026. Camera-ready version. Project page: https://lin-nie.github.io/EgoBrain/
TransSLR:用于手语识别的轻量级Transformer
机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 针对CASL手语识别的低准确率问题,提出轻量级Transformer模型TransSLR,在CASL-W60基准上取得80.39%的最新准确率,且计算开销低,适用于资源受限环境。
Comments This paper has been accepted for oral presentation at Deep Learning Indaba 2026 which will be hosted on the IJCAI hosting platform. paper link: https://chairingtool.com/conferences/dli2026/main-track/submissions/356
UniVVT:用于高保真视频虚拟试穿的统一端到端框架
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 UniVVT是一种统一端到端视频虚拟试穿框架,以多模态大语言模型为核心,采用三阶段渐进训练策略,在多基准上实现了优于主流方法的高保真试穿效果。
Comments 17 pages,21 figures
MAC 2026:推动微动作分析迈向细粒度理解
机构 * United Arab Emirates University(阿联酋大学) ; Hefei University of Technology(合肥工业大学) ; University College London(伦敦大学学院) ; Zhejiang University(浙江大学) ; University of Oulu(奥卢大学) ; CMVS, University of Oulu(奥卢大学计算机视觉与媒体研究中心)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM
AI总结 本文介绍第三届MAC 2026,以从识别到细粒度微动作理解为主题,扩大挑战范围,引入新任务并借助多模态大语言模型评估,总结了相关数据集、设置、结果等,还探讨了微动作分析未来方向及在视频理解中的作用。
Comments Challenge Summary Paper of the 3rd Micro-Action Analysis Grand Challenge (MAC 2026) at ACM Multimedia 2026
2026年EgoVis首届EgoCross挑战赛:跨域自我中心视频问答
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文介绍2026年EgoVis研讨会举办的首届EgoCross跨域自我中心视频问答挑战赛,含两个赛道,共获1500余份提交,公布结果与获胜方案,资源公开以推进相关研究。
Comments 1st EgoCross challenge @ EgoVis workshop, CVPR26
预测再检索:从视频前缀中进行跨实例未来状态检索
机构 * Centre for AI Research, VinUniversity(VinUniversity人工智能研究中心) ; National University of Singapore(新加坡国立大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL
AI总结 该研究提出PSR任务,构建含多数据集的基准,提出LFTR模型,发现预测而非感知是核心挑战,LFTR缩小差距且成本低,相关资源已公开。
Comments Work in progress
推理前的感知:面向视频理解与问答的动态隐式推理
机构 * Rice University(莱斯大学) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对视频问答现有方法依赖长文本思维链的问题,提出DyLaR模型,通过动态调整感知与推理隐式变量的使用,在9个视频基准上提升准确率且缩短响应长度。
通过双阶段蒸馏实现无约束事件-图像特征匹配的无标签目标域适应
机构 * Zhejiang University(浙江大学) ; Hunan University(湖南大学) ; National University of Defense Technology(国防科技大学) ; Ant Group(蚂蚁集团)
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.MM
AI总结 研究针对无约束事件-图像特征匹配问题,提出双阶段训练范式,先进行无标签蒸馏预训练,再引入极线引导自蒸馏框架,在新的跨模态评估基准上实验,取得领先的姿态估计性能。
Comments Accepted to ACM MM 2026. The source code and benchmark will be made publicly available at https://github.com/ZhonghuaYi/nexus2-official
AdaThinkV:面向令牌高效视频推理的自适应思维
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本研究提出AdaThinkV自适应视频推理框架,通过ThinkGain与VRPO解决CoT推理的令牌浪费问题,在视频推理任务中以更少令牌实现优于最强自适应基线的准确率。
神经网络中的隐状态:从模型权重中恢复漂移数据的时间结构
机构 * Princeton University(普林斯顿大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI
AI总结 该研究通过对连续时间窗口分类器的对齐权重轨迹拟合HMM,从模型权重中恢复离散状态,在Fakeddit和Yelp数据集上验证了状态内迁移优势,且该优势与数据分布外的迁移结构相关。
跨文本、表格和知识图谱检测知识不一致性
机构 * EURECOM(欧洲电信学院)
专题命中 视频多模态 :cross-modal(abstract);分类 cs.CL、cs.AI
AI总结 研究跨文本、表格和知识图谱的知识不一致性检测问题,提出\textsc{Kontrast}框架,通过文本到SPARQL和语言模型推理比较并分类不一致性,实验表明跨模态不一致性常见且有价值,为知识审计提供工具并建立基准。
I2VShield:一种针对基于DiT的图像到视频模型的高效主动防御框架
机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 针对I2V模型被滥用问题,提出I2VShield主动防御框架。其包含文本自适应扰动生成框架和非目标多模态注意力干扰攻击两部分。该方法在多数据集和模型上保护性能优,能破坏时空连贯性且降低计算成本。
利用记忆进行推理:一种用于免训练长视频理解的时间粒度自适应框架
机构 * National University of Singapore(新加坡国立大学) ; Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(高性能计算研究所,科学、技术与研究机构(A*STAR)) ; Nanyang Technological University(南洋理工大学) ; University of Science and Technology of China(中国科学技术大学) ; Jilin University(吉林大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 研究针对多模态大语言模型长视频理解受限问题,提出ReMem框架,通过双级记忆增强自适应,在查询和视频级别分别处理,能适应不同时间粒度,经实验验证在多个基准测试中实现高效零样本性能,提升模型长视频推理能力。
Comments Accepted by ECCV 2026
视觉瓶颈:用于联合时空视频定位的多模态大语言模型的稀疏帧适配
机构 * University of Zurich(苏黎世大学)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 研究针对多模态大语言模型在视频定位中训练与部署条件不匹配问题,通过实验表明视觉特征提取是稀疏帧输入瓶颈,提出适配特定层及边界感知采样策略,证明训练策略对稀疏帧视频定位比模型规模更关键。
Comments 15 pages, 5 figures
MarineEVT:通过视觉工具推理推进以事件为中心的海洋视频理解
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校) ; University of Electronic Science and Technology of China(电子科技大学)
专题命中 视频多模态 :image-text(abstract);分类 cs.CV、cs.AI
AI总结 针对海洋视频理解面临的挑战,构建MarineEVT数据集,将其理解分解为EVT-R1过程,利用视觉工具驱动模型。实验显示EVT-R1优于多个SOTA VLMs,为海洋相关发展奠定基础并推动VLMs进步。
Comments Accepted to The 19th European Conference on Computer Vision (ECCV) 2026
ReViV:从单目自我中心视频中重建4D中的观看者和视图
机构 * ETH Zurich(苏黎世联邦理工学院) ; Delft University of Technology(代尔夫特理工大学) ; Microsoft(微软)
专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 研究旨在从单目自我中心视频重建4D中的观看者和视图,提出ReViV框架,将任务建模为学习多模态信号联合概率分布,由掩码生成自我中心变压器驱动,在多基准测试中展现出高精度和效率,还保持了竞争力强的自我中心深度估计,且代码模型开源。
Comments Accepted to ECCV 2026. The first two authors contributed equally, and their author order is interchangeable