StreamFlow: Dynamic Memory Flows for Streaming Video Understanding
StreamFlow:用于流视频理解的动态内存流
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
AI总结 StreamFlow是一种动态视觉内存框架,通过中期内存过滤冗余、长期内存整合潜变量及注意力检索,在流视频理解任务中实现最优性能,同时提升视觉依据性并降低延迟与内存。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
StreamFlow:用于流视频理解的动态内存流
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
AI总结 StreamFlow是一种动态视觉内存框架,通过中期内存过滤冗余、长期内存整合潜变量及注意力检索,在流视频理解任务中实现最优性能,同时提升视觉依据性并降低延迟与内存。
GESTO:面向动态场景推理的以人为中心的时空记忆
机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) ; University of Stuttgart(斯图加特大学) ; Max Planck Research School for Intelligent Systems(马克斯·普朗克智能系统研究所) ; Google Research(谷歌研究院) ; TU Munich(慕尼黑工业大学)
专题命中 视觉推理 :grounding(abstract);分类 cs.CV
AI总结 该研究提出GESTO时空记忆模型,结合4D场景图与人机交互、目标事件的两级结构,在基准测试中表现优异,可支撑动态人类环境下的以活动为中心的时空推理。
从检测到理解:用于多任务交通异常推理的TAR与TAR-Bench
机构 * NVIDIA(英伟达) ; Santa Clara University(圣克拉拉大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
AI总结 该研究提出TAR与TAR-Bench数据集,用于训练评估超越异常检测的视频-语言模型,经实验验证其多任务微调可提升模型推理能力,且为2026年AI城市挑战赛第3赛道提供官方数据。
FactorDrive:面向端到端自动驾驶的、由规划关键因素驱动的自适应多步推理
机构 * Southeast University(东南大学) ; Universiti Malay(马来亚大学) ; Ant Group(蚂蚁集团) ; Tsinghua University(清华大学) ; Peking University(北京大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
AI总结 该研究针对现有端到端自动驾驶方法在空间物理证据融合、推理适应及推理路径优化上的不足,提出FactorDrive框架,通过PCF-CoT数据集与QS-GRPO算法优化推理,在两类基准上取得最优规划性能。
优势引导门:重塑基于视觉的空间智能的开放式推理
机构 * University of Science and Technology of China(中国科学技术大学) ; Suzhou Institute for Advanced Research, USTC(中国科学技术大学苏州高等研究院) ; Institute of Advanced Intelligence and Computing (IAIC), Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局高级智能与计算研究所) ; East China Normal University(华东师范大学) ; National University of Singapore(新加坡国立大学) ; Durham University(杜伦大学) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
AI总结 本文针对MLLMs开放式推理易出错的问题,提出优势引导门框架,结合蒙特卡洛价值评估与两类优势门,构建Reasoning-Tree-160k数据集并经两阶段学习,有效提升了基准MLLMs的视觉空间推理性能。
SCOUT:面向超长时长自我中心视频推理的自检查与恢复感知工具思维智能体
机构 * Sun Yat-sen University(中山大学) ; Shenzhen Loop Area Institute(深圳河套学院) ; Guangdong OPPO Mobile Telecommunications Corp., Ltd.(广东欧珀移动通信有限公司) ; OPPO AI Center(OPPO人工智能中心) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 视觉推理 :grounding(abstract);分类 cs.AI
AI总结 本研究提出SCOUT智能体框架,结合自适应策略与UPS-GRPO方法,解决超长自我中心视频推理的错误传播及信用分配问题,在对应基准上达最优性能且短时长场景仍具竞争力。
Comments Accepted by ACM Multimedia 2026 (MM '26)
面向工具增强空间推理的自演化神经符号技能
专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI
AI总结 该研究针对视觉-语言模型在细粒度空间任务上的不可靠问题,提出神经符号框架NeSy-Spatial,通过自演化空间技能提升工具利用精度与空间推理准确率。
Comments 25 pages, 9 figures, 10 tables; includes supplementary material
CliniCARE-Bench:电子健康记录中医疗推理的临床校准审计
机构 * Scale AI ; Emory University(埃默里大学) ; University of California, Santa Cruz(加州大学圣克鲁兹分校) ; Vanderbilt University Medical Center(范德堡大学医学中心) ; Stanford School of Medicine(斯坦福医学院) ; Stanford Health Care(斯坦福医疗保健系统) ; Clinical Excellence Research Center(临床卓越研究中心)
专题命中 视觉推理 :grounding(abstract);分类 cs.AI
AI总结 本研究推出首个面向部署的临床智能体基准CliniCARE-Bench,评估智能体对真实纵向电子健康记录的医疗推理,发现原始准确率夸大调查质量,无缺陷准确率更低且会重新排序排行榜。
科学边缘评估:SEE——迈向真实科学发现的缺失环节
机构 * Alibaba Group(阿里巴巴集团) ; University of Chinese Academy of Sciences(中国科学院大学) ; Tsinghua University(清华大学) ; University of Alberta(阿尔伯塔大学) ; Zhejiang University(浙江大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI
AI总结 该研究构建多模态基准SEE评估19个MLLMs,发现其仅达48.7%准确率,通用模型优于专用模型,工具使用可提至52.7%但仍难实现科学发现所需的证据约束推断,需从解释转向推导。
从失败中学习:基于难负例的以检索为中心的思维链用于统一多模态检索
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
AI总结 该研究提出UniME-R1框架,通过基于难负例的以检索为中心的思维链(RC-CoT)学习从检索失败中优化,在多模态检索基准上提升了性能。
Comments 26 pages,10 figures,14 Tables
OmniMech:面向3D重建的全合一多模态机械基准
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
AI总结 研究人员提出OmniMech——首个百万级多模态机械基准,针对工业制造数据的可执行CAD生成任务,含四类任务,实验发现现有模型在相关任务中存在不足,将发布资源支持后续研究。
C³PO:评估全模态模型中的跨模态组合与反事实性能
机构 * Microsoft Research India(微软研究院印度分院) ; IIIT Hyderabad(印度国际信息技术研究院(海得拉巴))
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI
AI总结 本研究推出C³PO基准数据集,评估全模态模型的跨模态组合与反事实性能,发现模型存在模态主导问题,需改进架构以支持持续跨模态注意力。
OmniEdit-Bench:基于指令的视频编辑综合基准
机构 * The University of Hong Kong(香港大学) ; Alibaba Group(阿里巴巴集团) ; Zhejiang University(浙江大学) ; Peking University(北京大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
AI总结 针对现有基于指令的视频编辑基准的任务覆盖有限、指标不足的问题,OmniEdit-Bench将编辑任务分解为多维度并提出含惩罚机制的评估框架,实验显示当前IVE模型仍待提升。
TriCLE:面向边缘部署的细粒度聚类的三模态视觉-语言推理
机构 * Clark Atlanta University(克拉克亚特兰大大学) ; United International University(国际大学) ; North South University(北南大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
AI总结 TriCLE是面向边缘部署的三模态视觉-语言系统,通过生成伪热视图和伪激光雷达深度,结合对齐策略实现细粒度飞机聚类,适配8GB内存边缘设备,验证与测试均取得良好性能。
面向跨站点可解释皮肤病图像诊断的开放语言概念统一学习
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
AI总结 针对现有概念模型跨站点泛化差、适配FVLMs成本高的问题,提出开放语言概念统一学习框架UniCon,通过共享语义空间等三项创新实现多模态可解释皮肤病诊断,获顶级准确率且具备跨站点干预能力。
Comments accepted by ACM Multimedia 2026
面向多讲座教育推理的证据 grounded 多模态知识图谱构建
专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI
AI总结 该研究针对讲座视频知识保留不全问题,提出基于证据的多模态知识图谱构建流程,在神经网络讲座实验中取得高覆盖率与检索准确率,贡献可审计的知识图谱构建方法。
StyleForge:基于超图场中反事实推理的室内家具风格生成
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
AI总结 StyleForge是基于动态超图风格场的室内家具风格生成框架,通过反事实风格偏好学习解决固定布局家具的风格冲突,在3D-FRONT数据集上实现了优于基线的家具检索和场景风格一致性。
Remember-R1:通过强化学习缓解长上下文视觉遗忘
机构 * Northwestern Polytechnical University(西北工业大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Zhejiang University(浙江大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
AI总结 该研究针对多模态大语言模型的长上下文视觉遗忘问题,提出强化学习框架Remember-R1,通过过程级监督优化视觉依赖与注意力,提升了多模态推理性能。
Comments Accepted by ACM Multimedia 2026
MemeBench:大型视觉语言模型在解读依赖文化的梗图时所缺失的内容
专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI
AI总结 研究针对LVLMs解读文化类梗图的知识缺口问题,推出诊断基准MemeBench及实体引导检索基线KAR,验证了检索手段可提升梗图解读的VIKR成功率。
Comments 17 pages, 5 figures, and 13 tables
大型视觉语言模型(LVLMs)能否揭示视觉错觉背后的真相?感知与推理能力分析
机构 * Adelaide University(阿德莱德大学) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Tsinghua University(清华大学) ; Amap, Alibaba Group(阿里巴巴集团高德地图) ; Beihang University(北京航空航天大学)
专题命中 视觉推理 :vision language model(abstract);分类 cs.AI
AI总结 本文利用IllusionReasoning基准,以视觉错觉为诊断工具评估LVLMs,发现多款LVLMs的推理能力不及宣称水平,为其优化提供了新方向。
MultivationBench:多模态序列动机推理基准
机构 * The Hong Kong University of Science and Technology(香港科技大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI
AI总结 本文提出MultivationBench基准,基于心理学框架评估多模态序列动机推理,发现现有模型难以在序列语境中保持一致的动机推理,暴露了静态识别与动态推理的差距。
Comments 31 pages, including appendices; 6 figures and 22 tables. Code: https://github.com/HKUST-KnowComp/MultivationBench
评估具有挑战性的真实世界临床病例中的多轮多模态诊断推理
机构 * Center for Biomedical Data Science, Duke-NUS Medical School(生物医学数据科学中心,杜克 - 新加坡国立大学医学院) ; Duke-NUS AI + Medical Sciences Initiative, Duke-NUS Medical School(杜克 - 新加坡国立大学人工智能与医学科学计划,杜克 - 新加坡国立大学医学院) ; Department of Population Health Sciences, Weill Cornell Medicine(人口健康科学系,威尔康奈尔医学院) ; System Engineering, College of Engineering, Cornell University(系统工程,康奈尔大学工程学院) ; Graduate School of Frontier Sciences, The University of Tokyo(前沿科学研究生院,东京大学) ; RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心) ; Department of Biostatistics and Bioinformatics, Duke University(生物统计学与生物信息学系,杜克大学) ; Perelman School of Medicine, University of Pennsylvania(佩雷尔曼医学院,宾夕法尼亚大学) ; School of Clinical Medicine, University of Cambridge(临床医学学院,剑桥大学) ; Hospital of the University of Pennsylvania(宾夕法尼亚大学医院) ; Children’s Hospital of Philadelphia (CHOP)(费城儿童医院) ; Department of Anatomic Pathology and Laboratory Medicine, Hospital of the University of Pennsylvania(解剖病理学与检验医学系,宾夕法尼亚大学医院) ; Department of Pathology and Laboratory Medicine, University of California, San Francisco(病理学与检验医学系,加州大学旧金山分校) ; Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI
AI总结 研究针对现有多模态大语言模型评估难以捕捉现实临床诊断复杂性的问题,开发ClinMM-Bench基准,用两级框架评估15个模型,发现专有模型诊断准确性最高,但各模型完全正确诊断比例有限,当前模型诊断推理有局限并明确了失败模式。
通过证据感知多智能体推理实现忠实的情感图像字幕生成
专题命中 视觉推理 :grounding(abstract);分类 cs.CV
AI总结 研究情感图像字幕生成中平衡情感表达与视觉保真度的问题,提出SEA-Cap系统,通过情感证据挖掘器提取线索,利用多智能体协作工作流程,依视觉证据审核完善字幕,有效减轻幻觉并达最优性能。
ProcAgent:一种用于边缘端人机协作的过程性任务指导的智能体框架
机构 * University of Tennessee Knoxville(田纳西大学诺克斯维尔分校) ; Worcester Polytechnic Institute(伍斯特理工学院)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI
AI总结 研究针对家具组装等过程性任务,提出ProcAgent框架,利用提议与验证架构,结合多种技术,在边缘设备上实现实时自适应指导,经多维度评估及用户研究,证明能在不牺牲可用性的情况下于边缘硬件达成自适应过程性辅助。
StanceFlip:用于多模态对话立场翻转预测的综合多维基准测试
机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件学院) ; Harbin Institute of Technology Shenzhen(哈尔滨工业大学(深圳)) ; City University of Macau(澳门城市大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI
AI总结 研究针对现有对话立场检测基准测试的局限,提出StanceFlip基准测试及ConStaFF框架,含多模态立场六元组提取和动态立场翻转归因两个新子任务,基于大语言模型实现端到端立场推理,实验显示该方法性能领先。
Comments 17pages, 8 figures
凝视到文本生成:超越人类注意力的分类解码
机构 * Stony Brook University(纽约州立大学石溪分校) ; Australian Institute for Machine Learning(澳大利亚机器学习研究所) ; Adelaide University(阿德莱德大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
AI总结 该研究提出将凝视解码为自然语言描述人类目标的新问题,构建Gazette框架,基于多模态大语言模型,利用新颖策略合成出声思考转录本并指令调优,使其在多任务凝视解码中达最优性能,能推断多样场景下人类目标意图。
Comments To appear in European Conference on Computer Vision (ECCV) 2026
用于多模态推理的离线-在线课程强化学习
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; BUPT Shenzhen Institute(北京邮电大学深圳研究院) ; Carnegie Mellon University(卡内基梅隆大学) ; Lancaster University(兰卡斯特大学) ; Nanyang Technological University(南洋理工大学) ; China Telecom Corporation Limited Sichuan Branch(中国电信股份有限公司四川分公司) ; Changsha University of Science & Technology(长沙理工大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI
AI总结 研究多模态推理中模型中间步骤有缺陷的问题,提出$O^2$-CritiCuRL框架,通过离线多步展开分析和在线渐进式强化学习策略,区分关键与冗余步骤,提升模型性能及训练和推理效率。
合理地运用波普尔方法:用归纳逻辑编程修补上下文推理
机构 * Vanderbilt University(范德堡大学)
专题命中 视觉推理 :grounding(abstract);分类 cs.AI
AI总结 研究针对思维链提示中间步骤逻辑不合理问题,提出Reason Popper-ly框架,用归纳逻辑编程学习规则作在线验证器校正步骤,在CLUTRR基准测试中提升了模型准确率,还产生细粒度错误分类法,优于完全外部符号管道。
Comments Accepted at the 20th Conference on Neurosymbolic Learning and Reasoning
面向儿童的AIGC视频风险审查:一个基准和知识支持的迭代推理框架
机构 * Shandong University(山东大学) ; Fudan University(复旦大学) ; Beijing Jiaotong University(北京交通大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
AI总结 研究面向儿童的AIGC视频审查问题,构建CAVSR基准和分层风险分类法,提出结合多智能体协作与知识经验的QVRS-E框架,实验证明该方法能增强儿童相关风险审查,产生更可靠报告。
通过内部信息分解保护多模态人工智能
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI
AI总结 研究多模态大语言模型的攻击问题,提出FlowGuard框架,通过监测内部多模态一致性检测有害输入,受部分信息分解启发得出FlowVectors量化相关指标,有效降低攻击成功率且减少效用损失和延迟,为多模态推理提供有效防御。
Comments Accepted as Spotlight Paper at ICML 2026