AdaThinkV: Adaptive Thinking for Token-Efficient Video Reasoning
AdaThinkV:面向令牌高效视频推理的自适应思维
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本研究提出AdaThinkV自适应视频推理框架,通过ThinkGain与VRPO解决CoT推理的令牌浪费问题,在视频推理任务中以更少令牌实现优于最强自适应基线的准确率。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
AdaThinkV:面向令牌高效视频推理的自适应思维
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本研究提出AdaThinkV自适应视频推理框架,通过ThinkGain与VRPO解决CoT推理的令牌浪费问题,在视频推理任务中以更少令牌实现优于最强自适应基线的准确率。
DeepVoyager-VL:为长视野多模态智能体激励视觉在环搜索
机构 * PKU(北京大学) ; HKUST(GZ)(香港科技大学(广州)) ; NUDT(中国人民解放军国防科技大学) ; OUC(中国海洋大学) ; HITSZ(哈尔滨工业大学(深圳)) ; Huawei Cloud BU(华为云业务部)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 针对现有多模态深度搜索忽视视觉中间推理作用的局限,提出DeepVoyager-VL框架,构建多模态事件图合成数据,设计智能体框架实现主动视觉获取,经10个基准实验验证其有效性。
Pro²Assist:面向长程流程任务的、基于多模态自我中心感知的步骤感知主动式辅助系统
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI
AI总结 本研究提出Pro²Assist,一种基于多模态自我中心感知的步骤感知主动式辅助系统,通过AR眼镜感知与持续推理提升长程流程任务辅助效果,在动作理解与主动时机准确率上优于基线,获多数用户认可。
Comments To appear in IMWUT'26
StyleForge:基于超图场中反事实推理的室内家具风格生成
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
AI总结 StyleForge是基于动态超图风格场的室内家具风格生成框架,通过反事实风格偏好学习解决固定布局家具的风格冲突,在3D-FRONT数据集上实现了优于基线的家具检索和场景风格一致性。
Remember-R1:通过强化学习缓解长上下文视觉遗忘
机构 * Northwestern Polytechnical University(西北工业大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Zhejiang University(浙江大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
AI总结 该研究针对多模态大语言模型的长上下文视觉遗忘问题,提出强化学习框架Remember-R1,通过过程级监督优化视觉依赖与注意力,提升了多模态推理性能。
Comments Accepted by ACM Multimedia 2026
CoLT: 教会多模态模型通过潜在思维链进行思考
机构 * Nanyang Technological University(南洋理工大学) ; Shanghai Jiao Tong University(上海交通大学) ; NKIARI ; AAIS & VCIP, Nankai University(南开大学AAIS & VCIP) ; Tianjin University(天津大学)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV
AI总结 提出CoLT框架,用潜在思维链代替文本推理,通过前向和后向解码器监督及内部监督实现高效多模态推理,在8个基准上优于现有方法,推理时间减少10.1倍。
Comments Accepted by ECCV2026. Code is available at https://github.com/hulianyuyy/CoLT
C-MIG:基于多视角信息增益的检索增强生成用于临床诊断推理
机构 * Baidu Inc(百度公司)
专题命中 视觉推理 :grounding(abstract);分类 cs.AI
AI总结 提出C-MIG框架,通过多视角信息增益和多重子查询检索增强策略,解决检索增强生成中奖励信号丢失和异构推理监督问题,在临床诊断任务上取得最优性能。
TS-Reasoner:将时间序列基础模型与大语言模型推理能力对齐
机构 * University of Maryland, College Park(马里兰大学学院公园分校)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI
AI总结 TS-Reasoner通过两阶段训练将时间序列基础模型与大语言模型对齐,在多个基准上性能优于同类模型且数据效率更高,解决了时间序列模型推理能力不足的问题。
Comments Accepted to Transactions on Machine Learning Research, 2026
CrossLex:面向大语言模型跨司法辖区法律推理的、基于法律来源的基准测试集
专题命中 视觉推理 :grounding(abstract)
AI总结 本文提出基于中、加州、德三国法律来源的CrossLex基准测试集,定义三项任务并提出联合评估指标,发现大语言模型在跨司法辖区法律推理上存在不足,旨在推动相关研究。
STAR-VLM:基于汽车雷达监督的时空视觉语言模型,用于运动与速度估计
机构 * University of Michigan(密歇根大学)
专题命中 视觉定位与Grounding :VLM(title,title_cn);vision-language model(title,abstract);grounding(title);分类 cs.CV
AI总结 该研究提出STAR-VLM框架,利用汽车雷达监督提升时空视觉语言模型的运动推理与度量速度估计能力,在驾驶场景相关任务上实现了优于特定任务方法的最先进性能。
GuideGround:用于3D视觉定位的VLM引导语义理解与视点感知推理
专题命中 视觉定位与Grounding :VLM(title,title_cn);grounding(title,abstract);vision-language model(abstract);分类 cs.CV
AI总结 GuideGround是一种VLM引导的3D视觉定位框架,用VLM生成的语义描述替代闭集分类、逐视图保留假设并经VLM验证,在ReferIt3D基准上性能优于现有SOTA。
Comments 18 pages, 5 figures
一个补丁就够:面向基于多模态大语言模型(MLLM)的场景文本定位的强化优化视觉标记接地
机构 * South China University of Technology(华南理工大学) ; HiThink Research(海思思考研究院)
专题命中 视觉定位与Grounding :MLLM(title,title_cn);grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 针对现有多补丁场景文本定位范式的冗余噪声与定位歧义问题,提出以视觉为中心的单补丁文本定位框架 SPaTS,通过强化学习优化的单补丁选择等技术实现性能提升,显著优于前沿相关模型。
Comments 15 pages, 11 figures. Accepted to ACM Multimedia 2026
Journal ref Proceedings of the 34th ACM International Conference on Multimedia (MM '26), 2026
面向高效自我中心 grounding 的动态分辨率路由
机构 * National University of Singapore(新加坡国立大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; Nanyang Technological University(南洋理工大学)
专题命中 视觉定位与Grounding :grounding(title,title_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 该研究针对自我中心视觉 grounding 中视觉 token 处理成本过高的问题,提出 SmartRes 框架,通过动态分辨率路由减少视觉 token,在 Ego4D 等数据集上实现 token 缩减与性能提升,代码将公开。
图像推理中的测试时感知扩展:解决图像推理中的 grounding 困境
机构 * Tsinghua University(清华大学) ; Beijing University of Technology(北京工业大学)
专题命中 视觉定位与Grounding :grounding(title,title_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出 TTSP 框架,通过测试时扩展感知解决图像推理中的 grounding 困境,通过生成多个感知轨迹并过滤不可靠轨迹来提升细粒度视觉推理能力。
看见不可见:基于知识增强视觉语言模型的无训练风机叶片检测方法
专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision language model(title);vision-language model(abstract,abstract_cn);分类 cs.CV
AI总结 该研究提出结合RAG与VLM的零样本风机叶片检测框架,构建多模态知识库,在小样本测试中表现优于基线,为工业检测提供数据高效方案。
多模态大语言模型生成图像检测的基准数据集:GPT Image2与Nano Banana2
机构 * College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) ; College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) ; School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)
专题命中 视觉定位与Grounding :MLLM(title,summary_cn);multimodal large language model(abstract);分类 cs.CV
AI总结 本文构建了含三种生成协议的MLLM生成图像检测基准数据集,评估现有检测器性能并提出SAP-DSP基线框架,验证了其检测稳定性。
基于专用分割模型实现具身智能视觉语言模型(Agentic VLMs)的细粒度车辆损伤评估
机构 * Northeastern University(东北大学)
专题命中 视觉定位与Grounding :grounding(title,abstract);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 针对VLMs空间定位不可靠问题,本文提出TinyDamage架构,将空间定位委托给专用多任务分割模型,集成至7节点LangGraph智能体流程,在车辆损伤评估中大幅降低报告虚构率。
Comments 8 pages, 2 figures
GeoArbiter:面向遥感多模态大语言模型的可验证性导向 grounding 方法
机构 * University of Minnesota, Twin Cities(明尼苏达大学双城分校)
专题命中 视觉定位与Grounding :grounding(title,title_cn);multimodal large language model(abstract);分类 cs.LG
AI总结 该研究针对遥感多模态大语言模型的事实断言问题,提出无需训练的 GeoArbiter 流程,通过仅注入图像无法验证的地理事实,有效降低了模型的断言级幻觉并提升了对冲突记录的鲁棒性。
用于手语翻译的注意力引导视觉-语言模型
机构 * Rochester Institute of Technology(罗切斯特理工学院) ; University of Virginia(弗吉尼亚大学) ; National Technical Institute for the Deaf(国家聋人技术学院)
专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract,abstract_cn);grounding(abstract);分类 cs.CV
AI总结 针对视觉-语言模型在手语翻译中时空视觉定位差的问题,提出AttnSign框架,通过空间注意力监督和RL运动节奏引导提升性能,在How2Sign和OpenASL基准上表现优于现有方法。
HorusEye:语言作为动态注意力用于应急视觉分析
机构 * Armel Yara
专题命中 视觉定位与Grounding :VLM(summary_cn,abstract_cn);LLaVA(abstract,abstract_cn);grounding(abstract);分类 cs.CV、cs.LG
AI总结 提出HorusEye框架,通过语言反馈动态引导视觉分析,在应急场景下评估多种VLM,发现语言反馈效果依赖模型,并揭示热成像中的裁剪悖论。
Comments 18 pages, 10 figures, 7 tables
面向细粒度遗忘:多模态大语言模型的属性遗忘
专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI
AI总结 针对多模态大语言模型(MLLMs)属性遗忘的细粒度需求,提出轻量级训练无关框架CLRP,通过激活修补定位因果层并应用保留感知投影,实现目标属性遗忘同时保留同一身份信息,在多种MLLMs上验证了有效性。
CoT-Edit:让思维链(CoT)指导指令视频编辑
机构 * University of Science and Technology of China(中国科学技术大学) ; Zhongguancun Academy(中关村学院) ; Tsinghua University(清华大学)
专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出CoT-Edit的plan--guide--edit框架,以CoT增强的MLLM为规划器生成空间先验,结合扩散编辑器实现高保真指令视频编辑,性能优于多个基准方法
手术增强现实中的实时视觉遮挡检测
机构 * Duke University(杜克大学)
专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV
AI总结 针对手术AR虚拟内容遮挡手术器械的问题,提出结合VLM与分割推理的延迟感知流水线,构建伪AR基准,实现87.43%准确率、479 ms延迟,较云端基线降延迟62.90%。
Comments ISMAR 2026 Mecidal Workshop
CrossProjection:建筑图纸中超越视角变化的几何定位
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; University College London(伦敦大学学院)
专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 该研究提出CrossProjection方法评估视觉语言模型在异构建筑视图间的几何定位能力,发现模型在自由几何定位上性能脆弱,仅封闭选择成功不代表具备可靠几何定位能力。
Comments Initial controlled diagnostic study on 23 natural drawing sets and three VLMs; broader model, building, repeated-inference, and human coverage is planned for a subsequent version
ORCESTRA:基于视觉语言模型的混合现实视觉机器人编程系统
机构 * Skolkovo Institute of Science and Technology(斯科尔科沃科技学院) ; R&D Center, MWS(MWS研发中心)
专题命中 视觉定位与Grounding :VLM(title);vision-language model(abstract);grounding(abstract);分类 cs.CV
AI总结 ORCESTRA是一款混合现实系统,通过无代码路径点示教和语言引导控制实现机器人数字孪生编程,支持多种异构机器人,其混合现实验证可作为语言引导机器人物理部署前的安全层。
Comments 4 page, 3 figures, 1 table, ISMAR 2026
OVEarth-Bench:面向开放词汇地球观测的类别广度与查询多样性评估
专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract);分类 cs.CV
AI总结 本文提出OVEarth-Bench基准,从类别广度与查询多样性两方面扩展开放词汇地球观测评估,经实验发现MLLM类方法性能最优,为该领域未来研究提供指导。
无实体的溯因推理?科学假说生成的表征奠基与溯因循环
专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出无需实体的科学溯因推理,构建含弃权机制的溯因循环架构,以惯例空间解决跨领域检索难题,通过案例抽象架构并提出DAB-30基准作为评估方案。
Comments 20 pages, 4 figures. DAB-30 execution reported in companion paper
RadPRISM:用于概念解耦图像表示与视觉定位的模式分层放射学报告监督方法
机构 * Technical University of Munich (TUM)(慕尼黑工业大学(TUM)) ; TUM University Hospital(慕尼黑工业大学医院) ; Technical University of Munich, School of Medicine and Health(慕尼黑工业大学医学与健康学院) ; Klinikum rechts der Isar(右伊萨尔医院) ; Charité – Universitätsmedizin Berlin(柏林夏里特医学院) ; Freie Universität Berlin(柏林自由大学) ; Humboldt Universität zu Berlin(柏林洪堡大学) ; Imperial College London(伦敦帝国理工学院) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML)) ; University Hospital Essen (AöR)(埃森大学医院(AöR)) ; Institute for Artificial Intelligence in Medicine (IKIM)(医学人工智能研究所(IKIM)) ; Institute of Interventional and Diagnostic Radiology and Neuroradiology(介入与诊断放射学及神经放射学研究所) ; National Center for Tumor Diseases West(西部肿瘤疾病国家中心)
专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.LG
AI总结 RadPRISM将放射学模式作为分层轴,通过专用视觉子空间对齐临床概念,提升零样本分类与视觉定位性能,实现可透明检查的概念解耦医学图像表示。
同一硬币的两面:面向视觉-语言模型跨任务攻击的协同演化搜索
机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) ; Center for Frontier AI Research, Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局前沿人工智能研究中心) ; School of Electrical Engineering and Automation, Fuzhou University(福州大学电气工程与自动化学院) ; ByteDance(字节跳动)
专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV
AI总结 针对视觉-语言模型易受对抗扰动的问题,提出协同演化跨模态攻击框架,联合优化文本与视觉空间,在多任务上展现出强攻击性能与跨任务可迁移性。
Comments 15 pages, 7 figures, and 8 tables; includes supplementary material
面向以人为中心场景中AI生成图像检测的视觉证据定位与解释
专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV
AI总结 针对以人为中心场景AI生成图像检测的证据定位与解释局限,提出HAVE数据集及PAVE框架,实现真伪预测、证据定位与解释生成,实验表现优异。