Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models
面向视觉语言模型空间推理的多视图关系蒸馏
机构 * KAIST(韩国科学技术院)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 针对视觉语言模型空间推理的几何脆弱性问题,提出多视图关系蒸馏方法,在保留语言对齐的同时提升视觉空间推理性能,可泛化至3D场景理解任务。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
面向视觉语言模型空间推理的多视图关系蒸馏
机构 * KAIST(韩国科学技术院)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 针对视觉语言模型空间推理的几何脆弱性问题,提出多视图关系蒸馏方法,在保留语言对齐的同时提升视觉空间推理性能,可泛化至3D场景理解任务。
用工具思考,而非用像素思考:工具调用作为视觉推理的文本支架
机构 * Hong Kong University of Science and Technology(香港科技大学) ; The Chinese University of Hong Kong(香港中文大学) ; Ant Group(蚂蚁集团) ; Zhejiang University(浙江大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 该研究提出工具调用支架假设,引入TextCall方法验证返回图像冗余,仅用结构化文本支架即可实现视觉推理,降低延迟并消除工具API调用,结论适用于现有相关基准。
基于主动感知的全切片病理图像智能体视觉推理
机构 * College of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院) ; School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 该研究提出AdaptivePath主动感知框架,通过序列决策实现千兆像素病理切片的视觉推理,在病理VQA基准及TCGA六队列癌症亚型分类上取得最优性能,辅助病理学家诊断。
Comments 14 pages, 5 figures
RemoteZero:零样本地理空间推理
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本研究提出无标签强化学习框架RemoteZero,利用MLLM的评估能力和航拍图像优势,以语义一致性为内在奖励实现地理空间推理,性能优于监督基线且可自演化,适配多类地球观测任务。
Radar4D-VLM:基于提议的跨冻结语言模型的时序4D雷达推理
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本文提出仅用雷达的时序视觉-语言模型Radar4D-VLM,结合提议的时序目标标记等,在K-Radar验证集上表现优异,且雷达标记接口兼容多款冻结语言骨干,为雷达多模态推理奠定基础。
NeuroMosaic:基于解剖学的多模态大语言模型,用于从3D MRI和临床叙事中进行分子感知的胶质瘤推理
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 该研究针对多模态医疗大语言模型在神经肿瘤学中的结构缺陷,提出NeuroMosaic模型,通过多模块架构实现胶质瘤的准确推理,在多个数据集上取得优异性能,验证了解剖学索引路由机制的有效性。
LUT:用于视觉推理的隐式效用训练
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本文提出仅用标准VQA对训练的LUT框架,通过轨迹和步骤层面的隐式效用优化,在感知密集型视觉推理基准上性能优于现有隐式推理方法,且标注成本更低。
GuideGround:用于3D视觉定位的VLM引导语义理解与视点感知推理
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 GuideGround是一种VLM引导的3D视觉定位框架,用VLM生成的语义描述替代闭集分类、逐视图保留假设并经VLM验证,在ReferIt3D基准上性能优于现有SOTA。
Comments 18 pages, 5 figures
Beacon:智能体何时及如何执行智能体视觉推理
机构 * Peking University(北京大学) ; Kling Team(Kling团队) ; HKUST(GZ)(香港科技大学(广州)) ; CUHK(香港中文大学) ; ZJU(浙江大学) ; THU(清华大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本研究针对现有智能体视觉推理模型模式适应性有限、工具增益被损害抵消的问题,提出Beacon模型,通过强化学习相关机制提升性能与适应性,在多基准上表现优异。
Comments 33 pages
面向决策关键型应用的多模态大语言模型中可解释且资源高效的空间推理
机构 * Heritage Institute of Technology(遗产技术学院) ; Kalyani Government Engineering College(卡利亚尼政府工程学院) ; IAIRO ; Intel Corporation(英特尔公司)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 针对多模态大语言模型空间判断不透明及细粒度空间理解不足的问题,提出无需训练的ByDeWay-V2框架,结合YOLO-World-L注入空间谓词,在多个基准上显著提升空间推理性能,适配资源受限场景。
Comments 14 pages
OmniAD:基于多模态推理的工业异常检测与理解
机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学学院) ; Visual Intelligence + X International Joint Laboratory of the Ministry of Education(教育部视觉智能+X国际合作实验室) ; Key Laboratory of Noise and Vibration Research, Institute of Acoustics, Chinese Academy of Sciences(中国科学院声学研究所噪声与振动重点实验室) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 OmniAD是融合视觉与文本推理的多模态框架,以Text-as-Mask Encoding等技术实现工业异常检测与理解,在MMAD基准性能超Qwen2.5-VL-7B等模型,代码与模型将公开。
保持一致!利用一致性约束增强大视觉语言模型中的鲁棒视觉推理
机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) ; Amazon Web Services(亚马逊网络服务公司)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 研究针对LVLMs在视觉推理任务中较脆弱的问题,引入ConVBench基准及逻辑一致性等评估指标,提出ConVLM,通过基于GRPO的强化学习及一致性奖励改进LVLM推理,利用自动生成的问答对和双重奖励设计提升模型表现。
Geo3R:减轻多模态大语言模型中的空间推理幻觉
机构 * Peking University(北京大学) ; Joy Future Academy(京东探索研究院)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 多模态大语言模型推理空间关系易产生幻觉,现有方法效果有限。本文定义空间推理幻觉及常见场景,提出无训练的Geo3R框架,结合几何证据和结构化3D推理减轻幻觉,实验证明该框架显著减少幻觉,优于现有模型和方法。
Comments Accepted by ACM MM 2026. This is the arXiv preprint version, not the camera-ready
S-Agent:空间工具使用激发空间智能推理
机构 * NTU(南洋理工大学) ; THU(清华大学) ; ByteDance(字节跳动) ; NWPU(西北工业大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 提出S-Agent空间工具使用智能体范式,通过时空证据积累和层次化工具集,将VLM作为语义规划器,实现连续多视图图像和视频的空间推理,在无训练下提升开源和闭源VLM性能,并基于S-300K轨迹微调得到紧凑空间智能体S-Agent-8B。
Comments Project Page : https://Ropedia.github.io/S-Agent
ConsiSpace:学习几何一致性对视频空间推理很重要
机构 * School of Intelligent Science and Technology, Nanjing University(南京大学智能科学与技术学院) ; School of Computer Science, Peking University(北京大学计算机科学学院) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 针对视频空间推理中现有模型难以聚合一致空间证据的问题,提出ConsiSpace框架,通过构建几何一致内存及采用统一一致性自监督强化学习,在三个空间推理基准测试上取得成绩提升,平均得分比最强基线高12.6分。
Comments ECCV 2026
VL-Nav: 一种基于神经符号的方法用于基于推理的视觉语言导航
机构 * Spatial AI & Robotics Lab, University at Buffalo, USA(美国布法罗大学空间人工智能与机器人实验室) ; Robotics Institute, Carnegie Mellon University, USA(卡内基梅隆大学机器人研究所)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本文提出VL-Nav,一种结合神经推理与符号引导的视觉语言导航系统,通过任务规划和探索系统提升机器人在复杂环境中的导航能力,实验证明其在室内和室外场景中均取得较高成功率。
Journal ref IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2026
ICLR: 基于视觉推理的上下文模仿学习
机构 * University of Southern California(南加州大学) ; Autodesk Research(Autodesk研究)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 ICLR通过结合视觉推理与上下文模仿学习,提升机器人在复杂任务中的适应性和泛化能力。
Comments Accepted to IROS 2026. Project website: https://toannguyen1904.github.io/ICLR
通过深度强化学习进行3D几何牙齿对齐规划
机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) ; State Key Laboratory of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) ; Stomatology Hospital, Zhejiang University School of Medicine(浙江大学医学院附属口腔医院)
专题命中 视觉空间推理 :planning(title,abstract)
AI总结 研究针对3D几何牙齿对齐规划问题,提出基于深度强化学习的框架。利用马尔可夫决策过程,结合三项创新:基于Transformer的智能体、动态掩码方案和两阶段课程学习策略,在数据集上评估,该方法在路径安全和效率上优于基线,提供自动化正畸对齐规划方案。
DynTrace:用于多模态大语言模型中4D时空推理的动态对象证据跟踪
机构 * Xiamen University(厦门大学) ; Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; China University of Mining and Technology(中国矿业大学) ; Shenzhen Technology University(深圳技术大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 研究针对多模态大语言模型在连续动态场景感知中跟踪动态对象证据的局限,提出DynTrace框架,含DTV和DT-Token两个互补组件,能为模型提供基于几何视觉先验和结构化时空轨迹的动态对象证据,在多个基准测试中达先进水平。
Comments Accepted by ACM MM 2026
当深度以文字表述比图像展示更好用时:用于视觉语言空间推理的深度序数提示
机构 * National University of Singapore(新加坡国立大学) ; Center of AI Research, VinUniversity(文大人工智能研究中心)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 研究视觉语言模型空间推理难题,提出深度序数提示(DOP)方法,该方法无需训练,将单目深度转换为序数文本提示,在伪深度提供可靠排序时可改善空间推理,简单且针对性强,与其他无需训练的深度提示方法有竞争力。
Comments Work in progress
场景图思维:增强多模态大语言模型的结构化视觉推理
机构 * Fudan University(复旦大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 针对多模态大语言模型忽视结构化关系的问题,提出场景图思维(SaGe)范式,通过自动数据引擎转换数据、构建训练数据,采用两阶段图对齐训练范式,在多模态基准测试中取得显著改进,提升细粒度感知和推理能力。
Comments ICML 2026
AeroRAG:结构化多模态检索增强型LLM用于细粒度航空视觉推理
机构 * Research Center for Space Computing System, Zhejiang Lab, Hangzhou(杭州浙大实验室空间计算系统研究中心) ; Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou(中国科学院大学杭州高等研究院) ; School of Cyber Science and Engineering, Zhengzhou University(郑州大学计算机科学与工程学院) ; School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本文提出AeroRAG,通过结构化场景图引导的多模态检索增强生成框架,解决航空场景中视觉问答的挑战,提升对小物体、数量、位置及物体关系的推理能力。
SplatReasoner:通过新颖视图合成增强具身推理与基础能力
机构 * POSTECH ; KAIST(韩国科学技术院) ; ETRI(韩国电子电信研究院) ; NVIDIA(英伟达)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 研究针对视觉语言模型应用于具身场景理解受固定视角限制的问题,提出SplatReasoner框架,利用3D高斯点云将新颖视图合成引入推理过程,经实验验证该方法能提升具身推理和3D基础能力。
Comments Accepted at ECCV 2026. Project page: https://splatreasoner.github.io/
RoboStream: 用记忆融合时空推理提升视觉语言模型在机器人中的应用
机构 * Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) ; YXGN Robotics(YXGN机器人) ; China University of Mining and Technology(中国矿业大学) ; Shenzhen Technology University(深圳技术大学) ; Huazhong University of Science and Technology(华中科技大学) ; Xiamen University(厦门大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 RoboStream通过时空融合令牌和因果时空图实现持久记忆,解决机器人长时间任务中的几何锚定和状态追踪问题,提升长期任务表现。
Comments Accepted by ECCV 2026
用于空间推理的视觉语言记忆
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 研究针对当前视觉语言模型在视频空间推理中未达人类水平的问题,提出VLM²,通过双记忆模块,即工作记忆和情景记忆,实现固定成本下的高效空间推理,在多基准测试中取得最优性能,推动视觉空间智能发展。
Comments Accepted to European Conference on Computer Vision (ECCV), 2026
EAGOR:全方位的具身推理
机构 * EmPACT Lab, NTU Singapore Institute for Infocomm Research, A*STAR Singapore(EmPACT实验室,南洋理工大学信息与通信研究所,A*STAR新加坡)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 研究针对现有视觉语言模型在处理360°观测时方向估计不一致的问题,提出无需训练的几何感知框架EAGOR,将方向推理表述为球面上的递归贝叶斯估计,引入球谐信念场,实验证明其性能优于现有方法。
Comments 12 Pages, 7 Figures, 4 Tables
IDEAL-Bench:用于分析3D布局推理的室内数据集和评估套件
机构 * Department of Computer Science Dartmouth College(达特茅斯学院计算机科学系)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 介绍IDEAL-Bench评估套件,让视觉语言模型预测室内场景结构化3D布局,基于IDEAL-Scenes数据集,评估15个模型发现任务待解、模型存在不对称性及排名差异,为下一代模型空间智能评估铺路。
Comments 36 pages. Project page: https://ideal3d.github.io/
Q-GeoMem:面向视频空间推理的问题引导几何记忆
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai AI Lab(上海人工智能实验室) ; Northwestern Polytechnical University(西北工业大学) ; TeleAI
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 提出Q-GeoMem框架,通过问题引导的几何记忆机制,结合细粒度上下文库和语义几何证据库,在视频空间推理任务中实现最先进性能。
空间平衡:利用空间推理在LLM辅助科学传播写作中平衡科学阐述与叙述吸引力
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本文提出SpatialBalancing系统,通过结合人类空间推理与大语言模型的语义能力,提升科学传播写作中科学严谨性与叙述吸引力的平衡。
Comments DIS '26
Journal ref In Designing Interactive Systems Conference (DIS '26), June 13-17, 2026, Singapore, Singapore. ACM, New York, NY, USA, 20 pages
通过本体感知进行思考:用于VLA策略的状态基础视觉令牌选择
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Eastern Institute of Technology(东区技术研究所) ; Great Bay University(大湾大学) ; Northeast Forestry University(东北林业大学) ; National University of Singapore(新加坡国立大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 研究VLA模型中本体感知应用问题,提出ThinkProprio方法,将本体感知离散化为视觉语言模型(VLM)词汇令牌,与指令共同作用在VLM计算前选视觉补丁,贡献是提升性能、降低延迟。