Relationship-Aware Hierarchical 3D Scene Graph for Task Reasoning
关系感知的层次3D场景图用于任务推理
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本文提出了一种关系感知的层次3D场景图,结合视觉语言模型和大型语言模型,用于任务推理和环境交互。
Comments ICRA 2026, 8 pages
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
关系感知的层次3D场景图用于任务推理
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本文提出了一种关系感知的层次3D场景图,结合视觉语言模型和大型语言模型,用于任务推理和环境交互。
Comments ICRA 2026, 8 pages
LongVPO:从锚定线索到自我推理的长视频偏好优化
机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) ; JIUTIAN Research(Jiutian研究) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 LongVPO通过两阶段直接偏好优化框架,利用合成数据和递归标注流程,在无需长视频标注的情况下实现高效长视频理解,优于现有开源模型并保持短视频性能。
Comments NeurIPS 2025
Med3D-R1: 促进3D医学视觉-语言模型的临床推理
机构 * School of Biomedical Engineering, Division of Life Sciences and Medicine, University of Science and Technology of China(生物医学工程学院,生命科学与医学系,中国科学技术大学) ; Suzhou Institute for Advanced Research, University of Science and Technology of China(先进研究所,中国科学技术大学) ; Stanford University(斯坦福大学) ; Medical Business Department, iFlytek Co.Ltd(iFlytek公司医学业务部) ; The First Affiliated Hospital of USTC, Division of Life Sciences and Medicine University of Science and Technology of China(中国科学技术大学第一附属医院,生命科学与医学系)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 Med3D-R1通过两阶段训练框架提升3D医学视觉-语言模型的临床推理能力,实现更准确的异常诊断。
DiVE-k:基于微细图像识别的差分视觉推理
机构 * University of Southern California(南加州大学) ; Meta
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 DiVE-k通过利用模型自身top-k预测作为训练信号,提升细粒度图像识别的差分推理能力,显著优于现有方法。
Comments ICLR 2026
平滑操作符:平滑可验证奖励激活视觉-语言模型的空间推理能力
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本文提出平滑可验证奖励激活方法,通过平滑操作符和绝对保持GRPO框架提升视觉-语言模型对3D场景的理解能力,实现性能与数据效率的平衡。
VIPER Strike: 通过结构化视觉-语言推理击败视觉推理验证码
机构 * City University of Macau(澳门城市大学) ; CSIRO Data61(澳大利亚联邦科学与工业研究组织数据61)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 ViPer通过结构化视觉-语言推理框架,有效解决视觉推理验证码问题,实现高达93.2%的成功率,优于现有方法,同时提出TSR策略提升防御效果。
Comments Accepted by Usenix Security 2026
基于蓝图的思考:通过结构化物体表示协助视觉-语言模型进行空间推理
机构 * National University of Singapore(新加坡国立大学) ; Microsoft Research, Asia(微软亚洲研究院) ; Tsinghua University(清华大学) ; University of Toronto(多伦多大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 通过结构化物体表示提升视觉-语言模型的空间推理能力,引入蓝图嵌入推理轨迹、蓝图意识奖励和反捷径数据增强技术。
Comments Preprint. Under review
从室内到开放世界:揭示MLLMs中的空间推理差距
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; ETH Zürich(苏黎世联邦理工学院) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本文提出了一种大规模基准测试,通过户外数据集揭示MLLMs在空间推理方面的不足,并证明其依赖语言先验而非真实视觉推理。
Comments Project page: https://mingrui-wu.github.io/openbench/
MAction-SocialNav: 通过推理增强的提示调优实现多动作社交合规导航
机构 * Graduate School of Information Science and Technology, Hokkaido University(信息科学与技术研究生院,北海道大学) ; Graduate School of Computer Science, George Mason University(计算机科学研究生院,乔治·梅森大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 MAction-SocialNav通过推理增强的提示调优实现多动作社交合规导航,提升决策质量与安全性,效率高于现有模型。
VisRes Bench: 关于评估视觉语言模型的视觉推理能力
机构 * Technology Innovation Institute, Abu Dhabi, UAE(阿布扎比技术创新研究所) ; Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 VisRes Bench通过三个层次评估VLMs的视觉推理能力,揭示其在复杂任务中的局限性,并为多模态研究提供统一框架。
RemoteReasoner: 向统一地理空间推理流程迈进
机构 * COWARobot
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 RemoteReasoner通过强化学习实现统一地理空间推理流程,具备多粒度任务处理能力和自主推理能力。
GeoVista: 基于网络增强的代理视觉推理用于地理定位
机构 * Fudan University(复旦大学) ; Tencent Hunyuan(腾讯文元) ; Tsinghua University(清华大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 GeoVista通过整合图像缩放和网络搜索工具,提升地理定位任务的代理模型性能,实现优于开源模型的性能。
SNOW:基于世界知识的时空场景理解用于开放世界具身推理
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ; Esslingen University of Applied Sciences(埃斯林根应用科学大学) ; Dr. Ing. h.c. F. Porsche AG(德意志联邦汽车工业联合会) ; University of Michigan(密歇根大学) ; Voxel51 Inc.(Voxel51公司)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 SNOW通过整合视觉语言模型与点云几何,实现统一的4D场景理解,提升开放世界具身推理的性能。
R4:在4D时空空间中为视觉语言模型引入检索增强推理
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ; Esslingen University of Applied Sciences(埃斯林根应用科学大学) ; Dr. Ing. h.c. F. Porsche AG(德意志联邦汽车工业协会) ; University of Michigan(密歇根大学) ; Voxel51 Inc.(Voxel51公司)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 R4通过构建4D时空知识库,使视觉语言模型具备结构化终身记忆,实现无需训练的检索增强推理,提升动态环境中的具身推理能力。
通过概率图增强视觉编程用于视觉推理
机构 * School of Computer Science and Engineering, Sun Yat-sen University(计算机科学与工程学院,中山大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 通过构建概率图解决视觉编程非可微问题,提升视觉推理任务的性能。
Comments 13 Pages, 12 figures
FoundationMotion: 自动标注与视频中空间运动的推理
机构 * MIT(麻省理工学院) ; NVIDIA(英伟达) ; UMich(密歇根大学) ; UC Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 FoundationMotion通过自动数据整理管道生成大规模细粒度运动数据集,提升开源模型在运动理解与空间推理任务中的性能。
Comments Code is available at https://github.com/Wolfv0/FoundationMotion/tree/main
视图-图:通过场景图上的视觉-语言推理实现零样本3D视觉定位
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本文提出视图-图方法,通过场景图上的视觉-语言推理实现零样本3D视觉定位,有效解决空间语义关系处理难题。
Tri-Bench:在相机倾斜和物体干扰下测试VLM在空间推理中的可靠性
机构 * Amit Bendkhale(独立研究者)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 Tri-Bench通过测试VLM在相机倾斜和物体干扰下的空间推理可靠性,揭示了模型在几何推理中的不足。
Comments 6 pages, 3 figures. Code and data: https://github.com/Amiton7/Tri-Bench. Accepted to the AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)
SpatialDreamer: 通过主动心理意象激励空间推理
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·宾·扎耶德人工智能大学) ; Sun Yat-sen University(孙中山大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 SpatialDreamer通过主动心理意象和几何策略优化,提升多模态大语言模型在复杂空间推理任务中的性能。
MMRPT:通过遮蔽视觉依赖推理的多模态强化预训练
机构 * SenseTime(秒速科技)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 MMRPT通过强化学习提升多模态预训练效果,利用视觉基础推理增强模型对视觉内容的理解能力。
Comments 7 pages, 1 figures
通过视觉推理序列攻击对多模态大语言模型进行劫持
机构 * Alibaba Group(阿里巴巴集团) ; Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 VRSA通过视觉推理序列攻击方法,针对多模态大语言模型的视觉模态进行劫持,提升攻击成功率。
LOG-Nav: 面向复杂多房间室内环境的高效布局感知物体目标导航方法
专题命中 视觉空间推理 :planning(title,abstract)
AI总结 LOG-Nav通过层次化规划和大语言模型智能体实现高效布局感知导航,实验显示其在复杂室内环境中的导航成功率显著提升。
COOPER:一种用于空间智能中协作感知与推理的统一模型
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Baidu Inc.(百度公司)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 COOPER是一种统一的多模态大语言模型,通过整合深度和分割等辅助模态,提升空间感知与推理能力,实现空间智能的增强。
InfiniBench:用于可定制场景复杂度的无限基准测试
机构 * University of Pittsburgh(匹兹堡大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 InfiniBench通过可定制的3D场景生成方法,提升视觉语言模型在复杂空间推理任务中的评估能力。
iFinder: 结构化零样本视觉基于LLM的地面定位用于行车记录仪视频推理
机构 * NEC Laboratories, America(NEC美国实验室) ; University of California, Riverside(加州大学河滨分校) ; University of California, San Diego(加州大学圣地亚哥分校)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 iFinder通过结构化语义接地框架,利用行车记录仪视频中的关键线索提升LLM在驾驶视频推理中的性能。
Comments Accepted at NeurIPS 2025
在可观察之前看见:通过视觉语言模型在自动驾驶中的潜在风险推理
机构 * School of Vehicle and Mobility, Tsinghua University(车辆与移动系统学院,清华大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本文提出PotentialRiskQA数据集和PR-Reasoner框架,通过视觉语言模型提升自动驾驶中潜在风险的前瞻性推理能力。
引导内在之眼:一种用于层次化和灵活的视觉基础推理的框架
机构 * Basic Algorithm Center, PCG, Tencent(腾讯基本算法中心、PCG、腾讯)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 GRiP通过认知增强的强化学习框架,提升视觉基础推理的鲁棒性和灵活性,实现复杂场景下的高性能表现。
Comments 9pages
感知分类:评估和引导视觉语言模型中的层次场景推理
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本文提出感知分类基准测试,旨在评估和引导视觉语言模型在层次场景推理中的能力,揭示模型在属性驱动推理上的不足,并展示通过上下文示例提升性能的效果。
ControlThinker: 通过视觉推理揭示潜在语义以实现可控图像生成
机构 * Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(上海智能信息处理关键实验室,复旦大学计算机学院) ; Shanghai Collaborative Innovation Center on Intelligent Visual Computing(上海智能视觉计算协同创新中心) ; MiniMax
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 ControlThinker通过视觉推理挖掘潜在语义,提升可控图像生成的语义一致性和视觉质量。
SpatialGeo:通过几何-语义融合提升多模态大语言模型的空间推理能力
机构 * School of Computer Science and Technology, Tongji University, Shanghai, China(计算机科学与技术学院,同济大学,上海,中国)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 SpatialGeo通过几何-语义融合提升多模态大语言模型的空间推理能力,实验表明在空间推理任务中准确率提升8.0%且内存消耗减少50%。