ViewFusion: Structured Spatial Thinking Chains for Multi-View Reasoning
ViewFusion:多视角推理的结构化空间思维链
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL
AI总结 ViewFusion通过两阶段框架提升多视角推理准确率,通过空间预对齐与问题驱动推理结合,有效提升复杂场景下的表现。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
ViewFusion:多视角推理的结构化空间思维链
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL
AI总结 ViewFusion通过两阶段框架提升多视角推理准确率,通过空间预对齐与问题驱动推理结合,有效提升复杂场景下的表现。
基于空间代码的物理世界视频推理
专题命中 视觉空间推理 :reasoning(title)
AI总结 基于空间代码的物理世界视频推理方法,通过空间编码器生成3D表示并提升大语言模型的推理能力。
Comments Code at https://github.com/Beckschen/spatialcode
持续性具身导航学习
机构 * State Key Laboratory of Robotics and Intelligent Systems(机器人与智能系统国家重点实验室) ; Shenyang Institute of Automation(沈阳自动化研究所) ; Chinese Academy of Sciences(中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 Uni-Walker通过分解导航知识为共享和特定组件,解决持续性具身导航学习中的灾难性遗忘问题,提升导航代理的持续学习能力。
Comments 24 pages, 7 figures
DeepSight: 通过深度驱动的多模态模型连接深度图与语言
机构 * Harbin Institute of Technology(哈尔滨工业大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL
AI总结 DeepSight通过深度驱动的多模态模型提升三维场景理解,利用深度图像特性增强空间推理能力,并通过新数据集和模型改进实现了深度感知和任务性能的显著提升。
VEGA:基于物理信息神经算子和近端策略优化的电动汽车导航代理
机构 * Department of Mechanical Engineering, State University of New York(机械工程系,纽约州立大学) ; Department of Computer Science, State University of New York(计算机科学系,纽约州立大学)
专题命中 视觉空间推理 :planning(abstract);分类 cs.LG
AI总结 VEGA通过结合物理信息神经算子和近端策略优化,为电动汽车提供高效的能耗感知导航方案,实现快速路径规划和充电站点选择。
Comments This work has been submitted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) for possible publication
OnlineSI: 通过大规模语言模型实现在线3D理解和定位
机构 * Tsinghua University(清华大学) ; Nanyang Technological University(南洋理工大学) ; Shanghai AI Lab(上海人工智能实验室)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 OnlineSI通过整合3D点云与语义信息,提升大规模语言模型在动态环境中的空间理解和物体识别能力。
Comments Project Page: https://onlinesi.github.io/