Improved Visual-Spatial Reasoning via R1-Zero-Like Training
专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract);分类 cs.AI
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract);分类 cs.AI
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.LG
Journal ref Computer Vision and Pattern Recognition Conference (CVPR) 2025
专题命中 视觉空间推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.LG
Journal ref 2015 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2015), pp. 2943-2950
推理的几何学:表示空间中的流动逻辑
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究通过几何框架分析LLM推理过程,揭示其在表示空间中的流动特性,并验证逻辑结构与语义的关系。
Comments ICLR 2026. Code: https://github.com/MasterZhou1/Reasoning-Flow
专题命中 视觉空间推理 :CoT(title,abstract);reasoning(abstract,comments)
Comments This work has been accepted to the Multimodal Algorithmic Reasoning (MAR) Workshop at CVPR 2025
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments The first two authors have contributed equally to this work. Accepted as regular paper at CVPR 2023 Workshop and Challenges for New Frontiers in Visual Language Reasoning: Compositionality, Prompts and Causality (NFVLR)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to TACL 2017, code: https://github.com/jannerm/spatial-reasoning
GRIT: 教授大语言模型通过图像思考
机构 * UC Santa Cruz(加州大学圣克鲁兹分校) ; UC Santa Barbara(加州大学圣芭芭拉分校) ; eBay
专题命中 视觉空间推理 :reasoning(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 GRIT提出一种基于图像和文本的 grounded reasoning 方法,通过强化学习实现高效训练,使大语言模型生成视觉基础的推理链。
Journal ref NeurIPS 2025
ActFER: 通过主动工具增强的视觉推理实现代理面部表情识别
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)
AI总结 ActFER通过主动视觉证据获取和多模态推理提升面部表情识别,采用UC-GRPO算法优化局部检查和情绪感知,实验显示其在AU预测准确率上显著优于传统方法。
Comments 10 pages, 7 figures
AirForesight:面向无人机视觉语言导航(UAV-VLN)的跨空间规划一致性当前-未来空间地图想象
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Shandong University(山东大学)
专题命中 视觉空间推理 :planning(title,abstract);reasoning(abstract)
AI总结 针对现有UAV-VLN方法空间推理不足的问题,提出AirForesight框架,通过联合监督学习当前地图表示并引入跨空间规划一致性损失,在公开数据集上取得良好性能。
Comments Accepted by ACM Multimedia 2026
TDVR:用于零样本3D视觉定位的联合文本消歧与视点推理框架
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)
AI总结 本文提出TDVR框架,通过联合文本消歧与视点推理解决零样本3D视觉定位中的文本歧义与视点不足问题,在ScanRefer数据集上的Acc@0.25和Acc@0.5指标较现有最优方法分别提升15.25%和14.46%
Comments 10 pages, 5 figures, 7 tables
DiffuseAgent-MI:用于忠实视觉推理的基于分布、集成工具的自进化智能体
专题命中 视觉空间推理 :reasoning(title,abstract);verifier(abstract)
AI总结 DiffuseAgent-MI是基于分布、集成工具的自进化视觉推理智能体,通过KL最小能量模型与轨迹级验证器提升忠实性,在多数据集上准确率及相关指标表现优于现有模型。
Comments 11 pages, 9 figures, accepted by ICML 2026 manitrack
超越缩放:学习用于超高分辨率遥感的多工具视觉推理
机构 * National University of Defense Technology(国防科技大学) ; Wuhan University(武汉大学) ; Tsinghua University(清华大学)
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)
AI总结 针对超高分辨率遥感图像给多模态大语言模型带来的挑战,提出GeoMTVR数据集,结合监督微调与以工具注意力为重点的强化学习算法开发GeoLens,实验证明其在多工具视觉推理方面优于直接推理和单工具放大基线。
PixDLM:一种用于无人机推理分割的双路径多模态语言模型
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)
AI总结 本文提出PixDLM,一种用于无人机推理分割的多模态语言模型,通过构建DRSeg基准数据集,验证了该模型在处理高分辨率无人机图像中的有效性。
Comments Accepted to CVPR 2026 (highlight)
Trace:一种用于多领域视觉推理的分类法引导环境
机构 * Rochester Institute of Technology(罗彻斯特理工学院)
专题命中 视觉空间推理 :reasoning(title,abstract);verifier(abstract)
AI总结 针对视觉语言模型缺乏合适训练数据的问题,提出Trace分类法引导环境,将任务构建分解,通过共享语义状态确定相关元素,在该环境上的RLVR提升了模型在外部基准测试中的表现,证明训练可迁移。
用于多步视觉推理的分层去噪
机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理技术国家重点实验室) ; The Hong Kong University of Science and Technology(香港科技大学) ; Beihang University(北京航空航天大学) ; Fuzhou University(福州大学) ; Muka Robotics(木卡机器人)
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)
AI总结 研究针对视频模型多步推理不足的问题,提出HDR框架,通过树形层次结构和稀疏分层注意力模式进行多步推理,在新基准测试中提升了成功率和进度,推理更快,数据效率更高,在机器人实验中展现潜力。
AgentsCAD: 通过多智能体大语言模型推理和几何特征识别实现FDM零件的自动化制造设计
专题命中 视觉空间推理 :reasoning(title,abstract);verifier(abstract)
AI总结 提出AgentsCAD多智能体系统,结合B-Rep几何解析与LLM推理,自动检测FDM零件悬垂缺陷并生成修改建议,输出修正STEP文件。
IndustryNav:探索动态工业导航中具身智能体的空间推理
机构 * Michigan State University(密歇根州立大学) ; Independent Researcher(独立研究者) ; University of California, Irvine(加州大学尔湾分校) ; Ohio State University(俄亥俄州立大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of California, Santa Barbara(加州大学圣巴巴拉分校) ; University of Pittsburgh(匹兹堡大学) ; University of Virginia(弗吉尼亚大学) ; Arizona State University(亚利桑那州立大学) ; Purdue University Northwest(普渡大学西北分校)
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)
AI总结 针对视觉大语言模型在空间推理的挑战,提出IndustryNav基准,利用动态工业场景评估,给出零样本导航管道及安全指标,研究发现模型在路径规划等方面有缺陷,凸显向主动探索等任务发展的需求。
空间思考者:通过密集奖励强化场景图基础的空间推理
机构 * University of Oxford(牛津大学) ; University of California, Santa Cruz(加州大学圣克鲁兹分校)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对多模态大语言模型空间推理难题,提出SpatialThinker,通过在线强化学习统一场景图生成与视觉推理,构建心理场景图并借助密集奖励推理,贡献包括基于SGG推理、高质量训练数据集及密集奖励设计。
Comments Preprint. Accepted at NeurIPS 2025 Workshops on SPACE in Vision, Language, and Embodied AI (SpaVLE) as Oral, Embodied World Models for Decision Making (EWM), Aligning Reinforcement Learning Experimentalists and Theorists (ARLET), and Scaling Environments for Agents (SEA)
面向可部署社交机器人导航的视觉-语言模型:弥合语义推理与低级控制
机构 * Graduate School of Information Science and Technology, Hokkaido University(弘前大学信息科学与技术研究生院) ; Graduate School of Information Science and Technology, The University of Tokyo(东京大学信息科学与技术研究生院)
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)
AI总结 本文综述了将视觉-语言模型(VLM)集成到社交机器人导航中的方法,提出包含高层推理、低层控制及中间机制的统一框架,并讨论了关键挑战与未来方向。
具有双LLM模块的分层提示用于机器人任务和运动规划
机构 * IBM, Krakow, Poland(IBM公司,波兰克拉科夫) ; Jagiellonian University, Krakow, Poland(雅盖隆大学,波兰克拉科夫) ; AGH University, Krakow, Poland(AGH大学,波兰克拉科夫)
专题命中 视觉空间推理 :planning(title,abstract);reasoning(abstract)
AI总结 本文提出一个分层语言驱动框架,通过双LLM模块提升服务和协助场景中人机交互的自然性和直观性,结合目标检测与运动执行实现高成功率的任务规划。
Journal ref Proc. IEEE International Conference on Advanced Robotics and its Social Impacts (ARSO), 2026, pp. 245-250
SAGE-Nav:利用LLM规划与对齐融合的分层场景图引导导航
机构 * Zhejiang University(浙江大学)
专题命中 视觉空间推理 :planning(title,abstract);reasoning(abstract)
AI总结 提出SAGE-Nav分层框架,结合大语言模型与动态场景图,通过解耦全局语义规划与高频反应控制,实现高效目标导航,在i-THOR和RoboTHOR中达到最优性能。
Comments Accepted by IROS 2026
RoBoSR:面向具身机器人推理的结构化场景表示
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)
AI总结 提出RoBoSR,一种基于语义对象中心场景图的中间结构表示,将操作建模为逐步状态转换,实现因果推理和长期任务规划,并在零样本泛化中优于提示方法和经典TAMP基线。
基于全局地图与局部视图的多视角3D推理的密集奖励
机构 * Graduate School of Artificial Intelligence, KAIST, Republic of Korea(韩国科学技术院人工智能研究生院) ; KRAFTON, Republic of Korea(韩国KRAFTON公司)
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)
AI总结 提出DR-MV3D框架,通过全局一致性奖励和局部轨迹奖励对多视角3D VQA的中间推理过程进行密集监督,提升跨视图推理一致性。
Comments ECCV 2026
从边界框到视觉推理:一种用于视觉语言模型的在线策略数据标注工具
机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) ; College of Computer Science, Jilin University(吉林大学计算机科学与技术学院) ; OPPO
专题命中 视觉空间推理 :reasoning(title,abstract);verifier(abstract)
AI总结 提出ScreenAnnotator,通过统一标注原子模式、在线策略循环与贝叶斯验证器,解决现有工具表达力不足、标注-训练脱节和数据复用性差的问题,实现高效多任务数据生成。
Comments 14 pages, 7 figures