SpatialVLM: Endowing Vision-Language Models with Spatial Reasoning Capabilities
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI
Comments 16 pages,1 figures, under review
专题命中 视觉空间推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI、cs.LG
机构 * Apple(苹果公司)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG
Comments additional experiments added, title changed from "Visual Scratchpads: Enabling Global Reasoning in Vision" to "Chain-of-Sketch: Enabling Global Visual Reasoning"
Pest-Thinker: 通过强化学习学习像昆虫学家一样思考和推理
机构 * Institute of Intelligent Machines, Hefei Institute of Physical Science, Chinese Academy of Sciences(智能机器研究所、合肥物理科学研究所、中国科学院) ; University of Science and Technology of China(中国科学技术大学) ; Zhongke Hefei Institute of Technology Innovation Engineering(中科创新合肥科技研究院) ; Hefei University of Technology(合肥工业大学)
专题命中 视觉空间推理 :chain-of-thought(abstract,abstract_cn);CoT(abstract,abstract_cn);reasoning(abstract)
AI总结 本文提出Pest-Thinker框架,通过强化学习提升多模态大语言模型对害虫形态的细粒度理解,构建了两个高精度害虫基准数据集,并通过监督微调和GRPO优化提升模型在农业害虫识别中的表现。
Comments 10 pages, 5 figures
专题命中 视觉空间推理 :reasoning(title);planning(title)
专题命中 视觉空间推理 :reasoning(title);planning(title)
Comments Project Page: https://ll3da.github.io/
LongEarth-R1:用于长时序地球观测推理的视觉语言模型基准测试与对齐
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 该研究推出长时序地球观测推理基准LongEarth-Bench,开发LongEarth-R1模型,在全部12项长序列遥感推理任务中表现最优,同时在标准遥感基准上保持竞争力。
LEGO-Puzzles:多模态大语言模型(MLLMs)在多步骤空间推理上的表现如何?
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Tongji University(同济大学) ; Tsinghua University(清华大学)
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI
AI总结 该研究推出多步骤空间推理基准LEGO-Puzzles,评估29个顶尖MLLMs,发现其在基础空间推理、多步骤规划任务上远逊于人类,凸显其空间推理能力存在关键局限。
LenGuard-GPC:用于空间推理强化学习的带引导提示一致性的长度保护
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 针对多视图空间推理中思维链推理冗长不准确及标准GRPO奖励问题,提出LenGuard-GPC框架,通过比较标准与引导提示下预测分布得KL散度作奖励信号,并引入阶段长度奖励,提升了准确率且缩短了平均响应长度。
RxBrain:具有联合语言-视觉推理与想象的具身认知基础模型
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI
AI总结 研究提出具身认知基础模型RxBrain,采用统一多模态架构,通过构建自动管道训练,引入RxBrain-Bench评估,能保持具身理解和生成能力,扩展到连续机器人动作生成,为具身认知基础模型发展奠定基础。
OpenGround:基于规划的开放世界3D视觉定位在线感知
机构 * Nanjing University, School of Intelligent Science and Technology(南京大学智能科学与技术学院) ; China Mobile Zijin Innovation Institute(中国移动紫金创新院)
专题命中 视觉空间推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI
AI总结 针对开放世界3D视觉定位中现有方法的局限,提出OpenGround框架,集成任务链规划与上下文引导感知,还构建OpenTarget数据集。实验表明其在多个数据集上性能优异,在开放世界评估中有显著提升。
Comments ECCV2026, 46 pages, 13 figures, 15 tables
EVLA:一种用于物理接地驾驶推理与控制的电感知多模态助手
机构 * College of Computer Science and Technology(计算机科学与技术学院)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 提出EVLA框架,融合视觉、文本与实时电动动力总成状态,通过统一共状态编码器和电感知结构化推理链,生成上下文感知且能量最优的驾驶决策,在驾驶问答基准上显著优于基线模型。
Comments 17 pages
Vesta: 一种通用具身推理模型
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of California, San Diego(加州大学圣地亚哥分校) ; The Hong Kong Polytechnic University(香港理工大学) ; University of Michigan(密歇根大学) ; Nanyang Technological University(南洋理工大学) ; Johns Hopkins University(约翰霍普金斯大学) ; University of Tübingen(图宾根大学)
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI
AI总结 提出统一的基础模型Vesta,整合定位、空间推理、导航和长时规划能力,通过大规模空间感知语料库和简单多模态记忆机制,在多个基准上平均优于专用模型20%以上,在真实机器人任务中成功率提升35%。
空间视觉语言模型中的双路径推理强化
机构 * The University of Hong Kong(香港大学) ; NVIDIA(英伟达) ; University of California, San Diego(加州大学圣迭戈分校)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 提出SR-REAL框架,通过强化学习融合语言推理和3D检测推理两条路径,显著提升空间VLM在复杂几何推理任务中的性能。
ParkingTransformer: 基于大语言模型增强的端到端自主泊车轨迹规划
机构 * School of Instrument Science and Engineering, Southeast University(东南大学仪器科学与工程学院) ; School of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) ; College of Transportation, Shandong University of Science and Technology(山东科技大学交通学院) ; National University of Defense Technology(国防科技大学)
专题命中 视觉空间推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI
AI总结 提出ParkingTransformer框架,利用多视角感知和大语言模型场景理解能力,结合轨迹查询与隐状态特征,直接输出规划轨迹,无需密集BEV表示,通过3D位置编码、固定窗口流机制和粗到细解码策略提升性能,在CARLA和实车实验中验证有效性。
Foresight: 关于导航关键线索的迭代推理
机构 * UT Austin(德克萨斯大学奥斯汀分校) ; FieldAI
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI
AI总结 提出Foresight框架,利用微调VLM交替提出和批评图像空间运动计划,通过人类反馈学习奖励模型进行强化学习后训练,实现无地图导航中稀疏语言指令下的迭代运动优化,任务成功率提升37%。
Comments 22 pages, 10 figures, 3 tables
MIRAGE: 具有隐式推理和生成世界模型的移动智能体
机构 * Beihang University(北京航空航天大学) ; Northwestern Polytechnical University(西北工业大学) ; Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; National University of Singapore(新加坡国立大学) ; Peking University(北京大学)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 提出MIRAGE框架,通过从显式推理轨迹学习连续潜在表示,使移动智能体能够内部推理并预测未来屏幕状态,在减少生成token的同时提升执行效率。
视觉语言模型后训练中推理与感知的非对称优化研究
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 通过合成任务诊断发现,后训练中推理提升显著优于感知,SFT源于感知token少导致训练信号弱,RL源于奖励耦合,提出动态重加权损失和感知奖励可缓解不平衡并提升端到端性能。
Comments Project: https://asymmetric-vlm-post-training.github.io/
MACReD:一种用于反应图解解析的多智能体协作推理框架
机构 * University of Science ; Technology of China \& iFLYTEK Co., Ltd. Hefei China ; Technology of China \& iFLYTEK Co., Ltd.
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI
AI总结 提出MACReD分层多智能体框架,通过协调分子感知、箭头理解、文本提取和反应重建等专用智能体,在统一VLM引导架构下实现化学图解解析,在RxnScribe基准上达到最优性能。
Comments Preprint. Code is available at https://github.com/TC9905/MACReD
Seg-Agent: 无训练语言引导分割的测试时多模态推理
机构 * School of Computing and Information Technology(计算与信息科技学院) ; Great Bay University(大湾大学) ; Hangzhou International Innovation Institute(杭州国际创新研究院) ; Beihang University(北航大学) ; Department of Computing(计算系) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 Seg-Agent提出无训练的多模态推理框架,通过生成-选择-细化三阶段循环实现视觉区域分割,无需参数更新即可达到与训练方法相当的性能。
大语言模型代理能否应对灾难?评估异构地理空间推理在紧急行动中的基准测试
机构 * The University of Tokyo(东京大学) ; RIKEN AIP(理化学研究所AIP) ; Waseda University(早稻田大学) ; Stanford University(斯坦福大学)
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI
AI总结 本文提出DORA基准测试,评估大语言模型在灾难响应中的端到端流程,揭示了灾难领域接地、工具选择瓶颈和组合脆弱性等挑战。
Comments DORA stress-tests LLM agents on real-world disaster operations that demand comprehensive orchestration of 108 specialized tools over heterogeneous geospatial data
学习高效的视觉推理路径
机构 * Fudan University(复旦大学) ; University of California, Davis(加州大学戴维斯分校)
专题命中 视觉空间推理 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL
AI总结 本文提出AVR框架,通过分解视觉推理为三个认知功能,动态选择响应格式,减少推理冗余,提升效率。
CharTool: 集成工具的视觉推理用于图表理解
机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院X-LANCE实验室) ; Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室) ; Suzhou Laboratory(苏州实验室) ; AISpeech Co., Ltd.(思必驰科技股份有限公司)
专题命中 视觉空间推理 :reasoning(title,abstract);math reasoning(abstract);分类 cs.AI
AI总结 本文提出CharTool,通过集成工具提升多模态大语言模型对图表的理解能力,通过双重数据管道和代理强化学习,在六个图表基准测试中取得显著提升。
Pixelis:在像素中推理,从看见到行动
机构 * University of Reading(雷丁大学)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 Pixelis通过在像素空间中直接操作图像和视频,结合执行操作和学习后果,提升视觉智能的通用性和物理基础,实现基于行动的多模态感知。
Comments 28pages, 16figures, 18tables
3D-Layout-R1: 为语言指导的空间编辑进行结构化推理
机构 * NVIDIA ; UMass Amherst(马萨诸塞大学阿默斯特分校)
专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract);分类 cs.AI
AI总结 本文提出一种结构化推理框架,通过场景图推理实现文本条件下的空间布局编辑,提升空间关系的可解释性和控制性,并在布局编辑基准测试中取得显著改进。
空间中的注意:VLM头部在空间推理中的功能角色
机构 * The University of Melbourne(墨尔本大学) ; Australian National University(澳大利亚国立大学) ; Fudan University(复旦大学) ; Monash University(莫纳什大学)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 本文研究VLM中注意力头部在空间推理中的作用,通过机制可解释性视角分析其功能,提出CogVSR数据集并开发探针框架,揭示注意力头部在空间推理中的稀疏性和关键作用。
ViSA增强的空中视觉语言导航:一种增强视觉空间推理能力的空中视觉语言导航框架
机构 * Tianmushan Laboratory, Beihang University(北航之梦实验室,北京航空航天大学) ; Hangzhou International Innovation Institute, Beihang University(杭州国际创新研究院,北京航空航天大学) ; Foshan Graduate School of Innovation, Northeastern University(佛山创新研究生学院,东北大学) ; School of Aeronautic Science and Engineering, Beihang University(航空科学与工程学院,北京航空航天大学) ; Faculty of Robot Science and Engineering, Northeastern University(机器人科学与工程学院,东北大学)
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI
AI总结 ViSA增强框架通过结构化视觉提示提升空中VLN的空间推理能力,显著提高成功率,为该领域提供有力支持。
Comments 8 pages
情境至关重要!利用LLMs进行可行的3D场景规划
机构 * Department of Computer, Automation and Management Engineering, Sapienza University of Rome(Sapienza大学计算机、自动化与管理工程系) ; Department of Electronics and Automation, Mohamed Khider University of Biskra(Mohamed Khider大学电子与自动化系) ; International University of Rome UNINT, Rome(罗马国际大学UNINT)
专题命中 视觉空间推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI
AI总结 ContextMatters结合LLMs与经典规划,通过分层目标放松提升3D场景规划的成功率