CL-CoTNav: Closed-Loop Hierarchical Chain-of-Thought for Zero-Shot Object-Goal Navigation with Vision-Language Models
专题命中 视觉空间推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract)
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 视觉空间推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)
多语言视觉语言模型是否同样具备推理能力?一种针对印度语言的跨语言视觉推理审计
机构 * Indian Institute of Information Technology, Raichur(印度信息技术学院赖丘尔分校)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG
AI总结 本文通过将MathVista、ScienceQA和MMMU的980道题翻译成印度语言,评估了8种VLM在七种语言中的表现,发现切换至印度语言时准确率下降9.8-25个百分点,且达罗毗荼语比印欧语下降更多,链式推理反而降低了部分语言的性能。
Comments 16 pages, 10 figures, 6 tables. Code and data: https://github.com/QuantumByte-01/multilingual-vlm-reasoning-audit Dataset: https://huggingface.co/datasets/Swastikr/multilingual-vlm-reasoning
专题命中 视觉空间推理 :reasoning(title,abstract);verifier(abstract);分类 cs.AI、cs.LG
Comments Accepted to the 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop on Efficient Reasoning
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG
Comments Project website: https://relational-reasoning-nav.github.io/; 20 pages, 9 figures, 6 tables
从提示到路面通过时间:代理场景到计划推理中的时间定位
机构 * Computer Science & Engineering Department, German University in Cairo (GUC), Egypt(德国亚历山大大学(GUC)计算机科学与工程系,埃及) ; C-DRiVeS Lab: Cognitive Driving Research in Vehicular Systems, Cairo, Egypt(认知驾驶系统实验室,埃及开罗,C-DRiVeS) ; M.Eng. Robotics Candidate at Deggendorf Institute of Technology, Germany(德国德格多夫技术学院机器人硕士候选人) ; IAV GmbH, Berlin, Germany(德国柏林IAV GmbH公司)
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 本研究探讨了在代理间通信中引入时间条件是否能保持或增强推理的一致性,而不会降低语义或逻辑一致性,并通过BDD-X数据集的curated子集评估了三种具有递增时间整合的规划器架构。结果表明,时间条件改变了推理风格,但并未在标准NLP正确性指标上产生统计显著改进,但定性分析揭示了预测危险推理、稳定纠正行为和战略分歧。
SCoTT:面向数字孪生的无线感知机器人导航战略链式思维任务规划
机构 * Technical University of Munich(慕尼黑技术大学) ; Virginia Tech(弗吉尼亚理工大学)
专题命中 视觉空间推理 :chain-of-thought(title,abstract);planning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出SCoTT框架,利用视觉语言模型优化路径收益与轨迹长度,通过分解搜索问题提升无线约束下的路径规划效率,实验显示其性能接近最优动态规划算法且生成更短轨迹。
Journal ref Asilomar Conference on Signals, Systems, and Computers, 2025
V-REX: 通过问题链进行探索性视觉推理的基准测试
机构 * University of Maryland, College Park(马里兰大学学院市分校) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG
AI总结 提出V-REX基准,通过问题链将多步探索推理分解为规划和遵循能力,评估视觉语言模型在复杂开放任务中的表现。
Comments 28 pages
推理模型不只思考更久,它们的移动方式不同
机构 * Technical University of Denmark(丹麦技术大学) ; Stanford University(斯坦福大学)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG
AI总结 本文研究了推理训练模型在生成链式思维时的轨迹差异,发现通过长度校正后,不同领域中难度与轨迹几何的耦合关系存在显著差异,尤其是在代码领域中,推理训练模型表现出更直接的轨迹和更一致的局部曲率。
Comments Preprint
何时想象以及想象多少:基于世界模型的自适应测试时缩放用于视觉空间推理
机构 * University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校) ; Nanyang Technological University(南洋理工大学)
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出自适应测试时框架AVIC/AVIC-R,通过世界模型选择性调用和缩放视觉想象,在空间推理中平衡准确性与效率,超越GPT-4o等基线。
Comments the first two authors are equally contributed. Project page: https://adaptive-visual-tts.github.io/
CLiViS: 通过语言-视觉协同释放认知地图用于具身视觉推理
机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) ; King Abdullah University of Science and Technology(科廷大学) ; Fudan University(复旦大学)
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 提出CLiViS框架,通过LLM进行高层任务规划并协调VLM驱动的开放世界视觉感知,构建动态认知地图以迭代更新场景上下文,实现无需训练的具身视觉推理。
ETCHR: 通过编辑来澄清和利用推理
机构 * The Chinese University of Hong Kong Shanghai AI Laboratory(香港中文大学上海人工智能实验室) ; Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 针对多模态大语言模型在需要细粒度关注或视角变换的问题上纯文本思维链的瓶颈,提出了一种解耦的图像编辑模型ETCHR,通过两阶段训练(推理模仿和推理增强)弥合语言侧和生成侧差距,无需训练即可插入不同MLLM,在五个任务族上平均Pass@1提升4.61-5.47个百分点。
Comments Code, model and data are open-sourced at https://github.com/InternLM/ETCHR
层次递归推理中的交互局部性
机构 * CyberAgent Inc.(CyberAgent公司)
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG
AI总结 本文提出交互局部性框架,用于测量信息流是否在附近单元或语义段内传输或跨越,通过在HRM和TRM等层次递归推理模型上应用,验证了局部执行与全局规划的可重复测量框架。
揭示过度完备推理轨迹中最小核心的表示几何
机构 * University of Maryland, College Park, USA(马里兰大学学院公园分校)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 研究揭示了过度完备推理轨迹中最小核心的表示几何,通过定义最小核心并提出压缩比、冗余质量等指标,发现平均46%的步骤可被移除且保留原答案,同时最小核心提升了正确-错误轨迹分离度,降低了内在维度,且在不同模型间具有高转移性。
SpatiaLab: 视觉-语言模型能否在真实环境中进行空间推理?
机构 * Computational Intelligence and Operations Laboratory(计算智能与运筹实验室) ; Shahjalal University of Science and Technology(沙赫jalal科技大学) ; BRAC University(BRAC大学) ; North South University(北南大学) ; Monash University(墨尔本大学) ; Qatar Computing Research Institute(卡塔尔计算研究院)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 SpatiaLab通过真实场景下的空间推理任务评估视觉-语言模型的能力,揭示其在复杂空间关系、深度感知和3D几何方面的不足。
Comments Accepted to ICLR 2026 (https://openreview.net/forum?id=fWWUPOb0CT). 92 Pages. 42 Figures and 29 Tables
Journal ref ICLR 2026
CompassLLM: 一种面向流行路径查询的多智能体方法
机构 * Bangladesh University of Engineering and Technology(孟加拉工程科技大学) ; University of Utah(犹他大学) ; Monash University(莫纳什大学) ; Qatar Computing Research Institute(卡塔尔计算研究所)
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 CompassLLM通过多智能体框架解决流行路径查询问题,结合空间推理能力提升搜索和生成性能,实验显示其在准确性和成本效益方面表现优异。
思维的几何学:大规模语言模型中规模如何重构推理
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 研究揭示大规模语言模型中推理能力的几何重构特性,通过分析不同领域和规模的推理轨迹,发现神经规模定律触发领域特定的相变而非均匀能力提升,提出神经推理算子并识别出跨领域和规模的振荡特征。
Comments The theoretical framework has been shown to be wrong and should not be followed for future research direction
CubeBench: 在部分观察下诊断交互式、长周期空间推理
机构 * THU(清华大学) ; Princeton(普林斯顿大学) ; SJTU & UMich(上海交通大学 & 密歇根大学) ; HKU(香港大学)
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 CubeBench通过魔方基准评估LLM在部分观察下的空间推理和长周期任务能力,揭示LLM在长期规划中的根本缺陷。
Comments Webpage: https://cubebench.c7w.tech/
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
Comments Accepted to NeurIPS 2025 (Thirty-ninth Conference on Neural Information Processing Systems)
机构 * University of Waterloo(多伦多大学) ; Hong Kong University of Science and Technology(香港科技大学) ; University of Science and Technology of China(中国科学技术大学) ; Vector Institute(向量研究所)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
Comments Project Page: https://tiger-ai-lab.github.io/Pixel-Reasoner/, Hands-on Demo: https://huggingface.co/spaces/TIGER-Lab/Pixel-Reasoner
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
Comments 24 pages, 3 figures, 9 tables
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG
Comments In submission
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG
机构 * Harvard University(哈佛大学) ; University of Chicago(芝加哥大学) ; Northeastern University(东北大学) ; Google DeepMind(谷歌DeepMind)
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
Comments Accepted by TPAMI 2025
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
Comments CVPR 2025. https://visco-benchmark.github.io/
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI
专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI
Comments https://github.com/declare-lab/Emma-X, https://huggingface.co/declare-lab/Emma-X
专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI
Comments COLM 2024. https://github.com/apple/ml-rpm-bench