Dialectical language model evaluation: An initial appraisal of the commonsense spatial reasoning abilities of LLMs
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
Comments 11 pages in main paper + 71 pages in appendix
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
Comments 11 pages in main paper + 71 pages in appendix
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
Journal ref Eleventh International Conference on Learning Representations (ICLR) 2023
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
Comments CVPR 2023. Project page: https://vis-www.cs.umass.edu/3d-clr/
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
Comments NAACL 2022 (13 pages)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
Comments ICLR 2022; Code: https://github.com/NVlabs/RelViT
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
Comments ICLR 2022
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.LG
Comments Accepted to ICCV 2021. PaperId : ICCV2021-10857 Copyright transferred to IEEE ICCV. DOI will be updated later
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
Comments Updated version
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
Comments NAACL 2021
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
Comments Accepted to CVPR 2021. Resources including the TRANCE dataset and the code can be found at our homepage https://hongxin2019.github.io/TVR
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
Comments Accepted to EMNLP'20 Findings
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
Comments to appear in EMNLP 2018
前沿大语言模型在空间意象推理中的局限性
机构 * Institute of Mathematics and Statistics – University of São Paulo(数学统计研究所 – 圣保罗大学)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本研究通过引入外部“意象模块”辅助3D模型旋转任务,发现即使外包整体3D状态维护,前沿模型仍缺乏基础视觉空间原语,导致准确率最高仅62.5%。
Comments 25 pages. v2: Title updated; added a section on object/spatial imagery and propositional reasoning; added new experimental results for the single-object rotation probe
通过文本表示引导推理来解锁多模态大语言模型中的空间推理
机构 * College of AI, Tsinghua University, Beijing, China(清华大学人工智能学院,北京,中国) ; Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) ; The University of Tokyo, Tokyo, Japan(东京大学,东京,日本)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出TRACE方法,通过生成文本表示来提升多模态大语言模型的空间推理能力,实验表明其在多个基准测试中表现优异。
Comments Accepted to ACL 2026. 22 pages, 6 figures, 10 tables. Project page: https://trace-reasoning.github.io
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI
Comments 10 pages,a detail and effective benchmark for spatial reasoning
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI
Comments 10 figures. 8 pages. Accepted for presentation at 36th International Workshop on Qualitative Reasoning (QR-23), in conjunction with ECAI2023 in Krakow, Poland
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI
Comments Technical Report for Humane-AI micro-project "Multi-Relational Contextual Reasoning for Complex Scene Generation for Autonomous Vehicle Data". 23 pages, 6 figures
通过分布偏移下的分阶段偏好优化减少视觉-语言模型中的幻觉
机构 * Meta AI
专题命中 视觉空间推理 :reasoning(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出分阶段偏好优化框架,通过构建针对幻觉问题的数据集,提升视觉-语言模型的 grounded reasoning,减少幻觉并提高响应信息量。
CoLT: 教会多模态模型通过潜在思维链进行思考
机构 * Nanyang Technological University(南洋理工大学) ; Shanghai Jiao Tong University(上海交通大学) ; NKIARI ; AAIS & VCIP, Nankai University(南开大学AAIS & VCIP) ; Tianjin University(天津大学)
专题命中 视觉空间推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)
AI总结 提出CoLT框架,用潜在思维链代替文本推理,通过前向和后向解码器监督及内部监督实现高效多模态推理,在8个基准上优于现有方法,推理时间减少10.1倍。
Comments Accepted by ECCV2026. Code is available at https://github.com/hulianyuyy/CoLT
面向相机鲁棒的3D定位:基于方程的工具使用用于MLLMs
机构 * Nanyang Technological University(南洋理工大学) ; DAMO Academy, Alibaba Group(阿里集团大模型研究院) ; HuPan Lab(虎派实验室) ; Alibaba Group(阿里集团)
专题命中 视觉空间推理 :chain-of-thought(abstract,abstract_cn);CoT(abstract,abstract_cn)
AI总结 本文提出了一种基于方程的工具使用框架,通过将空间工具作为公式变量重新利用,以解决多模态大语言模型(MLLMs)中3D定位的相机固有模糊问题,从而在3D物体检测和3D视觉定位任务中取得了显著提升。
AdaTooler-V:面向图像和视频的自适应工具使用
机构 * MMLab, CUHK(香港中文大学MML实验室) ; THU(清华大学) ; SJTU(上海交通大学) ; DB Group, CUHK(香港中文大学DB小组) ; UCF(佛罗里达大学) ; Sangfor(Sangfor公司) ; JMU(约翰·霍普金斯大学)
专题命中 视觉空间推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)
AI总结 本文提出AdaTooler-V,通过自适应工具使用提升多模态大语言模型的视觉推理能力,通过强化学习算法和定制数据集优化工具调用策略,实验证明其在多种视觉任务中表现优异。
Comments ACL 2026 Findings, Project page: https://github.com/CYWang735/AdaTooler-V
Chat-Scene++: 利用语境丰富的物体识别用于3D大语言模型
机构 * School of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 视觉空间推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)
AI总结 本文提出Chat-Scene++框架,通过将3D场景表示为语境丰富的物体序列,提升细粒度物体定位和上下文推理能力,在五个3D视觉语言基准测试中取得最佳性能。
SGG-R$^{\rm 3}$: 从单token预测到端到端无偏场景图生成
机构 * School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) ; Zhongguancun Academy(中关村学院)
专题命中 视觉空间推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)
AI总结 本文提出SGG-R$^{\rm 3}$框架,通过结合任务特定的推理过程和强化学习优化,解决场景图生成中的关系稀疏和长尾问题,提升生成效果和泛化能力。
EgoTL:用于长时任务的目视思考链
机构 * UMN(明尼苏达大学) ; TAMU(德克萨斯农工大学) ; Brown University(布朗大学) ; McGill University(麦吉尔大学) ; UT Austin(德克萨斯大学奥斯汀分校) ; Columbia University(哥伦比亚大学) ; Northwestern University(西北大学)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)
AI总结 本文提出EgoTL,通过构建目视思考链管道,提升长时任务中视觉语言模型和世界模型的推理与规划能力,发现基础模型在作为目视助手或开放世界模拟器方面仍有不足。
Comments https://ego-tl.github.io/
AgentVLN:迈向具有代理能力的视觉-语言导航
机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; Shandong University(山东大学) ; Zhejiang University(浙江大学)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);self-correction(abstract)
AI总结 本文提出AgentVLN框架,通过部分可观测半马尔可夫决策过程建模视觉-语言导航,结合VLM-as-Brain范式和跨空间表示映射,解决多级表示不一致问题,实现高效轻量级导航部署。
Comments 19pages, 4 figures
SPAN-Nav: 通用空间感知用于多功能视觉-语言导航
机构 * Peking University(北京大学) ; Galbot ; BAAI(北京人工智能研究院)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)
AI总结 SPAN-Nav通过端到端模型和空间感知机制,在复杂环境中实现高效的视觉-语言导航。
InsightDrive: 用于端到端自动驾驶的洞察场景表示
机构 * College of Surveying and Geo-informatics, Tongji University(同济大学测绘与地理信息学院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Computer Science, Wuhan University(武汉大学计算机学院) ; The School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Great Wall Motor(长城汽车) ; IAIR, Xi’an Jiaotong University(西安交通大学IAIR)
专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)
AI总结 InsightDrive通过结合显式和隐式场景表示,提升自动驾驶轨迹规划的鲁棒性和人类认知一致性。
运动即提示:通过运动引导的跨帧视觉提示增强多模态大语言模型的运动推理能力
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本文针对多模态大语言模型处理视频时丢失帧间关键运动信息的问题,提出Motion-as-Prompt框架,通过标记轨迹增强视觉提示,在CLEVRER等数据集上提升GPT-5.5的运动推理准确率且不影响非运动理解
GAM-Agent:面向复杂视觉推理的博弈论与感知不确定性感知协作框架
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI
AI总结 该研究提出GAM-Agent博弈论多智能体框架,通过基础感知智能体与关键验证智能体的非零和博弈及不确定性感知协作,在四个视觉推理基准上显著提升了中小及强规模VLM的性能,为可靠可解释多模态推理提供了新路径。
Comments Accepted at NeurIPS 2025. Code available at https://github.com/jushengzhang/Gam-Agent