arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3328 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3328 篇

2304.11164 2023-04-25 cs.CL cs.AI 81%

Dialectical language model evaluation: An initial appraisal of the commonsense spatial reasoning abilities of LLMs

Anthony G Cohn, Jose Hernandez-Orallo

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments 11 pages in main paper + 71 pages in appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.12810 2023-03-28 cs.CL cs.AI 81%

Are LLMs the Master of All Trades? : Exploring Domain-Agnostic Reasoning Skills of LLMs

Shrivats Agrawal

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.04928 2023-03-22 cs.AI cs.LG cs.NE cs.SC 81%

GAMR: A Guided Attention Model for (visual) Reasoning

Mohit Vaishnav, Thomas Serre

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

Journal ref Eleventh International Conference on Learning Representations (ICLR) 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.11327 2023-03-21 cs.CV cs.AI cs.LG cs.RO 81%

3D Concept Learning and Reasoning from Multi-View Images

Yining Hong, Chunru Lin, Yilun Du, Zhenfang Chen, Joshua B. Tenenbaum, Chuang Gan

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments CVPR 2023. Project page: https://vis-www.cs.umass.edu/3d-clr/

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.03961 2022-07-11 cs.CL cs.AI cs.CV 81%

CoSIm: Commonsense Reasoning for Counterfactual Scene Imagination

Hyounghun Kim, Abhay Zala, Mohit Bansal

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments NAACL 2022 (13 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.11167 2022-06-14 cs.CV cs.AI cs.LG 81%

RelViT: Concept-guided Vision Transformer for Visual Relational Reasoning

Xiaojian Ma, Weili Nie, Zhiding Yu, Huaizu Jiang, Chaowei Xiao, Yuke Zhu, Song-Chun Zhu, Anima Anandkumar

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments ICLR 2022; Code: https://github.com/NVlabs/RelViT

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.12162 2022-03-01 cs.LG cs.AI cs.CV 81%

Measuring CLEVRness: Blackbox testing of Visual Reasoning Models

Spyridon Mouselinos, Henryk Michalewski, Mateusz Malinowski

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments ICLR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.01934 2021-09-07 cs.CV cs.CL cs.LG 81%

Weakly Supervised Relative Spatial Reasoning for Visual Question Answering

Pratyay Banerjee, Tejas Gokhale, Yezhou Yang, Chitta Baral

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

Comments Accepted to ICCV 2021. PaperId : ICCV2021-10857 Copyright transferred to IEEE ICCV. DOI will be updated later

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.13613 2021-06-08 cs.AI cs.CL 81%

Joint Spatio-Textual Reasoning for Answering Tourism Questions

Danish Contractor, Shashank Goel, Mausam, Parag Singla

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Updated version

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.05832 2021-04-14 cs.CL cs.AI 81%

SpartQA: : A Textual Question Answering Benchmark for Spatial Reasoning

Roshanak Mirzaee, Hossein Rajaby Faghihi, Qiang Ning, Parisa Kordjmashidi

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments NAACL 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.13160 2021-04-05 cs.CV cs.AI cs.LG 81%

Transformation Driven Visual Reasoning

Xin Hong, Yanyan Lan, Liang Pang, Jiafeng Guo, Xueqi Cheng

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

Comments Accepted to CVPR 2021. Resources including the TRANCE dataset and the code can be found at our homepage https://hongxin2019.github.io/TVR

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.05001 2020-10-13 cs.CL cs.AI 81%

Beyond Language: Learning Commonsense from Images for Reasoning

Wanqing Cui, Yanyan Lan, Liang Pang, Jiafeng Guo, Xueqi Cheng

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments Accepted to EMNLP'20 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.01943 2018-09-07 cs.IR cs.AI cs.CL cs.CV 81%

Cascaded Mutual Modulation for Visual Reasoning

Yiqun Yao, Jiaming Xu, Feng Wang, Bo Xu

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

Comments to appear in EMNLP 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26779 2026-06-02 cs.CV cs.AI 80%

Limits of Spatial Imagery Reasoning in Frontier LLM Models

前沿大语言模型在空间意象推理中的局限性

Sergio Y. Hayashi, Nina S. T. Hirata

机构 * Institute of Mathematics and Statistics – University of São Paulo(数学统计研究所 – 圣保罗大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究通过引入外部“意象模块”辅助3D模型旋转任务,发现即使外包整体3D状态维护,前沿模型仍缺乏基础视觉空间原语,导致准确率最高仅62.5%。

Comments 25 pages. v2: Title updated; added a section on object/spatial imagery and propositional reasoning; added new experimental results for the single-object rotation probe

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23404 2026-04-21 cs.CV cs.CL 80%

Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning

通过文本表示引导推理来解锁多模态大语言模型中的空间推理

Jiacheng Hua, Yishu Yin, Yuhang Wu, Tai Wang, Yifei Huang, Miao Liu

机构 * College of AI, Tsinghua University, Beijing, China(清华大学人工智能学院,北京,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) The University of Tokyo, Tokyo, Japan(东京大学,东京,日本)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出TRACE方法,通过生成文本表示来提升多模态大语言模型的空间推理能力,实验表明其在多个基准测试中表现优异。

Comments Accepted to ACL 2026. 22 pages, 6 figures, 10 tables. Project page: https://trace-reasoning.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13782 2025-11-19 cs.AI 80%

Imagine in Space: Exploring the Frontier of Spatial Intelligence and Reasoning Efficiency in Vision Language Models

Xiaoxing Lian, Aidong Yang, Jun Zhu, Peng Wang, Yue Zhang

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

Comments 10 pages,a detail and effective benchmark for spatial reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.15577 2023-09-28 cs.AI 80%

An Evaluation of ChatGPT-4's Qualitative Spatial Reasoning Capabilities in RCC-8

Anthony G Cohn

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

Comments 10 figures. 8 pages. Accepted for presentation at 36th International Workshop on Qualitative Reasoning (QR-23), in conjunction with ECAI2023 in Krakow, Poland

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.02255 2023-05-04 cs.AI cs.LO 80%

Contextual Reasoning for Scene Generation (Technical Report)

Loris Bozzato, Thomas Eiter, Rafael Kiesel, Daria Stepanova

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

Comments Technical Report for Humane-AI micro-project "Multi-Relational Contextual Reasoning for Complex Scene Generation for Autonomous Vehicle Data". 23 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16411 2026-08-12 cs.CV cs.AI cs.CL cs.DB cs.LG 版本更新 80%

Grounded Post-Training with Hard Examples for Reducing Hallucination in Multimodal Large Language Models

通过分布偏移下的分阶段偏好优化减少视觉-语言模型中的幻觉

Qinwu Xu

机构 * Meta AI

专题命中 视觉空间推理 :reasoning(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出分阶段偏好优化框架,通过构建针对幻觉问题的数据集,提升视觉-语言模型的 grounded reasoning,减少幻觉并提高响应信息量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31986 2026-08-04 cs.CV 版本更新 80%

CoLT: Teaching Multi-Modal Models to Think with Chain of Latent Thoughts

CoLT: 教会多模态模型通过潜在思维链进行思考

Lianyu Hu, Shengqian Qin, Zeqin Liao, Qing Guo, Liang Wan, Wei Feng, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) NKIARI AAIS & VCIP, Nankai University(南开大学AAIS & VCIP) Tianjin University(天津大学)

专题命中 视觉空间推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 提出CoLT框架,用潜在思维链代替文本推理,通过前向和后向解码器监督及内部监督实现高效多模态推理,在8个基准上优于现有方法,推理时间减少10.1倍。

Comments Accepted by ECCV2026. Code is available at https://github.com/hulianyuyy/CoLT

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19528 2026-05-20 cs.CV 80%

Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs

面向相机鲁棒的3D定位:基于方程的工具使用用于MLLMs

Xueying Jiang, Wenhao Li, Quanhao Qian, Deli Zhao, Shijian Lu, Gongjie Zhang, Ran Xu

机构 * Nanyang Technological University(南洋理工大学) DAMO Academy, Alibaba Group(阿里集团大模型研究院) HuPan Lab(虎派实验室) Alibaba Group(阿里集团)

专题命中 视觉空间推理 :chain-of-thought(abstract,abstract_cn);CoT(abstract,abstract_cn)

AI总结 本文提出了一种基于方程的工具使用框架,通过将空间工具作为公式变量重新利用,以解决多模态大语言模型(MLLMs)中3D定位的相机固有模糊问题,从而在3D物体检测和3D视觉定位任务中取得了显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16918 2026-04-29 cs.CV 80%

AdaTooler-V: Adaptive Tool-Use for Images and Videos

AdaTooler-V:面向图像和视频的自适应工具使用

Chaoyang Wang, Kaituo Feng, Dongyang Chen, Zhongyu Wang, Zhixun Li, Sicheng Gao, Meng Meng, Xu Zhou, Manyuan Zhang, Yuzhang Shang, Xiangyu Yue

机构 * MMLab, CUHK(香港中文大学MML实验室) THU(清华大学) SJTU(上海交通大学) DB Group, CUHK(香港中文大学DB小组) UCF(佛罗里达大学) Sangfor(Sangfor公司) JMU(约翰·霍普金斯大学)

专题命中 视觉空间推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出AdaTooler-V,通过自适应工具使用提升多模态大语言模型的视觉推理能力,通过强化学习算法和定制数据集优化工具调用策略,实验证明其在多种视觉任务中表现优异。

Comments ACL 2026 Findings, Project page: https://github.com/CYWang735/AdaTooler-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27507 2026-04-28 cs.CV 80%

Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM

Chat-Scene++: 利用语境丰富的物体识别用于3D大语言模型

Haifeng Huang, Yilun Chen, Zehan Wang, Jiangmiao Pang, Zhou Zhao

机构 * School of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉空间推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出Chat-Scene++框架,通过将3D场景表示为语境丰富的物体序列,提升细粒度物体定位和上下文推理能力,在五个3D视觉语言基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07961 2026-04-24 cs.CV 80%

SGG-R$^{\rm 3}$: From Next-Token Prediction to End-to-End Unbiased Scene Graph Generation

SGG-R$^{\rm 3}$: 从单token预测到端到端无偏场景图生成

Jiaye Feng, Qixiang Yin, Yuankun Liu, Tong Mo, Weiping Li

机构 * School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) Zhongguancun Academy(中关村学院)

专题命中 视觉空间推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出SGG-R$^{\rm 3}$框架,通过结合任务特定的推理过程和强化学习优化,解决场景图生成中的关系稀疏和长尾问题,提升生成效果和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09535 2026-04-13 cs.CV 80%

EgoTL: Egocentric Think-Aloud Chains for Long-Horizon Tasks

EgoTL:用于长时任务的目视思考链

Lulin Liu, Dayou Li, Yiqing Liang, Sicong Jiang, Hitesh Vijay, Hezhen Hu, Xuhai Xu, Zirui Liu, Srinivas Shakkottai, Manling Li, Zhiwen Fan

机构 * UMN(明尼苏达大学) TAMU(德克萨斯农工大学) Brown University(布朗大学) McGill University(麦吉尔大学) UT Austin(德克萨斯大学奥斯汀分校) Columbia University(哥伦比亚大学) Northwestern University(西北大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

AI总结 本文提出EgoTL,通过构建目视思考链管道,提升长时任务中视觉语言模型和世界模型的推理与规划能力,发现基础模型在作为目视助手或开放世界模拟器方面仍有不足。

Comments https://ego-tl.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17670 2026-03-19 cs.RO 80%

AgentVLN: Towards Agentic Vision-and-Language Navigation

AgentVLN:迈向具有代理能力的视觉-语言导航

Zihao Xin, Wentong Li, Yixuan Jiang, Ziyuan Huang, Bin Wang, Piji Li, Jianke Zhu, Jie Qin, Shengjun Huang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Shandong University(山东大学) Zhejiang University(浙江大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);self-correction(abstract)

AI总结 本文提出AgentVLN框架,通过部分可观测半马尔可夫决策过程建模视觉-语言导航,结合VLM-as-Brain范式和跨空间表示映射,解决多级表示不一致问题,实现高效轻量级导航部署。

Comments 19pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09163 2026-03-11 cs.RO 80%

SPAN-Nav: Generalized Spatial Awareness for Versatile Vision-Language Navigation

SPAN-Nav: 通用空间感知用于多功能视觉-语言导航

Jiahang Liu, Tianyu Xu, Jiawei Chen, Lu Yue, Jiazhao Zhang, Zhiyong Wang, Minghan Li, Qisheng Zhao, Anqi Li, Qi Su, Zhizheng Zhang, He Wang

机构 * Peking University(北京大学) Galbot BAAI(北京人工智能研究院)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

AI总结 SPAN-Nav通过端到端模型和空间感知机制,在复杂环境中实现高效的视觉-语言导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13047 2025-12-02 cs.CV 80%

InsightDrive: Insight Scene Representation for End-to-End Autonomous Driving

InsightDrive: 用于端到端自动驾驶的洞察场景表示

Ruiqi Song, Xianda Guo, Yanlun Peng, Qinggong Wei, Hangbin Wu, Long Chen

机构 * College of Surveying and Geo-informatics, Tongji University(同济大学测绘与地理信息学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Computer Science, Wuhan University(武汉大学计算机学院) The School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Great Wall Motor(长城汽车) IAIR, Xi’an Jiaotong University(西安交通大学IAIR)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

AI总结 InsightDrive通过结合显式和隐式场景表示,提升自动驾驶轨迹规划的鲁棒性和人类认知一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11655 2026-08-13 cs.CV cs.AI 新提交 79%

Motion-as-Prompt: Enhancing Motion Reasoning in Multimodal Large Language Models via Motion-Guided Cross-Frame Visual Prompting

运动即提示:通过运动引导的跨帧视觉提示增强多模态大语言模型的运动推理能力

Xikai Sun, Kebin Liu, Haotian Wang, Li Liu, Xu Wang, Yunhao Liu

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文针对多模态大语言模型处理视频时丢失帧间关键运动信息的问题,提出Motion-as-Prompt框架,通过标记轨迹增强视觉提示,在CLEVRER等数据集上提升GPT-5.5的运动推理准确率且不影响非运动理解

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23399 2026-08-12 cs.AI 版本更新 79%

GAM-Agent: Game-Theoretic and Uncertainty-Aware Collaboration for Complex Visual Reasoning

GAM-Agent:面向复杂视觉推理的博弈论与感知不确定性感知协作框架

Jusheng Zhang, Yijia Fan, Wenjun Lin, Ruiqi Chen, Haoyi Jiang, Wenhao Chai, Jian Wang, Keze Wang

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究提出GAM-Agent博弈论多智能体框架,通过基础感知智能体与关键验证智能体的非零和博弈及不确定性感知协作,在四个视觉推理基准上显著提升了中小及强规模VLM的性能,为可靠可解释多模态推理提供了新路径。

Comments Accepted at NeurIPS 2025. Code available at https://github.com/jushengzhang/Gam-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏