arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3328 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3328 篇

2505.24273 2026-08-11 cs.AI 版本更新 85%

How Much Backtracking is Enough? Exploring the Interplay of SFT and RL in Enhancing LLM Reasoning

回溯应达到何种程度?探索SFT与RL在增强大语言模型推理能力中的相互作用

Hongyi James Cai, Junlin Wang, Xiaoyin Chen, Bhuwan Dhingra

机构 * Duke University(杜克大学) Mila - Quebec AI Institute(魁北克人工智能研究所)

专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);分类 cs.AI

AI总结 本研究探索SFT与RL在LLM推理中的相互作用,提出回溯是关键算子,发现最优回溯深度随任务难度变化,引入以回溯为核心的训练方案,证实合理回溯可提升模型推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04759 2026-08-06 cs.CV cs.CL 新提交 85%

Trace, Verify, and Correct: A Training-Free Framework for Spatial Reasoning in Multimodal LLMs

追踪、验证与修正:一种用于多模态大语言模型空间推理的无训练框架

Yang Yang, Jiawei Chen, Tairan Chen, Zhaoxia Yin

机构 * East China Normal University(华东师范大学) Zhongguancun Academy(中关村学院) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract,abstract_cn);分类 cs.CL

AI总结 针对多模态大语言模型空间推理的错误传播问题,提出无训练的追踪-验证-修正框架,构建空间证据图并评估证据可靠性,在15种模型-数据集设置下平均准确率达68.94%,优于基线。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28890 2026-05-29 cs.CR cs.LG 85%

Echoes within the Reasoning: Stealthy and Effective Watermarking via Chain of Thought

推理中的回声:通过思维链实现隐蔽且有效的数字水印

Jiacheng Lu, Yiming Li, Tao Song, Weijian Wang, Wenjie Qu, Haibing Guan, Jiaheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院) Nanyang Technological University, Singapore(南洋理工大学) National University of Singapore, Singapore(新加坡国立大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);verifier(abstract);分类 cs.LG

AI总结 提出BiCoT框架,通过将水印嵌入推理轨迹的内部几何结构,并利用基于Top-logprob的黑盒验证器RSR,在不影响推理保真度的前提下实现鲁棒的水印检测。

Comments This paper is accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06803 2026-04-21 cs.CL cs.CV 85%

Forest Before Trees: Latent Superposition for Efficient Visual Reasoning

森林在树之前:用于高效视觉推理的潜在叠加

Yubo Wang, Juntian Zhang, Yichen Wu, Yankai Lin, Nils Lukas, Yuhan Liu

机构 * MBZUAI Fudan University(复旦大学) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Harvard University(哈佛大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出Laser方法,通过动态窗口对齐学习实现视觉推理的'森林在树之前'认知层次,提升模型在保持全局特征叠加的同时,实现高效且可解释的视觉推理。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08476 2026-04-10 cs.CV cs.AI 85%

Faithful GRPO: Improving Visual Spatial Reasoning in Multimodal Language Models via Constrained Policy Optimization

可信的GRPO:通过约束策略优化提升多模态语言模型的视觉空间推理

Sai Srinivas Kancheti, Aditya Kanade, Rohit Sinha, Vineeth N Balasubramanian, Tanuja Ganu

机构 * IIT Hyderabad(印度理工学院海得拉巴分校) Microsoft Research(微软研究院)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出Faithful GRPO,通过约束策略优化提升多模态模型的空间推理质量,减少推理不一致率并提升视觉 grounding 评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05497 2026-04-08 cs.AI cs.CV 85%

Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models

Thinking Diffusion: 通过惩罚和引导在扩散多模态语言模型中抑制和引导视觉推理

Keuntae Kim, Mingyu Kang, Yong Suk Choi

机构 * Department of Computer Science, Hanyang University(汉阳大学计算机科学系) Department of Artificial Intelligence, Hanyang University(汉阳大学人工智能系)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文针对扩散多模态语言模型在视觉推理中生成过早答案的问题,提出位置与步数惩罚和视觉推理引导方法,提升推理准确率并加快推理速度。

Comments CVPR 2026 - main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02991 2026-04-03 cs.CV cs.AI 85%

Towards Faithful Reasoning in Comics for Small MLLMs

面向小规模MLLMs的漫画中忠实推理方法

Chengcheng Feng, Haojie Yin, Yucheng Jin, Kaizhu Huang

机构 * Duke Kunshan University(昆山杜克大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出一种两阶段框架,通过MoCoT和VERA提升小规模MLLMs在漫画理解中的推理忠实性,实验表明在4B参数范围内表现优异,优于7B基线,提升四个小模型12.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23945 2026-03-02 cs.CV cs.AI cs.MM 85%

PointCoT: A Multi-modal Benchmark for Explicit 3D Geometric Reasoning

PointCoT: 一种用于显式3D几何推理的多模态基准

Dongxu Zhang, Yiding Sun, Pengcheng Li, Yumou Liu, Hongqiang Lin, Haoran Xu, Xiaoxuan Mu, Liang Lin, Wenbiao Yan, Ning Yang, Chaowei Fang, Juanjuan Zhao, Jihua Zhu, Conghui He, Cheng Tan

机构 * Xi'an Jiaotong University(西安交通大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Institute of Automation, CASIA(中国科学院自动化研究所) Taiyuan University of Technology(太原理工大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 PointCoT通过显式链式推理提升3D几何推理能力,提出多模态基准和双流架构,实现对3D点云的高精度理解与推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21619 2026-02-26 cs.CL 85%

When More Is Less: A Systematic Analysis of Spatial and Commonsense Information for Visual Spatial Reasoning

更多未必更好:对视觉空间推理中空间与常识信息的系统分析

Muku Akasaka, Soyeon Caren Han

机构 * The University of Melbourne(墨尔本大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本文通过系统分析发现,过多信息未必提升视觉空间推理性能,针对性单空间提示和精确空间定位可提高准确性。

Comments 5 pages, 6 figures, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12159 2026-02-13 cs.RO cs.AI 85%

3DGSNav: Enhancing Vision-Language Model Reasoning for Object Navigation via Active 3D Gaussian Splatting

3DGSNav: 通过主动3D高斯散射增强视觉-语言模型的物体导航

Wancai Zheng, Hao Chen, Xianlong Lu, Linlin Ou, Xinyi Yu

机构 * Zhejiang University of Technology, Hangzhou, China(浙江工业大学,杭州,中国) Zhejiang University, Hangzhou, China(浙江大学,杭州,中国)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 3DGSNav通过主动3D高斯散射提升视觉-语言模型的物体导航能力,结合结构化视觉提示和链式推理,实现高效且可靠的导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21656 2026-01-06 cs.CV cs.CL 85%

Fine-Grained Preference Optimization Improves Spatial Reasoning in VLMs

细粒度偏好优化提升视觉语言模型的空间推理能力

Yifan Shen, Yuanzhe Liu, Jingyuan Zhu, Xu Cao, Xiaofeng Zhang, Yixiao He, Wenming Ye, James Matthew Rehg, Ismini Lourentzou

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 细粒度偏好优化方法SpatialReasoner-R1通过改进空间推理能力,在空间推理任务中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20164 2025-12-16 cs.CL 85%

Thinking with Visual Abstract: Enhancing Multimodal Reasoning via Visual Abstraction

通过视觉抽象思考:通过视觉抽象增强多模态推理

Dairu Liu, Ziyue Wang, Minyuan Ruan, Fuwen Luo, Chi Chen, Peng Li, Yang Liu

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 通过引入视觉抽象思考范式,提升多模态大语言模型在视觉感知和推理任务中的性能,实现更高效的视觉推理机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01174 2025-12-02 cs.CL 85%

DrawingBench: Evaluating Spatial Reasoning and UI Interaction Capabilities of Large Language Models through Mouse-Based Drawing Tasks

DrawingBench:通过基于鼠标绘制的任务评估大语言模型的空间推理和UI交互能力

Hyunjun Kim, Sooyoung Ryu

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);self-correction(abstract);分类 cs.CL

AI总结 DrawingBench通过基于鼠标绘制的任务评估大语言模型的空间推理和UI交互能力,揭示了模型在复杂场景中的表现及外部监督的重要性。

Comments AAAI 2026 TrustAgent Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08708 2025-11-24 cs.RO cs.AI cs.CV 85%

PhyBlock: A Progressive Benchmark for Physical Understanding and Planning via 3D Block Assembly

PhyBlock:通过3D积木组装实现物理理解和规划的渐进性基准

Liang Ma, Jiajun Wen, Min Lin, Rongtao Xu, Xiwen Liang, Bingqian Lin, Jun Ma, Yongxin Wang, Ziming Wei, Haokun Lin, Mingfei Han, Meng Cao, Bokui Chen, Ivan Laptev, Xiaodan Liang

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Tsinghua Shenzhen International Graduate School, Tsinghua University, China(清华大学深圳国际研究生院) Shenzhen Campus of Sun Yat-sen University(孙中山大学深圳校区) Spatialtemporal AI(时空人工智能) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉空间推理 :planning(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 PhyBlock通过3D积木组装任务评估VLMs在物理理解和规划能力,揭示其在复杂任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08942 2025-11-13 cs.RO cs.AI 85%

Think, Remember, Navigate: Zero-Shot Object-Goal Navigation with VLM-Powered Reasoning

Mobin Habibpour, Fatemeh Afghah

机构 * Holcombe Department of Electrical and Computer Engineering(霍尔科姆电气与计算机工程系) Clemson University(克莱姆森大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24152 2025-10-29 cs.CV cs.AI 85%

Enhancing Vision-Language Models for Autonomous Driving through Task-Specific Prompting and Spatial Reasoning

Aodi Wu, Xubo Luo

机构 * University of Chinese Academy of Sciences(中国科学院大学) Technology and Engineering Center for Space Utilization, Chinese Academy of Sciences(中国科学院空间利用技术与工程中心)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);planning(abstract);分类 cs.AI

Comments RoboSense Challenge with IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10973 2025-10-14 cs.CV cs.LG 85%

Chart-RVR: Reinforcement Learning with Verifiable Rewards for Explainable Chart Reasoning

Sanchit Sinha, Oana Frunza, Kashif Rasul, Yuriy Nevmyvaka, Aidong Zhang

机构 * University of Virginia(弗吉尼亚大学) Morgan Stanley(摩根士丹利)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24251 2025-10-07 cs.CV cs.CL 85%

Latent Visual Reasoning

Bangzheng Li, Ximeng Sun, Jiang Liu, Ze Wang, Jialian Wu, Xiaodong Yu, Hao Chen, Emad Barsoum, Muhao Chen, Zicheng Liu

机构 * University of California, Davis(加州大学戴维斯分校) Advanced Micro Devices, Inc.(先进微器件公司)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20752 2025-10-07 cs.CV cs.AI 85%

Reason-RFT: Reinforcement Fine-Tuning for Visual Reasoning of Vision Language Models

Huajie Tan, Yuheng Ji, Xiaoshuai Hao, Xiansheng Chen, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院自动化研究所人工智能学院)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

Comments 51 pages, 23 figures, NeurIPS'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22014 2025-09-29 cs.CV cs.AI cs.HC cs.RO 85%

Lightweight Structured Multimodal Reasoning for Clinical Scene Understanding in Robotics

Saurav Jha, Stefan K. Ehrlich

机构 * SETLabs Resarch GmbH(SETL实验室)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);planning(abstract);分类 cs.AI

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12109 2025-08-19 cs.CV cs.AI 85%

Simple o3: Towards Interleaved Vision-Language Reasoning

Ye Wang, Qianglong Chen, Zejun Li, Siyuan Wang, Shijie Guo, Zhirui Zhang, Zhongyu Wei

机构 * Independent Researcher(独立研究者)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19469 2025-06-25 cs.CV cs.AI 85%

Surgery-R1: Advancing Surgical-VQLA with Reasoning Multimodal Large Language Model via Reinforcement Learning

Pengfei Hao, Shuaibo Li, Hongqiu Wang, Zhizhuo Kou, Junhang Zhang, Guang Yang, Lei Zhu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hong Kong University of Science and Technology(香港科技大学) Department of Thoracic Surgery, the Seventh Affiliated Hospital, Sun Yat-sen University(中山大学第七附属医院胸外科部门) Bioengineering/Imperial-X, Imperial College London(生物工程/Imperial-X,帝国理工学院伦敦分校) ROAS Thrust, Hong Kong University of Science and Technology (Guangzhou)(ROAS项目,香港科技大学(广州)) Department of Electronic and Computer Engineering, Hong Kong SAR(香港特别行政区电子与计算机工程系)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04671 2025-04-09 cs.CV cs.AI 85%

Retrieval-Based Interleaved Visual Chain-of-Thought in Real-World Driving Scenarios

Charles Corbière, Simon Roburin, Syrielle Montariol, Antoine Bosselut, Alexandre Alahi

专题命中 视觉空间推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI

Comments Project page: https://vita-epfl.github.io/DrivingVQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06232 2025-03-18 cs.CL cs.CV 85%

Integrating Chain-of-Thought for Multimodal Alignment: A Study on 3D Vision-Language Learning

Yanjun Chen, Yirong Sun, Xinghao Chen, Jian Wang, Xiaoyu Shen, Wenjie Li, Wei Zhang

专题命中 视觉空间推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03230 2025-01-08 cs.AI cs.CV 85%

Video-of-Thought: Step-by-Step Video Reasoning from Perception to Cognition

Hao Fei, Shengqiong Wu, Wei Ji, Hanwang Zhang, Meishan Zhang, Mong-Li Lee, Wynne Hsu

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

Comments Accepted by ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01215 2026-06-30 cs.CV cs.AI cs.CL cs.MM 85%

Distilling Neuro-Symbolic Programs into 3D Multi-modal LLMs

将神经符号程序蒸馏到3D多模态大语言模型中

Wentao Mo, Yang Liu

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 视觉空间推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);planning(abstract)

AI总结 提出APEIRIA,通过三阶段课程学习将符号推理模式蒸馏到3D多模态大语言模型中,实现透明推理与开放词汇空间推理的统一。

Comments To appear in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02449 2026-08-04 cs.CV cs.RO 新提交 85%

MoRAL: Sensor-Grounded BEV Reasoning for Compact VLMs toward Edge-Oriented Autonomous Driving

MoRAL:面向边缘自动驾驶的紧凑型视觉语言模型的传感器接地鸟瞰图推理

Ambarish Govindarajulu Kaliamurthi, Kaikai Liu

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 MoRAL是一种两阶段微调流水线,指导Cosmos-Reason2-2B基于物理编码的BEV表示进行驾驶决策,在参数仅为零样本基准四分之一的情况下,在8类驾驶问题中7类胜出,紧急制动召回率提升至47.8%,可在消费级8GB GPU高效运行。

Comments 7 pages, 5 figures, 6 tables. Accepted to the 14th IEEE International Conference on Intelligent Mobile Computing (IEEE IMC 2026), Fukuoka, Japan, July 27-30, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13860 2026-07-16 cs.CV 新提交 85%

Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models

迈向增强医学多模态大语言模型中的 3D 空间推理

Zhuoyuan Fu, Zeshang Li, Yiqiong Zhang, Hangui Lin, Yan Shu, Yan Li, Binyang Li, Yaru Zhao

机构 * University of International Relations(国际关系学院)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 研究旨在增强医学多模态大语言模型的 3D 空间推理。通过新型逐片数据合成范式构建结构化推理数据集,用其对二维预训练模型进行指令微调,提升了模型在 3D 医学基准测试中的性能,缩小了与原生 3D 架构的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13539 2026-07-16 cs.CV cs.GR 新提交 85%

ThinkBLOX: 3D Indoor Scene Generation with Progressive Reasoning

ThinkBLOX:基于渐进推理的3D室内场景生成

Yuan Xiao, Can Wang, Xiangyu Kong, Jing Liao

机构 * City University of Hong Kong(香港城市大学) University of Hong Kong(香港大学) Beijing Information Science and Technology University(北京信息科技大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 研究针对传统与现有3D室内场景生成方法不足,提出基于VLM的渐进推理框架ThinkBLOX,构建数据集并采用监督微调与新强化学习方案,在多方面优于基线,支持多样3D场景应用。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12680 2026-07-15 cs.CV 新提交 85%

ReflectVLN: Training Vision-Language Navigation Agents with Reflective Reasoning

ReflectVLN:通过反思推理训练视觉语言导航智能体

Jiahang Wang, Yirong Yang, Yanqing Zhu, Minghua Luo, Shichao Xie, Fei Liu, Mu Xu

机构 * Amap, Alibaba Group(高德软件有限公司,阿里巴巴集团) Beihang University(北京航空航天大学)

专题命中 视觉空间推理 :reasoning(title);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 研究针对现有视觉语言导航方法缺乏闭环机制问题,提出ReflectVLN框架,通过双向交互智能体决策,引入行动思维链训练方案,实验证明该框架在有限数据下提升成功率和路径效率,且具良好训练成本与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏