arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-05 至 2026-03-05 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 10 篇

2510.09782 2026-03-05 cs.AI cs.CL cs.LG cs.LO 83%

The Geometry of Reasoning: Flowing Logics in Representation Space

推理的几何学:表示空间中的流动逻辑

Yufa Zhou, Yixiao Wang, Xunjian Yin, Shuyan Zhou, Anru R. Zhang

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过几何框架分析LLM推理过程,揭示其在表示空间中的流动特性,并验证逻辑结构与语义的关系。

Comments ICLR 2026. Code: https://github.com/MasterZhou1/Reasoning-Flow

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15040 2026-03-05 cs.CV cs.CL cs.LG 81%

Composition-Grounded Data Synthesis for Visual Reasoning

基于组成性的数据合成用于视觉推理

Xinyi Gu, Jiayuan Mao, Zhang-Wei Hong, Zhuoran Yu, Pengyuan Li, Dhiraj Joshi, Rogerio Feris, Zexue He

机构 * MIT(麻省理工学院) UW-Madison(威斯康星大学麦迪逊分校) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 COGS通过分解种子问题并重新组合生成合成数据,提升MLLMs在图表和网页等人工图像领域的推理能力。

Comments ICLR2026 camera-ready version. Project page: https://cogsynthesis.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04380 2026-03-05 cs.CV cs.CL 79%

TaxonRL: Reinforcement Learning with Intermediate Rewards for Interpretable Fine-Grained Visual Reasoning

TaxonRL: 用于可解释细粒度视觉推理的强化学习

Maximilian von Klinski, Maximilian Schall

机构 * Hasso Plattner Institute University of Potsdam(波茨坦大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL

AI总结 TaxonRL通过强化学习和中间奖励实现结构化层次推理,提升细粒度视觉分类的准确性和可解释性。

Comments Accepted at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03942 2026-03-05 cs.RO 78%

Lightweight Visual Reasoning for Socially-Aware Robots

轻量级视觉推理用于社交感知机器人

Alessio Galatolo, Ronald Cumbal, Alexandros Rouchitsas, Katie Winkle, Didem Gürdür Broo, Ginevra Castellano

机构 * Department of Information Technology, Uppsala University(信息科技系,乌普萨拉大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本研究提出了一种轻量级视觉推理模块,用于提升社交感知机器人在复杂人机交互中的表现,通过闭环反馈机制增强机器人对动态人类行为的理解和响应能力。

Comments ICRA26

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25191 2026-03-05 cs.RO 78%

SoraNav: Adaptive UAV Task-Centric Navigation via Zeroshot VLM Reasoning

SoraNav: 通过零样本VLM推理实现适应性无人机任务导向导航

Hongyu Song, Rishabh Dev Yadav, Cheng Guo, Wei Pan

机构 * Department of Computer Science, The University of Manchester(计算机科学系,曼彻斯特大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 SoraNav通过零样本VLM推理实现无人机任务导向导航,解决空间-语义差距问题,提升导航成功率与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19655 2026-03-05 cs.RO 67%

LaViRA: Language-Vision-Robot Actions Translation for Zero-Shot Vision Language Navigation in Continuous Environments

LaViRA: 语言-视觉-机器人动作翻译用于连续环境中的零样本视觉语言导航

Hongyu Ding, Ziming Xu, Yudong Fang, You Wu, Zixuan Chen, Jieqi Shi, Jing Huo, Yifan Zhang, Yang Gao

机构 * School of Computer Science, Nanjing University(南京大学计算机科学学院) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 LaViRA通过分解动作层次结构,利用多模态大语言模型的优势,实现连续环境中零样本视觉语言导航的高效导航与泛化能力。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04128 2026-03-05 cs.CV cs.AI cs.MM 57%

Crab$^{+}$: A Scalable and Unified Audio-Visual Scene Understanding Model with Explicit Cooperation

Crab$^{+}$: 一种可扩展且统一的音频视觉场景理解模型,具有显式合作

Dongnuan Cai, Henghui Du, Chang Zhou, Xi Chen, Dan Guo, Hongyuan Zhang, Xuelong Li, Di Hu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学耿丽人工智能学院) Institute of Artificial Intelligence of China Telecom (TeleAI)(中国电信人工智能研究院) AI Technology Center, Online Video Business Unit, Tencent PCG(腾讯PCG在线视频业务单元AI技术中心) Hefei University of Technology(合肥工业大学) The University of Hong Kong(香港大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 Crab$^{+}$通过显式合作解决音频视觉任务异质性问题,实现更广泛的任务覆盖和优于单任务模型的性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03946 2026-03-05 cs.LG 57%

Lang2Str: Two-Stage Crystal Structure Generation with LLMs and Continuous Flow Models

Lang2Str: 基于LLM和连续流模型的双阶段晶体结构生成

Cong Liu, Chengyue Gong, Zhenyu Liu, Jiale Zhao, Yuxuan Zhang

机构 * AMLab, AI4Science Lab University of Amsterdam(AMLab、AI4Science Lab 阿姆斯特丹大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 Lang2Str通过结合LLM和流模型,实现灵活且精确的晶体结构生成,提升材料设计的效率和定制性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04368 2026-03-05 cs.NI 50%

LLM-supported 3D Modeling Tool for Radio Radiance Field Reconstruction

支持大型语言模型的3D建模工具用于无线电辐射场重建

Chengling Xu, Huiwen Zhang, Haijian Sun, Feng Ye

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出了一种结合微调语言模型和生成3D建模框架的本地部署工具,用于简化无线电辐射场重建的3D环境创建。

Comments Submitted to an IEEE conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04336 2026-03-05 cs.CV 50%

Building a Mind Palace: Structuring Environment-Grounded Semantic Graphs for Effective Long Video Analysis with LLMs

构建一个思维宫殿:为有效长视频分析构建基于环境的语义图谱

Zeyi Huang, Yuyang Ji, Xiaofang Wang, Nikhil Mehta, Tong Xiao, Donghyun Lee, Sigmund Vanvalkenburgh, Shengxin Zha, Bolin Lai, Yiqiu Ren, Licheng Yu, Ning Zhang, Yong Jae Lee, Miao Liu

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Meta UIUC(伊利诺伊大学香槟分校)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 VideoMindPalace通过构建环境基础的语义图谱,提升长视频分析中空间-时间连贯性和类人推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏