arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-14 至 2026-07-14 共收录 20 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 20 篇

2606.26104 2026-07-14 cs.CL cs.AI 版本更新 81%

Assert, don't describe: Linguistic features that shift LLM reasoning about animal welfare

断言,而非描述:改变LLM关于动物福利推理的语言特征

Jasmine Brazilek, Harper Dunn

机构 * Compassion Aligned Machine Learning (CaML)(同情对齐机器学习实验室) Independent researcher(独立研究者)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究通过词汇匹配的立场对比探针,测量十种语言特征对Llama-3.2-1B模型动物福利推理的影响,发现断言性确定性等七种特征增强支持动物福利,而模糊语言等两种特征削弱立场。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10991 2026-07-14 cs.RO cs.AI cs.CV 新提交 79%

Think When It Matters: Conditional VLM Reasoning for Social Navigation with RL Policies

在重要时刻思考:用于社交导航的基于RL策略的条件VLM推理

Ali Ahmadi, Hamed Rahimi, Adrien Jacquet Cretides, Marie Samson, Mahdi Khoramshahi, Mohamed Chetouani

机构 * Institut des Systèmes Intelligents et de Robotique (ISIR)(智能系统与机器人研究所)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究社交机器人导航中强化学习策略缺乏语义推理能力的问题,提出HUMA混合架构,动态平衡RL策略与VLM的优势。在基准测试中任务成功率提高,减少碰撞,消融研究验证组件,实际部署证明方法可行。

Comments CoRL 2026 submission. 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09740 2026-07-14 cs.AI cs.CV 新提交 79%

A Dynamic Scene Interaction Reasoning Framework for Scene-level Lane-Change Intention and Trajectory Prediction of Multiple Interacting Vehicles

用于多交互车辆场景级变道意图和轨迹预测的动态场景交互推理框架

Joshua Kofi Asamoah, Blessing Agyei Kyem, Eugene Denteh, Armstrong Aboah

机构 * North Dakota State University(北达科他州立大学)

专题命中 视觉空间推理 :reasoning(title);planning(abstract);分类 cs.AI

AI总结 研究针对多交互车辆场景级变道意图及轨迹预测问题,提出动态场景图注意力框架,将场景表示为时变交互图,通过时态图注意力消息传递等捕捉车辆关系与线索,实验表明该框架能提升预测准确率,降低碰撞率和误差,验证了组件贡献和公式有效性。

Comments 28 pages, 9 Figures, 16 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11173 2026-07-14 cs.CV 新提交 78%

When Depth Is Better Told Than Shown: Depth-Ordinal Prompting for Vision-Language Spatial Reasoning

当深度以文字表述比图像展示更好用时:用于视觉语言空间推理的深度序数提示

Quynh Vo, Phuc Dao, Cong-Duy Nguyen, Thong Nguyen

机构 * National University of Singapore(新加坡国立大学) Center of AI Research, VinUniversity(文大人工智能研究中心)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 研究视觉语言模型空间推理难题,提出深度序数提示(DOP)方法,该方法无需训练,将单目深度转换为序数文本提示,在伪深度提供可靠排序时可改善空间推理,简单且针对性强,与其他无需训练的深度提示方法有竞争力。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05716 2026-07-14 cs.CV 版本更新 78%

Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models

场景图思维:增强多模态大语言模型的结构化视觉推理

Zhiwei Yang, Yuanchen Wu, Nan Zhang, Yucong Meng, Ke Yan, Shouhong Ding

机构 * Fudan University(复旦大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 针对多模态大语言模型忽视结构化关系的问题,提出场景图思维(SaGe)范式,通过自动数据引擎转换数据、构建训练数据,采用两阶段图对齐训练范式,在多模态基准测试中取得显著改进,提升细粒度感知和推理能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17889 2026-07-14 cs.CV 版本更新 78%

AeroRAG: Structured Multimodal Retrieval-Augmented LLM for Fine-Grained Aerial Visual Reasoning

AeroRAG:结构化多模态检索增强型LLM用于细粒度航空视觉推理

Junxiao Xue, Quan Deng, Tingqi Hu, Meicong Si, Xinyi Yin, Yunyun Shi, Xuecheng Wu

机构 * Research Center for Space Computing System, Zhejiang Lab, Hangzhou(杭州浙大实验室空间计算系统研究中心) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou(中国科学院大学杭州高等研究院) School of Cyber Science and Engineering, Zhengzhou University(郑州大学计算机科学与工程学院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出AeroRAG,通过结构化场景图引导的多模态检索增强生成框架,解决航空场景中视觉问答的挑战,提升对小物体、数量、位置及物体关系的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13132 2026-07-14 cs.CV 版本更新 78%

SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis

SplatReasoner:通过新颖视图合成增强具身推理与基础能力

Kim Yu-Ji, Dahye Lee, Kim Jun-Seong, Nam Hyeon-Woo, GeonU Kim, Yongjin Kwon, Yu-Chiang Frank Wang, Jaesung Choe, Tae-Hyun Oh

机构 * POSTECH KAIST(韩国科学技术院) ETRI(韩国电子电信研究院) NVIDIA(英伟达)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 研究针对视觉语言模型应用于具身场景理解受固定视角限制的问题,提出SplatReasoner框架,利用3D高斯点云将新颖视图合成引入推理过程,经实验验证该方法能提升具身推理和3D基础能力。

Comments Accepted at ECCV 2026. Project page: https://splatreasoner.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11119 2026-07-14 cs.RO cs.AI 新提交 70%

VIA: Visual Interface Agent for Robot Control

VIA:用于机器人控制的视觉接口代理

Hengyuan Hu, Priya Sundaresan, Jensen Gao, Dorsa Sadigh

机构 * Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究探索能否用基础模型通过视觉接口控制机器人,提出 VIA 框架,将机器人控制转为代理任务,该框架无需特定微调及特权信息,能零样本解决多种桌面操作任务,凭借基础模型能力提升取得高成功率,证明前沿代理技能可借合适接口用于机器人控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10719 2026-07-14 cs.CV 版本更新 67%

SpaceDrive: Infusing Spatial Awareness into VLM-based Autonomous Driving

SpaceDrive: 在基于视觉语言模型的自动驾驶中引入空间感知

Peizheng Li, Zhenghao Zhang, David Holtz, Hang Yu, Yutong Yang, Yuzhi Lai, Rui Song, Andreas Geiger, Andreas Zell

机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) TU Munich(慕尼黑工业大学) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) University of Stuttgart(斯图加特大学) UCLA(加州大学洛杉矶分校)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出SpaceDrive框架,通过将空间信息作为显式位置编码来增强基于VLM的自动驾驶系统对精细3D空间关系的理解,从而提升规划精度和开放环性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01830 2026-07-14 cs.RO 版本更新 67%

What Matters in RL-Based Methods for Object-Goal Navigation? An Empirical Study and A Unified Framework

基于强化学习的目标导航方法中什么重要?实证研究与统一框架

Hongze Wang, Boyang Sun, Jiaxu Xing, Fan Yang, Marco Hutter, Dhruv Shah, Davide Scaramuzza, Marc Pollefeys

机构 * Computer Vision and Geometry Group, ETH Zurich, Switzerland(苏黎世联邦理工学院计算机视觉与几何组) Robotics and Perception Group, University of Zurich, Switzerland(苏黎世大学机器人与感知组) Robotic Systems Lab, ETH Zurich, Switzerland(苏黎世联邦理工学院机器人系统实验室) Princeton Robotic Intelligence and SysteMs group, Princeton University, USA(普林斯顿大学机器人智能与系统组) Microsoft, Switzerland(微软公司)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 研究目标导航中基于强化学习方法各组件影响,通过分解导航管道为感知、策略和测试时增强三组件进行实证研究,引入统一框架,构建增强系统达领先性能,提供见解与建议,凸显当前智能体与人类导航差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10706 2026-07-14 cs.RO cs.AI cs.CV cs.LG 新提交 62%

Action Map Policy: Learning 3D Closed-loop Manipulation via Pixel Classification

动作映射策略:通过像素分类学习3D闭环操作

Haojie Huang, Zhang Ye, Linfeng Zhao, Boce Hu, Mingxi Jia, Yu Qi, Ahmed Agha, Dian Wang, Robert Platt, Robin Walters

机构 * Northeastern University(东北大学) Stanford University(斯坦福大学) Brown University(布朗大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对机器人学习中动作空间的挑战,提出动作映射策略(AMP),将3D闭环操作策略学习转为图像空间分类问题,通过投影动作到图像平面,以像素为类别控制维度,实现高精度、快速推理,实验证明其优于基线。

Comments Project Website: https://haojhuang.github.io/amp_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10169 2026-07-14 cs.LG cs.AI 新提交 62%

Beyond Euclidean Clipping: Overcoming Exploration Collapse in LLM RL via Riemannian Isometric Policy Optimization

超越欧几里得裁剪:通过黎曼等距策略优化克服大语言模型强化学习中的探索崩溃

Zhicheng Cai, Xinyuan Guo, Hanlin Wu, Mingxuan Wang, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型强化学习中PPO-Clip的探索崩溃问题,提出黎曼等距策略优化(RIPO)方法,通过保证黎曼流形上等距策略更新平衡探索与利用,在七个竞争级基准上显著超越现有算法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08098 2026-07-14 cs.AI cs.LG 版本更新 62%

When Does Delegation Beat Majority? A Delegation-Based Aggregator for Multi-Sample LLM Inference

何时委托优于多数?一种基于委托的多样本LLM推理聚合器

Yasushi Sakai, Allen Song, Kent Larson

机构 * MIT Media Lab(麻省理工学院媒体实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出基于委托的聚合器PPV,利用样本的字母熵和推理几何信号,在MMLU-Pro上比多数投票高1.5个百分点,无需标签或训练。

Comments Preprint. 16 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11377 2026-07-14 cs.RO cs.AI 新提交 57%

A Glimpse into Long-term Physical Coexistence with Intelligent Robots

深入了解与智能机器人的长期物理共存

Weiqi Jin, Peijun Tang, Kuncheng Luo, Baifu Huang, Binyan Sun, Haotian Yang, Shangjin Xie, Jianan Wang

机构 * Astribot Team(Astribot团队)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 研究与智能机器人长期物理共存问题,提出基于机器人网关抽象的多机器人代理PHILIA,解耦代理推理与机器人执行,实现即插即用集成,在Astribot S1机器人上验证架构,展示用例,强调人机交互流程对有效协助的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10578 2026-07-14 cs.AI 新提交 57%

Laguerre Geometry for Interpreting Large Language Models

用于解释大语言模型的拉盖尔几何

Chunwei Ma, Russell Wolfinger

机构 * JMP Statistical Discovery(JMP统计发现公司)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 研究大语言模型中概念结构的形成,利用拉盖尔几何精确表征概念,通过分解Transformer层揭示隐藏轨迹控制机制,提出无需训练和超参数的几何透镜方法读出概念,开发可视化工具,还实现可操作的可解释性。

Comments Geometric Lens; LLM Interpretability; Code: https://github.com/horsepurve/Geometric-Lens

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09741 2026-07-14 cs.RO cs.AI cs.MA 新提交 57%

SWIFT: A Small-World Interaction Framework for Flow-Aware Trajectory Prediction in Autonomous Driving

SWIFT:用于自动驾驶中流量感知轨迹预测的小世界交互框架

Chengyue Wang, Bin Rao, Haicheng Liao, Bonan Wang, Chengzhong Xu, Zhenning Li

机构 * University of Macau(澳门大学) State Key Laboratory of Internet of Things for Smart City, University of Macau(澳门大学智慧城市物联网国家重点实验室) Department of Civil and Environmental Engineering, University of Macau(澳门大学土木与环境工程系)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 研究自动驾驶中轨迹预测问题,提出SWIFT框架,结合小世界网络与交通流理论,通过特定网络和模块引入结构偏差与增强推理,实验证明其在多方面优于基线,展现出结构感知设计的有效性。

Comments Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09716 2026-07-14 cs.RO 新提交 50%

RoboNav-Arm: Agentic AI-Driven Navigation and Obstacle Avoidance for Robotic Manipulator in Cluttered Environments

RoboNav-Arm:杂乱环境中机器人操纵器的智能AI驱动导航与避障

Aachal Sharma, Narendra Kumar Dhar

机构 * Centre for Artificial Intelligence and Robotics (CAIR), Indian Institute of Technology Mandi(人工智能与机器人中心(CAIR),印度曼迪理工学院)

专题命中 视觉空间推理 :planning(abstract)

AI总结 针对杂乱环境中机器人操纵器面临的挑战,提出含环境、中央协调和规划模块的安全任务执行框架,能实时检测与定位障碍物,依环境选算法规划轨迹并优化,在Gazebo Classic中评估,展现动态场景鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06537 2026-07-14 cs.RO 版本更新 50%

UniLM-Nav: A Unified Framework for Zero-Shot Last-Mile Navigation

UniLM-Nav:零样本最后一英里导航的统一框架

Zhuofan Zhang, Tianxu Wang, Guoxi Zhang, Yixiong Lin, Xilin Wang, Hongming Xu, Qing Li, Song-Chun Zhu, Lifeng Fan

机构 * Tsinghua University(清华大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,字节跳动公司人工智能研究院) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究移动操作中最后一英里导航问题,提出UniLM-Nav统一框架,通过多模态大语言模型后端分解任务为视图选择、功能接地和姿态推理,在OVMM基准上优于现有方法,还验证了在实际机器人上的适用性。

Comments Project page: https://unilm-nav.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06534 2026-07-14 cs.CV 版本更新 50%

CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models

CAIRN:使用拓扑感知大型多模态模型进行跨房间3D场景理解

He Liang, Chenyang Ma, Yiming Zhang, Sangyun Shin, Andrew Markham, Niki Trigoni, Yuhang He

机构 * University of Oxford(牛津大学) Microsoft(微软公司) Simon Fraser University(西蒙弗雷泽大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究针对现有3D-LLMs不能处理多房间场景问题,提出拓扑感知3D-LLM即CAIRN。其将Transformer注意力与场景层次对齐,通过多种方式增强模型能力。在新基准CAIRN-MR上实验,CAIRN在多房间任务中大幅超越前人,单房间任务也具竞争力。

Comments Project Page: https://oceansdepp.github.io/cairn_web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09375 2026-07-14 cs.RO 50%

Self-navigation in crowds: An invariant set-based approach

人群中的自主导航:基于不变集的方法

Veejay Karthik J, Leena Vachhani

机构 * Indian Institute of Technology Bombay(印度理工学院班加罗尔)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出了一种基于不变集的自主导航方法,通过输入受限反馈控制器和规划策略,实现非协调拥挤环境中安全快速的多智能体导航。

详情

展开后加载摘要…

URL PDF HTML 收藏