arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-29 至 2026-07-29 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 10 篇

2606.15753 2026-07-29 cs.AI 版本更新 91%

RoboPIN: Grounded Embodied Reasoning via Pinned Chain-of-Thought

RoboPIN: 基于锚定思维链的具身推理

Yaoting Huang, Yifu Yuan, Linqi Han, Chengwen Li, Shuoheng Zhang, Xianze Yao, Hongyao Tang, Yan Zheng, Jianye Hao

机构 * Tianjin University(天津大学)

专题命中 视觉空间推理 :chain-of-thought(title,summary_cn);reasoning(title,abstract);分类 cs.AI

AI总结 提出Pinned Chain-of-Thought (PinCoT)推理范式,通过结构化视觉锚点绑定实体,解决多步推理中实体引用漂移和视觉解耦问题;训练4B参数模型在14个基准上平均超越最强7B基线12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25993 2026-07-29 cs.CV 新提交 82%

Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing

超越缩放:学习用于超高分辨率遥感的多工具视觉推理

Fengxiang Wang, Jiangnan Huang, Mingshuo Chen, Yueying Li, Yang Shi, Junwei Luo, Haoyu Wang, Yansheng Li, Jing Zhang, Haiyan Zhao, Wenjing Yang

机构 * National University of Defense Technology(国防科技大学) Wuhan University(武汉大学) Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

AI总结 针对超高分辨率遥感图像给多模态大语言模型带来的挑战,提出GeoMTVR数据集,结合监督微调与以工具注意力为重点的强化学习算法开发GeoLens,实验证明其在多工具视觉推理方面优于直接推理和单工具放大基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13454 2026-07-29 cs.CV cs.AI 版本更新 79%

GeoAnchor: Collaborative Reasoning via Latent Decomposition for 3D Spatial Understanding

GeoAnchor:通过潜在分解进行协作推理以实现3D空间理解

Hao Li, Han Fang, Zixin Pan, Xin Wei, Hongbo Sun, Jinglin Xu, Zhiyu Lin, Ye Yuan, Zhongjiang He, Yu Yu, Hao Sun

机构 * Shanghai Jiao Tong University(上海交通大学) Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(星辰通用人工智能实验室,中国电信人工智能技术(北京)有限公司) University of Science and Technology Beijing(北京科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 针对从2D图像理解3D空间关系的挑战,提出GeoAnchor框架,通过分解3D空间信息为互补组件并结合协作训练策略,实现动态可解释推理,在复杂3D推理任务中优于现有技术。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25663 2026-07-29 cs.AI cs.CL 新提交 62%

Localized Adaptation Reveals Distinct Learning Signatures in Transformers

局部适应揭示了Transformer中不同的学习特征

Rebecca Ramnauth, Brian Scassellati

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究Transformer适应位置对模型学习的影响,引入含五个目标的基准,定义“适应几何”,发现不同目标有不同适应模式,且在参数匹配控制下模式持续,确立适应位置为控制模型学习等的关键设计变量。

Comments Main text: 8 pages, 2 figures; appendix: 13 tables, 10 figures; code and data available at https://github.com/rramnauth2220/adaptation-geometries

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25537 2026-07-29 cs.CV cs.AI 新提交 57%

Visual prompt engineering for video models

视频模型的视觉提示工程

Robert Geirhos, Yuxuan Li, Thaddäus Wiedemer, Neha Kalibhat, Zi Wang, Mani Malek, Oyvind Tafjord, Kevin Swersky, Been Kim, Priyank Jaini

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 研究视频模型能否从视觉提示工程中受益,通过自动修改任务图像提升性能,如视觉物理推理任务。发现视觉提示工程(VIPE)能提高视频推理性能,比传统方法更有效,为提升视频模型视觉推理性能提供简单高效途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24904 2026-07-29 cs.CV cs.CL 新提交 57%

Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model

Mage-VL:一种高效的编解码器原生流式多模态基础模型

Senqiao Yang, Kaichen Zhang, Zhaoyang Jia, Jinghao Guo, Yifei Shen, Xinjie Zhang, Xiaoyi Zhang, Haoqing Wang, Xiao Li, Peng Zhang, Xiang An, Yin Xie, Zhening Liu, Xun Guo, Jiahao Li, Shicheng Zheng, Jinglu Wang, Zongyu Guo, Wenxuan Xie, Zihan Zheng, Yuxuan Luo, Bin Li, Yan Lu

机构 * Microsoft(微软)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 研究针对标准视觉语言模型在流式感知任务的不足,提出Mage-VL。核心方法是用Mage-ViT选择性编码关键区域,减少视觉令牌消耗。该模型在多模态理解和交互上表现出色,推理速度加快,还有多项关键实证发现。

Comments Project page: https://microsoft.github.io/Mage

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00435 2026-07-29 cs.CV cs.AI 版本更新 57%

Detect Before You Leap: Mirage Detection in Vision-Language Models

在跳跃前检测:视觉语言模型中的幻象检测

Sayeed Shafayet Chowdhury, Md. Shaown Miah, S. M. Taiabul Haque, Syed Ishtiaque Ahmed

机构 * Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校) Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 针对视觉语言模型在缺乏视觉证据时产生自信但无根据回答的幻象问题,提出文本条件层内对齐方法,通过分析视觉编码器各层补丁令牌与问题嵌入的对齐轨迹,结合像素统计、零样本域路由和结构化自评估,实现高精度预响应幻象检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14366 2026-07-29 cs.AI cs.RO 版本更新 57%

Towards Embodied Cognition in Robots via Spatially Grounded Synthetic Worlds

通过空间基础合成世界实现机器人的具身认知

Joel Currie, Gioele Migno, Enrico Piacenti, Maria Elena Giannaccini, Patric Bach, Davide De Tommaso, Agnieszka Wykowska

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出训练视觉语言模型执行视觉视角采择的概念框架,引入合成数据集用于空间推理任务监督学习,专注推断Z轴距离,数据集公开,为具身人工智能系统空间理解奠基。

Comments Accepted to: Intelligent Autonomous Systems (IAS) 2025 as Late Breaking Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25243 2026-07-29 cs.DB 新提交 50%

AuthentiCity: A Multi-Source Provenance-Aware Knowledge Graph and Benchmark for 3D City Models

真实性:用于3D城市模型的多源溯源感知知识图谱及基准测试

Huynh Duc An Son Nguyen, Lukas Arzoumanidis, Youness Dehbi

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究针对城市数字孪生多源数据整合难题,提出多源溯源感知的3D城市知识图谱AuthentiCity,整合多城市多类型数据。引入两个基准测试系列,通过自然语言到查询翻译及图表示学习评估,展示其在多任务中的优势,为相关研究提供数据及测试支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21409 2026-07-29 cs.RO 版本更新 50%

DSCD-Nav: Dual-Stance Cooperative Debate for Object Navigation

DSCD-Nav: 双视角协作辩论用于物体导航

Weitao An, Qi Liu, Chenghao Xu, Jiayi Chai, Xu Yang, Kun Wei, Cheng Deng

机构 * School of Electronic Engineering, Xidian University, Xi' an 710071, China.(西安电子科技大学电子工程学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 DSCD-Nav通过双视角协作辩论机制提升机器人在部分可观测环境中的导航可靠性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏