arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-24 至 2026-07-24 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 12 篇

2607.21552 2026-07-24 cs.AI cs.LG 新提交 81%

MIRROR: Learning from the Other View for Multi-Modal Reasoning

MIRROR:从其他视角学习以进行多模态推理

Wen Ye, Yuxiao Qu, Aviral Kumar, Xuezhe Ma

机构 * University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究视觉语言模型在几何问题多模态推理上的不足,构建ODA-Data数据集,提出模态感知互惠推理优化(MIRROR)方法,通过强化学习自我监督,提升多模态推理能力,在相关基准测试中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21085 2026-07-24 cs.CV 新提交 78%

Geo3R: Mitigating Spatial Reasoning Hallucination in Multimodal Large Language Models

Geo3R:减轻多模态大语言模型中的空间推理幻觉

Mingyu Wang, Weilin Jin, Wenbo Li, Haoyang Huang, Tong Jia, Ying Li

机构 * Peking University(北京大学) Joy Future Academy(京东探索研究院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 多模态大语言模型推理空间关系易产生幻觉,现有方法效果有限。本文定义空间推理幻觉及常见场景,提出无训练的Geo3R框架,结合几何证据和结构化3D推理减轻幻觉,实验证明该框架显著减少幻觉,优于现有模型和方法。

Comments Accepted by ACM MM 2026. This is the arXiv preprint version, not the camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20515 2026-07-24 cs.CV 版本更新 78%

S-Agent: Spatial Tool-Use Elicits Reasoning for Spatial Intelligence

S-Agent:空间工具使用激发空间智能推理

Yalun Dai, Hao Li, Shulin Tian, Runmao Yao, Yuhao Dong, Fangzhou Hong, Zhaoxi Chen, Fangfu Liu, Tao Wang, Kim-Hui Yap, Ziwei Liu

机构 * NTU(南洋理工大学) THU(清华大学) ByteDance(字节跳动) NWPU(西北工业大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出S-Agent空间工具使用智能体范式,通过时空证据积累和层次化工具集,将VLM作为语义规划器,实现连续多视图图像和视频的空间推理,在无训练下提升开源和闭源VLM性能,并基于S-300K轨迹微调得到紧凑空间智能体S-Agent-8B。

Comments Project Page : https://Ropedia.github.io/S-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21595 2026-07-24 cs.CV cs.AI cs.LG 新提交 62%

3D-Aware VLMs with Implicit and Explicit Geometries

具有隐式和显式几何的3D感知视觉语言模型

Wenhao Li, Xueying Jiang, Quanhao Qian, Deli Zhao, Ran Xu, Shijian Lu, Gongjie Zhang

机构 * Nanyang Technological University(南洋理工大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) HuPan Lab(湖畔实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对多数2D视觉输入的VLM处理3D任务困难的问题,提出VLM-IE3D框架,通过引入隐式和显式几何令牌及3D感知适配器,融合几何表示与视觉线索,在多种3D任务中表现优异。

Comments Accepted by ECCV 2026, Open Sourced

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05881 2026-07-24 cs.LG cs.CL cs.RO 62%

Training Fast Robot Policies with Slow Foundation Models

用慢速基础模型训练快速机器人策略

Utsav Singh, Pramit Bhattacharyya, Vinay P. Namboodiri, Amrit Singh Bedi

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出VGRS方法,通过利用慢速基础模型训练快速机器人策略,结合LLM生成奖励与视觉分析诊断,提升机器人在复杂任务中的表现和部署效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21036 2026-07-24 cs.CV 新提交 50%

GeoThreat: Transferable Targeted Adversarial Attacks on Large Vision-Language Models for Remote Sensing Image Interpretation

GeoThreat:用于遥感图像解释的大型视觉语言模型的可转移目标对抗攻击

Yimin Fu, Yuefeng Bai, Baicheng Pan, Zhunga Liu, Michael K. Ng

机构 * Department of Mathematics, Hong Kong Baptist University(香港浸会大学数学系) School of Automation, Northwestern Polytechnical University(西北工业大学自动化学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究针对大型视觉语言模型在遥感图像解释中的对抗攻击问题,提出GeoThreat方法,通过在概念和感知层面调制对抗表示,结合对抗目标相似性梯度等技术,实现可转移目标对抗攻击,实验证明该方法在可转移性和可控性上具有优越性。

Comments The code will be released at https://github.com/fuyimin96/GeoThreat upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21025 2026-07-24 cs.RO 新提交 50%

ZONDA: Zero-shot Object Navigation with Dynamic Avoidance in Multi-floor Environments

ZONDA:多楼层环境中具有动态避障功能的零样本目标导航

Shaomin Liang, Xuanhong Liao, Shiyao Zhang

机构 * Southern University of Science and Technology(南方科技大学) Guangdong Direct Drive Technology Limited(广东直驱技术有限公司) South China University of Technology(华南理工大学) Great Bay University(大湾区大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 研究针对目标导航任务中现有方法局限,提出ZONDA框架,集成启发式多楼层规划、多视图目标验证、动态行人避障三个核心组件,通过真实机器人及模拟测试取得显著改进结果,在动态基准测试中表现优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20990 2026-07-24 cs.ET 新提交 50%

LivePhys: Transforming Static Physics Problems into Interactive Simulations via a Scan-to-Play Framework

LivePhys:通过扫描即播放框架将静态物理问题转化为交互式模拟

Xiaowei Dai, Ziyu Luo, Xiangwen Zhang, Xiaoming Chen, Juan Wu, Yonghong Ke

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究针对教科书中静态物理问题学习的高认知负担,提出LivePhys框架,通过多模态处理构建中间表示,用大语言模型推理并由物理引擎执行生成交互式模拟,显著提升模拟性能并降低学习者认知负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16619 2026-07-24 cs.RO cs.MA 版本更新 50%

SAGE: A Socially-Aware Generative Engine for Heterogeneous Multi-Agent Navigation

SAGE:用于异构多智能体导航的社会感知生成引擎

Lan Hu, Minghui Liwang, Wenbo Zhu, Xinlei Yi, Yiguang Hong, Xianbin Wang, Zhenzhen Jiao, Seyyedali Hosseinalipour

机构 * Guohao School, Tongji University(同济大学国豪书院) Shanghai Research Institute for Intelligent Autonomous Systems(上海智能无人系统科学中心) Tongji University(同济大学) Western University(西安大略大学) Aeromind Technology Co., Ltd.(深圳智元科技有限公司) University at Buffalo-SUNY(纽约州立大学布法罗分校)

专题命中 视觉空间推理 :planning(abstract)

AI总结 针对开放人机环境中异构多智能体导航问题,提出SAGE,通过有向异构图和异构图变换器编码交互,扩散生成模块建模轨迹,无训练安全-社会能量引导机制优化轨迹,实验验证其有效性及可扩展性。

Comments 16 pages, 5 figures, and 14 tables. Includes supplementary experimental details

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13318 2026-07-24 cs.CV 版本更新 50%

Reflecting Process Expertise in Procedural Material Generation

在程序材质生成中反映过程专业知识

Kunal Gupta, Gaurav Joshi, Yen-Ru Chen, Seemandhar Jain, Ishit Mehta, Manmohan Chandraker

机构 * University of California San Diego(加利福尼亚大学圣地亚哥分校)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究聚焦程序材质生成,核心方法是将其作为检索时的过程推理,利用专家演示、教程视频等提取轨迹并合成材质图。主要贡献是生成的材质编辑少、更符合专业策略,且相比先前系统有更好的生成和编辑性能。

Comments Accepted to ECCV 2026. Project page: https://materialapprentice.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31533 2026-07-24 cs.CV 版本更新 50%

MV-GEL: Language-Driven Multi-View Geometric Entity Localization on Meshes

MV-GEL:语言驱动的多视图网格几何实体定位

Kartik Bali, Roland Aydin

机构 * Helmholtz Zentrum Hereon(亥姆霍兹赫里恩研究中心) Institute for Continuum and Material Mechanics, Hamburg University of Technology(汉堡工业大学连续介质与材料力学研究所) German Research Center for Artificial Intelligence(德国人工智能研究中心)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出MV-GEL框架,通过语言查询定位网格上的细粒度几何实体,利用视角选择模块GELviews优先选择可观察性高的视角,结合VLM分割和光线投射提升定位精度。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22819 2026-07-24 cs.CV 版本更新 50%

Cambrian-P: Pose-Grounded Video Understanding

Cambrian-P: 基于姿态的视频理解

Jihan Yang, Zifan Zhao, Xichen Pan, Shusheng Yang, Junyi Zhang, Bingyi Kang, Hu Xu, Shang-Wen Li, Saining Xie

机构 * New York University(纽约大学) UC Berkeley(加州大学伯克利分校) Meta FAIR

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 该研究提出Cambrian-P,一种增强的视频多模态大语言模型,通过引入可学习的相机令牌和姿态回归头,利用姿态作为轻量级监督信号,显著提升了空间推理能力,并在多个视频问答基准上实现了SOTA表现。

Comments Project Page: https://cambrian-mllm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏