arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-27 至 2026-05-27 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 15 篇

2605.26239 2026-05-27 cs.CV cs.MA 88%

Sentinel: Embodied Cooperative Spatial Reasoning and Planning

Sentinel:具身协同空间推理与规划

Xiangye Lin, Hongxin Zhang, Ruxi Deng, Qinhong Zhou, Chuang Gan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(title,abstract)

AI总结 提出Sentinel挑战和CoSaR框架,通过自然语言通信与空间导航算法结合,解决多智能体在城市规模户外环境中的协同空间推理与规划问题。

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27134 2026-05-27 cs.AI 79%

Scaling, Benchmarking, and Reasoning of Vision-Language Agents for Mobile GUI Navigation

面向移动GUI导航的视觉语言模型:缩放、基准测试与推理

Heng Qu, Yike Liu, Renren Jin, Wenzong Zhang, Pengzhi Gao, Wei Liu, Jian Luan

机构 * Wuhan University(武汉大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文系统研究了视觉语言模型在移动GUI导航中的数据缩放、基准测试与推理,提出了大规模数据集HyperTrack和开源工具包GUIEvalKit,并发现基于强化学习的微调优于监督微调,尤其在域外场景中表现更佳。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21552 2026-05-27 cs.CV cs.CL 79%

Learning GUI Grounding with Spatial Reasoning from Visual Feedback

通过视觉反馈学习具有空间推理能力的 GUI 定位

Yu Zhao, Wei-Ning Chen, Huseyin Atahan Inan, Samuel Kessler, Lu Wang, Lukas Wutschitz, Fangkai Yang, Chaoyun Zhang, Pasquale Minervini, Saravan Rajmohan, Robert Sim

机构 * University of Edinburgh(爱丁堡大学) Microsoft(微软)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出将 GUI 定位重构为交互式搜索任务,利用多步在线强化学习训练 GUI-Cursor 模型,通过光标视觉反馈提升空间推理能力,在 GUI 定位和代理任务上超越强基线。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18603 2026-05-27 cs.AI cs.CV 79%

Doc-CoB: Enhancing Document Understanding with Visual Chain-of-Boxes Reasoning

Doc-CoB:通过视觉链式框推理增强文档理解

Ye Mo, Kai Ye, Xianwei Mao, Zirui Shao, Gang Huang, Bo Zhang, Hangdi Xing, Kehan Chen, Huan Zhou, Zixu Yan, Jiajun Bu, Sheng Zhou

机构 * Zhejiang Key Laboratory of Accessible Perception and Intelligent Systems, Zhejiang University(浙江可感知与智能系统重点实验室,浙江大学) Alibaba Group(阿里巴巴集团) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出Doc-CoB框架,通过粗到细的布局感知视觉推理,结合多模态大语言模型,逐步聚焦查询相关布局区域,提升文档理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27310 2026-05-27 cs.CV 78%

How and What to Imagine? Visual Thinking in Unified Multimodal Models for Cross-View Spatial Reasoning

如何以及想象什么?统一多模态模型中的视觉思维用于跨视角空间推理

Qian Yang, Ankur Sikarwar, Huy Le, Le Zhang, Zhuan Shi, Perouz Taslakian, Aishwarya Agrawal

机构 * Mila - Québec AI Institute(蒙特利尔AI研究所) Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) ServiceNow AI Research(ServiceNow人工智能研究) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出View Dropout训练策略使模型利用中间思维图像进行跨视角空间推理,并发现全景视觉思维在信息性和可学习性上最优。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24456 2026-05-27 cs.CV 78%

EgoProx: Evaluating MLLMs on Egocentric 3D Proximity Reasoning Across a Cognitive Hierarchy

EgoProx: 在认知层级上评估多模态大语言模型的自我中心3D邻近推理能力

Jinzhao Li, Yinuo Chen, Dongxu Piao, Panwang Pan, Yifan Yu, Dong Wang, Honglei Yan, Liang Yue, Shaofei Wang, Yixin Chen, Siyuan Huang, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院) ByteDance(字节跳动) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出EgoProx基准,通过认知链任务和基于智能体的数据引擎,评估多模态大语言模型在自我中心3D邻近推理中的表现,发现模型虽具备空间知识但难以有效利用。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09606 2026-05-27 cs.CV 78%

SpaceVista: All-Scale Visual Spatial Reasoning from mm to km

SpaceVista:从毫米到公里的全尺度视觉空间推理

Peiwen Sun, Shiqiang Lang, Dongming Wu, Yi Ding, Kaituo Feng, Huadai Liu, Zhen Ye, Rui Liu, Yun-Hui Liu, Jianan Wang, Xiangyu Yue

机构 * Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Beijing University of Posts(北京邮电大学) Hong Kong University of Science(香港理工大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出全尺度空间推理解决方案,通过结构化知识系统、尺度感知建模和渐进训练范式,构建SpaceVista-1M数据集(38K视频场景、约1M空间QA对)和SpaceVista-7B模型,在5个基准上展现强泛化能力。

Comments Project Page: https://peiwensun2000.github.io/mm2km/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27038 2026-05-27 cs.RO 67%

TPS-Drive: Task-Guided Representation Purification for VLM-based Autonomous Driving

TPS-Drive: 基于VLM的自动驾驶任务引导表示净化

Jiaxiang Li, Yumao Liu, Ke Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 提出TPS-Drive框架,通过任务引导的表示净化(Agent-Centric Tokenizer)解决VLM在自动驾驶中的空间幻觉和表示干扰问题,实现精确的3D空间预测与安全规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26543 2026-05-27 cs.AI cs.LG 62%

PolyFusionAgent: A Multimodal Foundation Model and Autonomous AI Assistant for Polymer Property Prediction and Inverse Design

PolyFusionAgent: 用于聚合物性能预测和逆向设计的多模态基础模型与自主AI助手

Manpreet Kaur, Xingying Zhang, Qian Liu

机构 * Department of Applied Computer Science, The University of Winnipeg(应用计算机科学系,温尼伯大学) Department of Mechanical Engineering, University of Manitoba(机械工程系,曼尼托巴大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出PolyFusionAgent框架,结合多模态聚合物基础模型PolyFusion和工具增强的设计代理PolyAgent,通过对齐序列、拓扑、3D几何和指纹等多模态视图学习共享潜在空间,实现热物理性能预测和化学有效、结构新颖的聚合物逆向设计,并利用文献证据检索闭环设计流程。

Comments 23 pages, 5 figures, 2 tables; Supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17759 2026-05-27 cs.CR cs.CL cs.CV cs.LG stat.ML 62%

VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models

VERA-V:用于破解视觉语言模型的变分推断框架

Qilin Liao, Anamika Lochab, Ruqi Zhang

机构 * Department of Computer Science, Purdue University, USA(美国普渡大学计算机科学系)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出VERA-V变分推断框架,通过联合后验分布生成隐蔽的文本-图像对抗输入,以系统性地发现视觉语言模型的多模态漏洞,在多个基准上攻击成功率最高提升53.75%。

Comments 18 pages, 7 Figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22904 2026-05-27 cs.CV cs.AI 57%

Suicide Risk Assessment from AI-powered Video Surveillance: An Interpretable Framework for Prevention in Metro Stations

基于AI视频监控的自杀风险评估:地铁站预防的可解释框架

Safwen Naimi, Wassim Bouachir, Guillaume-Alexandre Bilodeau, Brian Mishara

机构 * Université TÉLUQ(大学TÉLUQ) Polytechnique Montréal(蒙特利尔理工学院) Université du Québec à Montréal(魁北克大学蒙特利尔分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出首个可解释框架,通过行人跟踪、活动识别、站台语义分割和轨迹风险热图建模,从监控视频中评估自杀风险,在真实数据上达到83.2% ROC-AUC。

Comments 9 pages, 6 figures, 1 table. Accepted for Publication in the International Joint Conference of Artificial Intelligence (IJCAI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26949 2026-05-27 cs.CV cs.GR 50%

DinoComplete: 3D Shape Completion with Distilled Semantic Priors and State Space Models

DinoComplete: 利用蒸馏语义先验和状态空间模型进行3D形状补全

Furkan Mert Algan, Eckehard Steinbach

机构 * Chair of Media Technology(媒体技术教授职位) Munich Institute of Robotics and Machine Intelligence(慕尼黑机器人与机器智能研究所) School of Computation Information and Technology, Technical University of Munich(计算信息科学学院,慕尼黑技术大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出DinoComplete框架,通过从DINO特征中蒸馏语义先验并结合多尺度体素Mamba模块,实现高效、鲁棒的3D形状补全,在未见类别和真实噪声扫描上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26399 2026-05-27 cs.CV 50%

OmniGF: A Dual-Branch Vision-Language Framework for Unified Gaze Following

OmniGF: 一种用于统一视线跟随的双分支视觉-语言框架

Qiaomu Miao, Haoyu Wu, Jingyi Xu, Minh Hoai, Dimitris Samaras

机构 * Stony Brook University(石英布大学) The University of Adelaide(阿德莱德大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出OmniGF框架,通过双分支解码策略(语言分支生成离散推理状态,连续空间分支利用密集隐藏状态)结合头部嵌入,实现多人场景下精确的空间视线估计、语义视线预测和复杂社会视线推理,在多个基准上达到新最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26232 2026-05-27 cs.CV 50%

Not All Modalities Are Equal: Instruction-Aware Gating for Multimodal Videos

并非所有模态都平等:面向多模态视频的指令感知门控

Bonan Ding, Umair Nawaz, Ufaq Khan, Abdelrahman M. Shaker, Muhammad Haris Khan, Jiale Cao, Jin Xie, Fahad Shahbaz Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎伊德大学人工智能学院) Tianjin University(天津大学) Chongqing University(重庆大学) Linköping University(林奈大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出UniMVU框架,通过内模态和模态级指令感知动态门控实现多模态视频理解,在六个基准上优于静态融合方法。

Comments 19 pages, 8 figures, 7 tables, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22274 2026-05-27 cs.CV 50%

CAGE-SGG: Counterfactual Active Graph Evidence for Open-Vocabulary Scene Graph Generation

CAGE-SGG:用于开放词汇场景图生成的反事实主动图证据

Suiyang Guang, Chenyu Liu, Ruohan Zhang, Siyuan Chen

机构 * Institute of Intelligent Vision and Embodied Cognition(智能视觉与具身认知研究院)

专题命中 视觉空间推理 :verifier(abstract)

AI总结 提出基于反事实关系验证的开放词汇场景图生成框架,通过分解谓词为软证据基并使用反事实验证器确保关系有视觉证据支持,从而提升可靠性、可解释性和泛化能力。

Comments This manuscript has been withdrawn by the authors because we found a methodological flaw in the formulation and evaluation of the proposed approach. The issue affects the reliability of the experimental results and the conclusions drawn from them. Therefore, the authors consider the current version unsuitable for citation or further use

详情

展开后加载摘要…

URL PDF HTML 收藏