arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-17 至 2026-07-17 共收录 106 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 32 篇

2607.14727 2026-07-17 cs.CV 新提交 67%

WorkDrive: Roadwork Chain of Causation for Autonomous Driving

WorkDrive:自动驾驶的道路施工因果链

Tianyi Jiang, Wen Zhang, Sihan Yang, Ming Lu, Wentao Zhang

机构 * Peking University(北京大学) Xiaomi EV(小米电动汽车)

专题命中 规划推理 :reasoning(abstract);planning(abstract)

AI总结 针对自动驾驶视觉语言模型在道路施工区域的难题,提出WorkDrive框架,通过自动化多任务感知管道提取场景事实,经监督微调与强化学习,在ROADWork数据集上降低轨迹平均位移误差,实现渐进改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14494 2026-07-17 cs.AI cs.IR cs.LG 新提交 62%

SAGA: Schema-Aware Grounding for Agentic Text-to-SPARQL Generation

SAGA:用于智能文本到SPARQL生成的模式感知基础

Yiming Zhang, Koji Tsuda

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究复杂知识库问答中语义解析范式,针对现有智能体类型盲基础问题,提出无训练框架SAGA,通过模式约束基础操作,维护类型状态,过滤候选属性,以紧凑格式呈现图模式,在多基准设置上取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14145 2026-07-17 cs.AI cs.CV cs.LG 新提交 62%

ToolAnchor: Anchoring Counterfactual Context to Boost Agentic Tool-use Capability

ToolAnchor:锚定反事实上下文以提升智能体工具使用能力

Weiting Liu, Jieyi Bi, Wanqi Zhou, Jianfeng Feng, Yining Ma, Ai Han, Wenlian Lu

机构 * Fudan University(复旦大学) Nanyang Technological University(南洋理工大学) MIT(麻省理工学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对工具增强大语言模型智能体在工具集扩展时的问题,提出ToolAnchor框架,通过在关键决策点注入反事实锚定上下文打破行为惯性,经教师模型假设、学生展开验证及智能体后训练,提升其在扩展工具集下的性能,为智能体强化学习开辟新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31693 2026-07-17 cs.IR cs.AI cs.CL 版本更新 62%

ShopX: A Foundation Model for Intent-to-Item Fulfillment in Agentic Shopping

ShopX:面向智能购物中意图到商品实现的基础模型

Jiacheng Chen, Tao Zhang, Manxi Lin, Dunxian Huang, Teng Shi, Honghao Fu, Mengyan Li, Xinming Zhang, Chenchi Zhang, Xuan Lu, Xiaoxiong Du, Haibin Chen, Shaolin Ye, Hao Chang, Xiaoqi Li, Shuwen Xiao, Yujin Yuan, Jingxuan Feng, Shaopan Xiong, Huimin Yi, Ju Huang, Qiu Shen, Ying Chen, Junjun Zheng, Xiangheng Kong, Dan Ou, Haihong Tang, Yuning Jiang, Bo Zheng

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 提出ShopX基础模型,通过统一意图理解、执行规划和基于语义ID的商品空间操作,解决大语言模型代理在购物中意图到商品实现的瓶颈,在淘宝生产日志任务上优于工具中介系统。

Comments The new version adds additional results and details

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00761 2026-07-17 cs.AI cs.CL 版本更新 62%

L-MARS: Legal Multi-Agent System with Agentic Search and Citation-Faithfulness Audit

L-MARS:具有协调推理和代理搜索的法律多智能体工作流

Boqin Yuan, Ziqi Wang

机构 * University of Southern California(南加州大学) University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 规划推理 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 L-MARS是一种多代理检索框架,通过分解查询为结构化子问题,利用代理网络搜索获取证据,并通过验证代理过滤结果,从而在法律问答中实现高准确率。

Comments Accepted at the AI4Law Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15253 2026-07-17 cs.IR cs.CL 新提交 57%

Bridge Evidence: Static Retrieval Utility Does Not Predict Causal Utility in Multi-Step Agentic Search

桥梁证据:静态检索效用无法预测多步智能体搜索中的因果效用

Debayan Mukhopadhyay, Utshab Kumar Ghosh, Shubham Chatterjee

机构 * University of Calcutta(卡塔克大学) Missouri University of Science and Technology(密苏里科技大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 研究智能体检索中静态检索效用与因果效用的差异,通过在HotpotQA上用ReAct风格智能体实验,比较原始与反事实运行得CTU分数,发现两者近乎独立,约三分之一文档为桥梁文档,还确定了相关机制,指出优化静态相关性无法带来因果有用性。

Comments Preprint; extended version in preparation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15193 2026-07-17 cs.AI 新提交 57%

Plover: Steering GUI Agents through Plan-Centric Interaction

Plover:通过以计划为中心的交互来操控图形用户界面代理

Madhumitha Venkatesan, Shicheng Wen, Jiajing Guo, Jorge Piazentin Ono, Liu Ren, Dongyu Liu

机构 * University of California, Davis(加利福尼亚大学戴维斯分校) Bosch Research North America(博世北美研究院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究针对现实中GUI自动化难题,提出以计划为中心的Plover系统,通过规划器-执行器架构,支持多方式监督与修正,经形成性研究和评估表明,该系统能让GUI自动化更透明、可控与可适应,利于修复故障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14485 2026-07-17 cs.AI 新提交 57%

Step-Level Preference Learning for Generative Agents in Social Simulations

社会模拟中生成式智能体的步骤级偏好学习

Wenchang Gao, Pingyue Sheng, Lanlan Qiu, Yunfei Ma, Jian Zhao, Baicheng Chen, Kangda Wang, Yuyang Tian, Shunqiang Mao, Tianxing He

机构 * Shanghai Qi Zhi Institute(上海期智研究院) Xiongan AI Institute(雄安人工智能研究院) Tsinghua University(清华大学) CUHK-Shenzhen(香港中文大学(深圳)) USTC(中国科学技术大学) Sun Yat-sen University(中山大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究基于大语言模型的生成式智能体模拟人类行为时中间步骤注释稀缺问题,引入交互式模拟界面收集步骤级人类偏好监督,经监督微调算法和直接偏好优化方法进行步骤级偏好学习,提升模拟效果,证明步骤级人类监督是有效训练信号。

Comments WAICA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14314 2026-07-17 cs.LG 新提交 57%

NeuroGRIP: Retrieval-Augmented Graph Refinement for Knowledge-Grounded EEG Seizure Diagnosis

NeuroGRIP:用于基于知识的脑电图癫痫诊断的检索增强图细化

Lincan Li, Zheng Chen, Yushun Dong

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 研究针对脑电图癫痫诊断难题,提出NeuroGRIP框架,结合外部医学知识校准脑电图图。通过构建知识库、利用大语言模型提取知识图,经对齐感知查询和相似性搜索检索关系证据,提升诊断准确性与可解释性,为临床诊断提供新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14277 2026-07-17 cs.CL 新提交 57%

Multi-Head Latent Control: A Unified Interface for LLM Agent Decision Making

多头潜在控制:大语言模型智能体决策的统一接口

Amirhosein Ghasemabadi, Ruichen Chen, Bahador Rashidi, Di Niu

机构 * University of Alberta(阿尔伯塔大学) Huawei Technologies Canada Co., Ltd.(华为加拿大技术有限公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 研究大语言模型作智能体时的决策控制问题,提出多头潜在控制方法,通过读取冻结模型的隐藏状态轨迹生成控制信号,能在不修改模型的情况下进行事后适配,改善多模型系统质量成本权衡,减少大模型使用并提高工具使用决策质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14240 2026-07-17 cs.AI 新提交 57%

Align AI to Dynamic Human-AI Workflows

将人工智能与动态人机工作流程对齐

Valerie Chen, Cleotilde Gonzalez, Anita Williams Woolley, Michael Lee, Tongshuang Wu, Vincent Conitzer, Aarti Singh

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California Irvine(加州大学欧文分校)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 研究现实世界中人类与人工智能交互的动态本质,主张从静态模拟对齐转向交互式互补对齐,通过对比现有对齐与轨迹级视图形式化差距,借鉴多学科见解指出挑战,最后概述开发与人类交互对齐的人工智能系统的研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14093 2026-07-17 cs.AI 新提交 57%

Intelligent Three Level Learning Architecture for Autonomous UAV Swarms in Search and Rescue

用于自主无人机群搜索和救援的智能三级学习架构

Oleksii Bychkov

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文针对无人机群搜索和救援提出智能三级学习架构,集成三种学习机制,通过架构契约形式化,引入群体元认知,有进展函数和主整合定理,解决了现有分层强化学习方法的五个基本限制。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15001 2026-07-17 hep-lat cs.AI hep-ph 新提交 57%

LQCDMaster: Agentic Scientific Computing for Lattice Quantum Chromodynamics Research

LQCDMaster:用于格点量子色动力学研究的智能科学计算

Haofei Gao, Tingjia Miao, Wenkai Jin, Muhua Zhang, Hanzhang Wang, Jie Ran, Jinxin Tan, Zhentao Zhang, Bo Tang, Leiyi Li, Jun Hua, Xiangyu Jiang, Qi-An Zhang, Siheng Chen, Wei Wang

机构 * School of Physics and Astronomy(物理与天文学院) Tsung-Dao Lee Institute(李政道研究所) State Key Laboratory of Dark Matter Physics(暗物质物理国家重点实验室) School of Artificial Intelligence(人工智能学院) Zhiyuan College(智远学院) School of Physics(物理学院) SciLand Institute of Quantum Matter(量子物质研究所) Department of Physics(物理系)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究针对格点量子色动力学研究实际应用受限问题,提出LQCDMaster智能体,结合智能规划等技术将自然语言任务转化为计算工作流程。经实验评估,其能精确再现多数任务,大幅缩短实现时间,开创智能科学计算范式,促进相关研究。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28149 2026-07-17 cs.CV cs.AI 版本更新 57%

Toward Robust In-Context Segmentation via Concept Guidance

通过概念引导实现鲁棒的上下文分割

Zhigang Chen, Xiawu Zheng, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出概念引导的上下文分割(CG-ICS),通过提取参考图像的高层语义概念而非仅依赖低层视觉匹配,结合文本概念与视觉示例,显著提升分割准确性和鲁棒性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17612 2026-07-17 cs.PL cs.AI 版本更新 57%

Provable Coordination for LLM Agents via Message Sequence Charts

通过消息序列图实现LLM代理的可证明协调

Benedikt Bollig, Matthias Függer, Thomas Nowak

机构 * Université Paris-Saclay, CNRS, ENS Paris-Saclay, LMF, Gif-sur-Yvette, France(巴黎萨克雷大学、法国国家科学研究中心、巴黎萨克雷高等师范学院、LMF、法国吉夫-sur-耶vette) Institut Universitaire de France, Paris, France(法国国家科学院、巴黎,法国)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出基于消息序列图的领域特定语言,用于规范LLM代理协调,解决死锁和消息类型不匹配等问题,通过语法引导投影生成无死锁的局部代理程序,并展示如何在LLM非确定性基础上建立协调属性。

Comments 42 pages; accepted at ISoLA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08877 2026-07-17 cs.AI 57%

Quantifying the Accuracy and Cost Impact of Design Decisions in Budget-Constrained Agentic LLM Search

量化预算约束下代理LLM搜索中的准确性与成本影响

Kyle McCleary, James Ghawaly

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本研究探讨了预算约束下代理LLM搜索中搜索深度、检索策略和完成预算对准确性和成本的影响,并提供了可重复的评估方法和实验结果。

Comments Accepted in 2026 Language Resources and Evaluation Conference (LREC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07944 2026-07-17 stat.ML cs.LG stat.CO 版本更新 57%

Neural Architectures for Amortized Bayesian Inference: Statistical Foundations and Empirical Assessments

用于摊销贝叶斯推理的神经架构:统计基础与实证评估

Roy Shivam Ram Shreshtth, Arnab Hazra, Gourab Mukherjee

机构 * Department of Mathematics and Statistics, Indian Institute of Technology Kanpur(数学与统计学系,印度理工学院坎浦尔分校) Marshall School of Business, University of Southern California(马歇尔商学院,南加州大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 探讨用于摊销贝叶斯推理的神经架构,从统计角度分析前馈网络等架构如何支持摊销推理,通过模拟研究评估其在不同场景下的表现,展现其优势与局限。

Comments 32 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05002 2026-07-17 cs.DB cs.AI 版本更新 57%

AgenticData: An Agentic Data Analytics System for Heterogeneous Data

AgenticData:一种用于异构数据的智能数据分析系统

Ji Sun, Guoliang Li, Peiyao Zhou, Yihui Ma, Jingzhe Xu, Yuan Li

机构 * Department of Computer Science, Tsinghua University(清华大学计算机科学系)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 针对现有非结构化数据分析系统依赖专家且成本高、耗时久的问题,AgenticData通过反馈驱动规划技术及多智能体协作策略,将自然语言查询转换为语义计划并优化执行,经测试在多个基准测试中准确率超现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12548 2026-07-17 cs.LG 版本更新 57%

Human-In-The-Loop Machine Learning for Safe and Ethical Autonomous Vehicles: Principles, Challenges, and Opportunities

用于安全且符合道德的自动驾驶车辆的人在回路机器学习:原理、挑战与机遇

Yousef Emami, Mohammadhossein Homaei, Miguel Gutiérrez Gaitán, Luis Almeida, Kai Li, Hui Huang, Zhu Han

机构 * IEEE

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文针对自动驾驶车辆面临的挑战,对人在回路机器学习进行教程式综述,涵盖课程学习、人在回路强化学习、人在回路大语言模型、主动学习等方法及道德原则,以推动安全且符合道德的自动驾驶发展。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15182 2026-07-17 cs.MA cs.RO 新提交 50%

Stigmergic Graph Memory: An Environment-Aware Approach for Many-to-Many Multi-Agent Pickup and Delivery

stigmergic图记忆:一种用于多对多多智能体取货和送货的环境感知方法

Aditya Dutta, Joon-Seok Kim

机构 * Aditya Dutta, Joon-Seok Kim ∗(Aditya Dutta, Joon-Seok Kim)

专题命中 规划推理 :planning(abstract)

AI总结 研究多对多多智能体取货和送货问题,提出SGM方法,通过记录仓库节点和边的近期执行信号排序端点与路由偏好,在多种布局、负载条件下实验,结果显示该方法能提高仓库吞吐量。

Comments 16 pages total: 7 pages main text, 2 pages references, and 7 pages appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14548 2026-07-17 cs.CV 新提交 50%

HyMobileAgent: Data-Environment Co-Scaling for Efficient GUI Agents

HyMobileAgent:用于高效GUI代理的数据-环境协同扩展

Hy Vision Team, Huawen Shen, Zhengyang Tang, Shangpin Peng, Liang Wu, Anran Zhang, Weinong Wang, Yiduo Guo, Chenxin Li, Zhengyao Fang, Yang Ding, Junyi Li, Fei Tang, Zheng Ruan, Yi Zhang, Xingran Zhou, Dingchen Yang, Sunqi Fan, Zhiyi Wan, Han Hu, Xin Lai, Pengyuan Lyu, Chengquan Zhang

机构 * PhoneWorld Mock App Factory(手机世界模拟应用工厂)

专题命中 规划推理 :planning(abstract)

AI总结 研究移动GUI代理在数字环境中的运行,基于Hy3.0-VL-A3B构建HyMobileAgent,开发数据和环境协同扩展框架,集成多种机制和管道,提出渐进式训练方法,解决移动交互关键瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14547 2026-07-17 cs.CV 新提交 50%

AdaTurn: Budget-Aware Test-Time Scaling for Active Visual Perception Agents

AdaTurn:用于主动视觉感知智能体的预算感知测试时缩放

Susan Liang, Chao Huang, Filippos Bellos, Jing Bi, Jason J Corso, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) Univeristy of Michigan(密歇根大学)

专题命中 规划推理 :reasoning(abstract)

AI总结 研究主动视觉感知智能体在不同预算下的任务执行问题,提出AdaTurn框架,通过强制答案DAPO等组件,根据预算调整智能体行为,提高低预算准确率,且能有效转移到多基准测试中。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 9 篇

2607.14187 2026-07-17 cs.AI cs.RO 新提交 83%

RxBrain: Embodied Cognition Foundation Model with Joint Language-Visual Reasoning and Imagination

RxBrain:具有联合语言-视觉推理与想象的具身认知基础模型

Haotian Liang, Mingkang Chen, Yufei Huang, Yuchun Guo, Xiaomeng Zhu, Xiangli Shi, Kaixuan Wang, Yunxuan Mao, Weijie Zhou, Ling Chen, Shirong Zeng, Yueyu Long, Yuchen Si, Yajuan Zhu, Xingyu Zhou, Minghui Wang, Wanjia He, Xin Yang, Lingzhu Xiang, Zhiqing Liu, Bohan Ma, Xiran Huang, Tianshuo Yang, Zhiheng Liu, Xuantang Xiong, Zisheng Lu, Ping Luo, Yao Mu, Han Hu, Zhengyou Zhang

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 研究提出具身认知基础模型RxBrain,采用统一多模态架构,通过构建自动管道训练,引入RxBrain-Bench评估,能保持具身理解和生成能力,扩展到连续机器人动作生成,为具身认知基础模型发展奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15278 2026-07-17 cs.CV 新提交 82%

Hierarchical Denoising For Multi-Step Visual Reasoning

用于多步视觉推理的分层去噪

Zezhong Qian, Xiaowei Chi, Chak-Wing Mak, Tianze Zhou, Ruibin Yuan, Yuhan Rui, Hengzhe Sun, Zhuoqun Wu, Yuming Li, Siyuan Qian, Sirui Han, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理技术国家重点实验室) The Hong Kong University of Science and Technology(香港科技大学) Beihang University(北京航空航天大学) Fuzhou University(福州大学) Muka Robotics(木卡机器人)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

AI总结 研究针对视频模型多步推理不足的问题,提出HDR框架,通过树形层次结构和稀疏分层注意力模式进行多步推理,在新基准测试中提升了成功率和进度,推理更快,数据效率更高,在机器人实验中展现潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14544 2026-07-17 cs.CV 新提交 78%

3D Geometric Tooth Alignment Planning via Deep Reinforcement Learning

通过深度强化学习进行3D几何牙齿对齐规划

Yong Li, Jianwen Lou, Jiayue Ma, Yao-Xiang Ding, Youyi Zheng, Haihua Zhu

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) State Key Laboratory of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Stomatology Hospital, Zhejiang University School of Medicine(浙江大学医学院附属口腔医院)

专题命中 视觉空间推理 :planning(title,abstract)

AI总结 研究针对3D几何牙齿对齐规划问题,提出基于深度强化学习的框架。利用马尔可夫决策过程,结合三项创新:基于Transformer的智能体、动态掩码方案和两阶段课程学习策略,在数据集上评估,该方法在路径安全和效率上优于基线,提供自动化正畸对齐规划方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18624 2026-07-17 cs.RO cs.AI cs.CV 版本更新 77%

REST: Receding Horizon Explorative Steiner Tree for Zero-Shot Object-Goal Navigation

REST:基于零样本目标导航的视界探索Steiner树

Shuqi Xiao, Maani Ghaffari, Chengzhong Xu, Hui Kong

机构 * State Key Laboratory of Internet of Things for Smart City, University of Macau(智能城市物联网国家重点实验室,澳门大学) University of Michigan(密歇根大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.AI

AI总结 REST通过构建开放词汇3D地图、生成以代理为中心的路径树以及利用LLM推理选择最佳路径,在多个基准测试中实现了高成功率和高效路径效率。

Comments Accepted to IROS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14127 2026-07-17 cs.LG cs.AI cs.ET 新提交 62%

Explainable Geospatial AI for Satellite Ground Station Siting Using LiDAR-Derived Terrain Intelligence

利用激光雷达衍生地形智能的卫星地面站选址可解释地理空间人工智能

Shohini Sarkar, Smithi Mahendran, Rishi Chudasama, Varun Mannam, Arav Luthra, Yuvraj Rekhi, Vivek Nadig, Arsh Goenka

机构 * U.S. Geological Survey(美国地质调查局)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究利用激光雷达衍生地形智能预测卫星地面站选址的代表性杂波高度,提出可解释机器学习框架,用多种数据训练,选LightGBM,模型误差降低超60%,评估相关标准,SHAP识别关键预测因子,证明开放数据可改善杂波建模。

Comments Accepted at the 2026 IEEE 22nd International Conference on Automation Science and Engineering (IEEE CASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15054 2026-07-17 cs.CV 新提交 50%

Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding

超越单一专家:在多模态大语言模型中协调多样视觉先验以实现空间理解

Xiao Lin, Xiaohu Huang, Kai Han

机构 * The University of Hong Kong(香港大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究旨在提升多模态大语言模型的空间理解能力,提出ViPS框架,通过高效先验代理和动态先验融合机制,整合不同模型的视觉先验,经实验验证该框架能协调多样先验,在多基准测试中取得新的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14586 2026-07-17 cs.RO 新提交 50%

SoftNav: Injecting 3D Scene Tokens into VLMs for Embodied Navigation

SoftNav:将3D场景令牌注入视觉语言模型以进行具身导航

Yi Wu, Junjie An, Xiao Liu, Yiqun Zhou, Yuechen Wu, Xiaoqing Guan, Shuyang Yu, You Wang, Guang Li

机构 * Zhejiang University(浙江大学) Shandong University(山东大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究针对具身导航中3D场景理解与导航推理协同问题,提出SoftNav方法,通过轻量级投影仪将3D连续表示作为软令牌注入VLM隐藏空间,在HM3D-OVON上超越先前方法,且能零样本转移到其他场景,弥合表征差距实现可转移导航。

Comments 8 pages, 6 figures. Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14497 2026-07-17 cs.CV 新提交 50%

Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation

通过自我场景增强在多模态大语言模型中强化自我中心空间感知

Chi Kit Wong, Ye Pan, Yuanhuiyi Lyu, Xu Zheng, Zidong Cao, Lutao Jiang, Zixin Zhang, Huiyu Zhou, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Guangxi Zhuang Autonomous Region Information Center(广西壮族自治区信息中心) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究如何强化多模态大语言模型的自我中心空间感知,提出自我场景增强框架ESA,利用自我元素图作为中间表示,通过视觉基础模型增强空间感知,在EgoTextVQA基准上取得显著性能提升。

Comments 14 pages, 8 figures. Chi Kit Wong and Ye Pan contributed equally. Code: https://github.com/Chikit-WONG/spatialGraph

详情

展开后加载摘要…

URL PDF HTML 收藏