arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-14 至 2026-07-14 共收录 193 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 46 篇

2607.10588 2026-07-14 cs.AI cs.CL 新提交 62%

Constraint-Aware Hierarchical Search for Regulation-Driven Fine-Grained Classification

用于规则驱动的细粒度分类的约束感知层次搜索

Siyu Wang, Wei Tan, Lulu Chen

机构 * Gusu Laboratory of Materials(姑苏材料实验室) Chongqing Institute of Engineering(重庆工程学院) Suzhou Digital China Wuxin Intelligent Technology Co., Ltd.(苏州神州数码五新智能科技有限公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对规则驱动的细粒度分类任务,现有方法存在不足。本文构建基准数据集,提出约束感知层次搜索框架,将监管文件转换为可搜索树,只检索有效局部候选节点,实验证明该方法准确率高且能提供可解释决策路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10555 2026-07-14 cs.IR cs.AI cs.CL 新提交 62%

Tool-Adaptive LLM Reranker

工具自适应语言模型重排器

Zichuan Liu, Ruijin Hua

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对生成式大语言模型在复杂查询时的事实幻觉及重排延迟问题,提出TALRanker框架,将相关性评分形式化为马尔可夫决策过程,经两阶段训练优化,在检索基准上性能领先,兼顾吞吐量与准确性。

Comments 12 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11433 2026-07-14 cs.AI 新提交 57%

Omni-Decision: A Progressive Evidence-State Agent System for Omni-Modal QA

全决策:一种用于全模态问答的渐进式证据状态智能体系统

Ming Ma, Yi Zhu, Yiran Zhong, Feida Zhu, Weigao Sun, Junhan Shi, Lingrui Mei, Tianming Yang, Steven Hoi

机构 * Institute of Neuroscience, Chinese Academy of Sciences(中国科学院神经科学研究所) University of Chinese Academy of Sciences(中国科学院大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) Tsinghua University(清华大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究全模态问答中证据分散问题,提出全决策系统,将问答转化为证据闭合过程,维护结构化证据状态,通过确定性状态更新处理异构观察,提升了准确率,验证了证据状态控制在多步证据寻求中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11084 2026-07-14 cs.AI 新提交 57%

NVAITC AI Scientist: A Governed End-to-End Research System -- A Hypertension GWAS Case Study

NVAITC人工智能科学家:一个受治理的端到端研究系统——以高血压全基因组关联研究为例

Eddie Huang, Ken Liao, Iven Fu, Yang-Hsien Lin, Chao-Shun Zhan, Andy Liao, Virginia Chen, Johnson Sun, Pika Wang, Richard Huang, Jiun-Cheng Jiang, Ting-Yuan Liu, Hsing-Fang Lu, Ray Y. Lee, Chi-Chou Liao, Simon See, Fuu-Jen Tsai

机构 * Department of Medical Research, China Medical University Hospital(中国医药大学附设医院医学研究部) Master Program for Digital Health Innovation, China Medical University(中国医药大学数字健康创新硕士项目) Laboratory for Statistical and Translational Genetics, RIKEN Center for Integrative Medical Sciences(理化学研究所综合医学科学中心统计与转化遗传学实验室) AI-Driven Genomic Medicine and Drug Discovery Lab, China Medical University Hospital(中国医药大学附设医院人工智能驱动的基因组医学与药物发现实验室)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究以高血压GWAS为例,介绍受治理的端到端智能研究系统NAIS,其集成多种功能。通过真实数据验证,NAIS能支持生物医学发现,规划队列提取等,重现高血压基因座,在药物性肝损伤预测中也有成果,可产生与专家主导流程相当的输出。

Comments 22 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10960 2026-07-14 cs.LG q-fin.CP stat.ML 新提交 57%

Reinforcement Learning for Execution under Dynamic Fees in a Closed-Loop DEX Simulator

在闭环去中心化交易所模拟器中基于动态费用的执行强化学习

Wen-Ting Wang

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 研究在闭环去中心化交易所模拟器中,针对动态费用下的执行问题,采用构建最小闭环模拟器及小深度Q网络的方法,得出该方法能减少执行缺口,且优势集中在动态费用环境中的结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10871 2026-07-14 cs.AI cs.HC 新提交 57%

Toward Contemplative LLM: A Modular Framework for Evaluating and Enhancing LLM Alignment in Mental Health

迈向沉思型大语言模型:心理健康领域中评估与增强大语言模型对齐性的模块化框架

Asher Sprigler, Yang-Yang Feng, Iftach Amir, Jonathan E. Bogard, Todd S Braver, Yi Ding, David Kinney, Yixue Zhao

机构 * Purdue University(普渡大学) Washington University in St. Louis(圣路易斯华盛顿大学) Yixue Research Institute(易学研究所)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 针对新模型等涌现使评估沉思原则增强大语言模型对齐性具挑战的问题,提出模块化可扩展评估框架,能集成新元素并重现先进结果,支持交叉评估,其提示模块便于纳入伦理视角,为跨学科研究及有益人机生态系统奠定基础。

Comments Accepted as an oral presentation at HARMONY 2026 (Human-centered AI Research for Mental Health, an Open Networking Symposium), co-located with IEEE/ACM Conference on Connected Health: Applications, Systems, and Engineering Technologies (CHASE 2026) held in Pittsburgh, August 6, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10522 2026-07-14 cs.CV cs.AI 新提交 57%

Towards Autonomous and Auditable Medical Imaging Model Development

迈向自主且可审计的医学成像模型开发

Shengyuan Liu, Jia-Xuan Jiang, Boyun Zheng, Cheng Wang, Zipei Wang, Wentao Pan, Hongtao Wu, Houwen Peng, Yu Gu, Lichao Sun, Yixuan Yuan

机构 * The Chinese University of Hong Kong(香港中文大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Microsoft Research(微软研究院) Lehigh University(里海大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究针对医学成像模型开发困难的问题,提出AMID自主多代理框架。该框架含数据条件方法规划和验证引导两阶段优化,经20个医学成像任务验证,其性能优于通用MLE系统,能将特定任务模型开发转变为高效可审计的代理工作流程。

Comments 18 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10511 2026-07-14 cs.CL 新提交 57%

Articulate Intuition or Genuine Analysis? Benchmarking Epistemic Reliability in LLM-as-a-Judge Peer Reviews

清晰的直觉还是真正的分析?评估大语言模型作为评审员的同行评审中的认知可靠性基准

Nuo Chen, Qian Wang, Qingyun Zou, Bingsheng He

机构 * National University of Singapore(新加坡国立大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 研究大语言模型评审员与人类评审员对同行评审评估的差异,将卡尼曼双过程理论转化为评分标准并发布Kahneman4Review基准,通过多方面发现揭示问题,强调可靠基准应区分分析形式与认知功能并给出设计选择。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10463 2026-07-14 cs.AI cs.IR 新提交 57%

GRASP: GRanularity-Aware Search Policy for Agentic RAG

GRASP:用于智能检索增强生成的粒度感知搜索策略

Varun Gandhi, Jaewook Lee, Shantanu Todmal, Franck Dernoncourt, Ryan Rossi, Zichao Wang, Andrew Lan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Adobe Research(Adobe 研究院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 研究智能体检索增强生成中模型决策难题,提出GRASP强化学习框架,训练智能体协调互补检索工具,实验表明其提升检索召回率和问答性能,还展现出可解释行为,凸显协调检索信号和上下文粒度对智能体推理的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09787 2026-07-14 cs.CV cs.LG 新提交 57%

Adversarially Guided Diffusion for LiDAR Range Image Synthesis

用于激光雷达距离图像合成的对抗引导扩散

Stavros Bouras, Antonios Makris, Alexandros Gkillas, Aris S. Lalos, Konstantinos Tserpes

机构 * School of Electrical and Computer Engineering, National Technical University of Athens(雅典国立技术大学电气与计算机工程学院) Industrial Systems Institute, Athena Research Center(雅典娜研究中心工业系统研究所)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 研究针对二维距离图像分割的无限制对抗攻击,提出基于扩散并利用分割损失对抗引导的方法,在SemanticKITTI数据集实验,能跨架构转移,相比基线在有效性与现实性间有独特权衡,实现可控退化。

Comments Accepted at the 1st Workshop on Secure and Trustworthy AI (STAI 2026), co-located with the European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECML PKDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09322 2026-07-14 cs.AI 版本更新 57%

LongMedBench: Benchmarking Medical Agents for Long-Horizon Clinical Decision-Making

LongMedBench:用于长期临床决策的医疗智能体基准测试

Zihan Xu, Yanzhen Chen, Xiaocheng Zhang, Zhiting Fan, Weiqi Zhai, Hongxia Xu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Transvascular Implantation Devices Research Institute(血管内植入装置研究所)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 介绍基于EHR的LongMedBench基准,用于长期临床决策。构建含多患者多事件数据集,提出评估分类法。实验表明大语言模型在隐式时间推理有挑战,RAG和智能体记忆系统对信息检索有帮助,决策任务性能依赖模型即时上下文。

Comments Submitted manuscript prior to peer review in MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31651 2026-07-14 cs.AI 版本更新 57%

FARS: A Fully Automated Research System Deployed at Scale

FARS:一个大规模部署的全自动研究系统

Qiong Tang, Tianxiang Sun, Xiangkun Hu, Xiangyang Liu, Yiran Chen, Yunfan Shao, Bobo Li, Changze Lv, Cheng Xu, Chengsong Huang, Chunyang Li, Dizhan Xue, Hao Bai, Haodong Duan, Hengquan Guo, Hongyang He, Hongyi Chen, Hui Shen, Jiahao Yuan, Jiankai Sun, Jikang Cheng, Jinfeng Xu, Jingqi Tong, Jingye Chen, Jinxiu Liu, Jixuan Leng, Junchi Yu, Kaixun Jiang, Kun Xiang, Kunpeng Yao, Lang Feng, Liangqi Yuan, Longsen Gao, Meng Li, Qi Jia, Qiushi Sun, Shengyuan Ding, Shizhan Gong, Siru Zhong, Terry Jingchen Zhang, Tianle Gu, Tianyi Liang, Weijie Liu, Weikai Yang, Weizhi Fei, Xin Wang, Xinpeng Liu, Xuanwen Ding, Yihong Tang, Yuanli Wang, Yukun Jiang, Yuming Yang, Zhengbao He, Zhikai Chen, Zhikun Xu, Zhuang Li, Zihao Huang

机构 * Analemma National University of Singapore(新加坡国立大学) Fudan University(复旦大学) University College Dublin(都柏林大学) Washington University in St. Louis(圣路易斯华盛顿大学) The Hong Kong University of Science and Technology(香港科技大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ByteDance(字节跳动) ShanghaiTech University(上海科技大学) University of Warwick(华威大学) Carnegie Mellon University(卡内基梅隆大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) East China Normal University(华东师范大学) Stanford University(斯坦福大学) Tencent(腾讯) The University of Hong Kong(香港大学) Shanghai Innovation Institute(上海创新研究院) Nex-AGI Team(Nex-AGI团队)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 提出FARS系统,通过分阶段智能体协作自动生成研究项目,在67个AI/ML主题上产出166篇论文,经282份评审验证其可产出有价值成果,同时暴露实验范围窄、方法局限和诚信问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03174 2026-07-14 cs.AI 版本更新 57%

InqEduAgent: Adaptive AI Learning Partners with Gaussian Process Augmentation

InqEduAgent:具有高斯过程增强的自适应人工智能学习伙伴

Wen-Xi Yang, Tian-Fang Zhao, Guan Liu

机构 * Guangdong Institute of Smart Education(广东智能教育研究院) Jinan University(暨南大学) School of Journalism and Communication(新闻与传播学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究针对探究式教育中学习伙伴分配问题,提出InqEduAgent框架,集成高斯过程增强匹配机制,能基于先验知识模式选自适应伙伴,实验证明其性能优越,推进了人机协作学习及相关领域发展。

Comments Accepted by the 2026 8th Asia Conference on Machine Learning and Computing (ACMLC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11032 2026-07-14 cs.CY 新提交 50%

LLM-Generated Design Problems for Assessing Higher-Order Thinking in Project-Based Learning

基于项目式学习的高阶思维评估中由大语言模型生成的设计问题

Ahmad D. Suleiman, Daqing Hou, Maliha Noushin Raida

专题命中 规划推理 :planning(abstract)

AI总结 研究针对基于项目式学习中传统评估难以捕捉高阶思维的问题,引入设计问题(DPs),通过调查教师看法、评估大语言模型生成的DPs及学生表现数据等,发现DPs是传统评估的有益补充,能捕捉高阶思维不同方面。

Comments Accepted to appear in Proceedings of the 2nd ACM Virtual Global Computing Education Conference V.1 (SIGCSE Virtual 2026). DOI: 10.1145/3795867.3831014

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10986 2026-07-14 eess.SY cs.SY 新提交 50%

Capture, Shield, or Neutralize: Engagement-Aware Pursuit-Evasion

捕获、防护或中和:基于交战感知的追逃

Ananya Acharya, Trenton Goyette, Masoud Ataei, Adrian Stoica, Vikas Dhiman, Mohammad Javad Khojasteh

专题命中 规划推理 :planning(abstract)

AI总结 研究多智能体对抗环境下的追逃问题,提出分层控制架构,将战略规划与安全保证解耦。通过零和滚动时域博弈及MPC求解,利用横向速度惩罚和CBF保证安全。模拟实验表明该框架能灵活切换策略,不同规则下性能稳健且控制逻辑不变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09673 2026-07-14 cs.CY 新提交 50%

Critsly: An Artefact-Aware AI Critique Teammate for Design Education and Project-Based Learning

Critsly:用于设计教育和基于项目学习的人工制品感知人工智能批判队友

Nizam Kadir, Juan David Salazar Rodriguez, Sumaiyya Al

专题命中 规划推理 :planning(abstract)

AI总结 研究针对设计教育和基于项目学习中高质量批判稀缺等问题,提出Critsly这一人工制品感知的人工智能批判工作区,结合多种功能,将AI变为批判队友,为学习者和教育者提供更优批判实例。

Comments 3 pages, Accepted submission to the 27th International Conference on Artificial Intelligence in Education Interactive Events Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11680 2026-07-14 physics.ed-ph physics.soc-ph 新提交 50%

From Prompt Engineering to Epistemic Prompting: Prompt Trajectories as AI-Mediated Problem Framing in Science Education

从提示工程到认知提示:提示轨迹作为科学教育中人工智能介导的问题框架

Matteo Tuveri

专题命中 规划推理 :reasoning(abstract)

AI总结 研究探讨在STEM教育中提示不仅是技术能力,更是认知实践。基于认识论框架等提出认知提示新框架及多轮循环,形成提示框架轨迹,阐述其构建过程,还讨论了对人工智能介导的STEM教学及学习者与大语言模型交互的影响。

Comments 13 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09361 2026-07-14 cs.DB 版本更新 50%

Bespoke-Card: Why Tune When You Can Generate? Synthesizing Workload-Specific Cardinality Estimators

Bespoke-Card:为何调优而非生成?合成工作负载特定的基数估计器

Johannes Wehrstein, Anton Winter, Timo Eckmann, Carsten Binnig

专题命中 规划推理 :planning(abstract)

AI总结 提出Bespoke-Card系统,通过智能体驱动合成工作负载特定的基数估计器,利用结构化q-error反馈和课程学习等策略,在JOB上降低33%总运行时间和41%中位数q-error。

Comments Accepted for AIDB@VLDB'26 (Boston)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03007 2026-07-14 eess.SY cs.SY 50%

From inconsistency to decision: explainable operation and maintenance of battery energy storage systems

从不一致到决策:电池储能系统的可解释运维

Jingbo Qu, Yijie Wang, Yujie Fu, Putai Zhang, Weihan Li, Mian Li

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出一种基于不一致性的电池储能系统运维方法,通过多维度不一致评估与大语言模型语义推理结合,将监测数据转化为可解释的运维指导,提升运维效率和安全性。

Comments 13 pages, 5 figures

Journal ref Cell Reports Physical Science 7(6), 103388 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06717 2026-07-14 cs.RO 版本更新 50%

SanDRA: Safe Large-Language-Model-Based Decision Making for Automated Vehicles Using Reachability Analysis

SanDRA:基于可达性分析的自动驾驶车辆安全大语言模型决策

Yuanfei Lin, Sebastian Illing, Matthias Althoff

机构 * Department of Computer Engineering, Technical University of Munich(计算机工程系,慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 规划推理 :reasoning(abstract)

AI总结 针对大语言模型用于自动驾驶决策时安全性无法保证的问题,提出SanDRA框架,先描述驾驶场景促使模型生成排序动作,转化为时序逻辑公式并结合可达性分析消除不安全动作,经实验验证能提供安全合规驾驶动作,代码和实验设置公开。

Comments @2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

Journal ref T-ITS, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 20 篇

2606.26104 2026-07-14 cs.CL cs.AI 版本更新 81%

Assert, don't describe: Linguistic features that shift LLM reasoning about animal welfare

断言,而非描述:改变LLM关于动物福利推理的语言特征

Jasmine Brazilek, Harper Dunn

机构 * Compassion Aligned Machine Learning (CaML)(同情对齐机器学习实验室) Independent researcher(独立研究者)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究通过词汇匹配的立场对比探针,测量十种语言特征对Llama-3.2-1B模型动物福利推理的影响,发现断言性确定性等七种特征增强支持动物福利,而模糊语言等两种特征削弱立场。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10991 2026-07-14 cs.RO cs.AI cs.CV 新提交 79%

Think When It Matters: Conditional VLM Reasoning for Social Navigation with RL Policies

在重要时刻思考:用于社交导航的基于RL策略的条件VLM推理

Ali Ahmadi, Hamed Rahimi, Adrien Jacquet Cretides, Marie Samson, Mahdi Khoramshahi, Mohamed Chetouani

机构 * Institut des Systèmes Intelligents et de Robotique (ISIR)(智能系统与机器人研究所)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究社交机器人导航中强化学习策略缺乏语义推理能力的问题,提出HUMA混合架构,动态平衡RL策略与VLM的优势。在基准测试中任务成功率提高,减少碰撞,消融研究验证组件,实际部署证明方法可行。

Comments CoRL 2026 submission. 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09740 2026-07-14 cs.AI cs.CV 新提交 79%

A Dynamic Scene Interaction Reasoning Framework for Scene-level Lane-Change Intention and Trajectory Prediction of Multiple Interacting Vehicles

用于多交互车辆场景级变道意图和轨迹预测的动态场景交互推理框架

Joshua Kofi Asamoah, Blessing Agyei Kyem, Eugene Denteh, Armstrong Aboah

机构 * North Dakota State University(北达科他州立大学)

专题命中 视觉空间推理 :reasoning(title);planning(abstract);分类 cs.AI

AI总结 研究针对多交互车辆场景级变道意图及轨迹预测问题,提出动态场景图注意力框架,将场景表示为时变交互图,通过时态图注意力消息传递等捕捉车辆关系与线索,实验表明该框架能提升预测准确率,降低碰撞率和误差,验证了组件贡献和公式有效性。

Comments 28 pages, 9 Figures, 16 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11173 2026-07-14 cs.CV 新提交 78%

When Depth Is Better Told Than Shown: Depth-Ordinal Prompting for Vision-Language Spatial Reasoning

当深度以文字表述比图像展示更好用时:用于视觉语言空间推理的深度序数提示

Quynh Vo, Phuc Dao, Cong-Duy Nguyen, Thong Nguyen

机构 * National University of Singapore(新加坡国立大学) Center of AI Research, VinUniversity(文大人工智能研究中心)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 研究视觉语言模型空间推理难题,提出深度序数提示(DOP)方法,该方法无需训练,将单目深度转换为序数文本提示,在伪深度提供可靠排序时可改善空间推理,简单且针对性强,与其他无需训练的深度提示方法有竞争力。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05716 2026-07-14 cs.CV 版本更新 78%

Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models

场景图思维:增强多模态大语言模型的结构化视觉推理

Zhiwei Yang, Yuanchen Wu, Nan Zhang, Yucong Meng, Ke Yan, Shouhong Ding

机构 * Fudan University(复旦大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 针对多模态大语言模型忽视结构化关系的问题,提出场景图思维(SaGe)范式,通过自动数据引擎转换数据、构建训练数据,采用两阶段图对齐训练范式,在多模态基准测试中取得显著改进,提升细粒度感知和推理能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17889 2026-07-14 cs.CV 版本更新 78%

AeroRAG: Structured Multimodal Retrieval-Augmented LLM for Fine-Grained Aerial Visual Reasoning

AeroRAG:结构化多模态检索增强型LLM用于细粒度航空视觉推理

Junxiao Xue, Quan Deng, Tingqi Hu, Meicong Si, Xinyi Yin, Yunyun Shi, Xuecheng Wu

机构 * Research Center for Space Computing System, Zhejiang Lab, Hangzhou(杭州浙大实验室空间计算系统研究中心) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou(中国科学院大学杭州高等研究院) School of Cyber Science and Engineering, Zhengzhou University(郑州大学计算机科学与工程学院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出AeroRAG,通过结构化场景图引导的多模态检索增强生成框架,解决航空场景中视觉问答的挑战,提升对小物体、数量、位置及物体关系的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13132 2026-07-14 cs.CV 版本更新 78%

SplatReasoner: Enhancing Embodied Reasoning and Grounding by Novel View Synthesis

SplatReasoner:通过新颖视图合成增强具身推理与基础能力

Kim Yu-Ji, Dahye Lee, Kim Jun-Seong, Nam Hyeon-Woo, GeonU Kim, Yongjin Kwon, Yu-Chiang Frank Wang, Jaesung Choe, Tae-Hyun Oh

机构 * POSTECH KAIST(韩国科学技术院) ETRI(韩国电子电信研究院) NVIDIA(英伟达)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 研究针对视觉语言模型应用于具身场景理解受固定视角限制的问题,提出SplatReasoner框架,利用3D高斯点云将新颖视图合成引入推理过程,经实验验证该方法能提升具身推理和3D基础能力。

Comments Accepted at ECCV 2026. Project page: https://splatreasoner.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11119 2026-07-14 cs.RO cs.AI 新提交 70%

VIA: Visual Interface Agent for Robot Control

VIA:用于机器人控制的视觉接口代理

Hengyuan Hu, Priya Sundaresan, Jensen Gao, Dorsa Sadigh

机构 * Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 研究探索能否用基础模型通过视觉接口控制机器人,提出 VIA 框架,将机器人控制转为代理任务,该框架无需特定微调及特权信息,能零样本解决多种桌面操作任务,凭借基础模型能力提升取得高成功率,证明前沿代理技能可借合适接口用于机器人控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10719 2026-07-14 cs.CV 版本更新 67%

SpaceDrive: Infusing Spatial Awareness into VLM-based Autonomous Driving

SpaceDrive: 在基于视觉语言模型的自动驾驶中引入空间感知

Peizheng Li, Zhenghao Zhang, David Holtz, Hang Yu, Yutong Yang, Yuzhi Lai, Rui Song, Andreas Geiger, Andreas Zell

机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) TU Munich(慕尼黑工业大学) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) University of Stuttgart(斯图加特大学) UCLA(加州大学洛杉矶分校)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出SpaceDrive框架,通过将空间信息作为显式位置编码来增强基于VLM的自动驾驶系统对精细3D空间关系的理解,从而提升规划精度和开放环性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01830 2026-07-14 cs.RO 版本更新 67%

What Matters in RL-Based Methods for Object-Goal Navigation? An Empirical Study and A Unified Framework

基于强化学习的目标导航方法中什么重要?实证研究与统一框架

Hongze Wang, Boyang Sun, Jiaxu Xing, Fan Yang, Marco Hutter, Dhruv Shah, Davide Scaramuzza, Marc Pollefeys

机构 * Computer Vision and Geometry Group, ETH Zurich, Switzerland(苏黎世联邦理工学院计算机视觉与几何组) Robotics and Perception Group, University of Zurich, Switzerland(苏黎世大学机器人与感知组) Robotic Systems Lab, ETH Zurich, Switzerland(苏黎世联邦理工学院机器人系统实验室) Princeton Robotic Intelligence and SysteMs group, Princeton University, USA(普林斯顿大学机器人智能与系统组) Microsoft, Switzerland(微软公司)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 研究目标导航中基于强化学习方法各组件影响,通过分解导航管道为感知、策略和测试时增强三组件进行实证研究,引入统一框架,构建增强系统达领先性能,提供见解与建议,凸显当前智能体与人类导航差距。

详情

展开后加载摘要…

URL PDF HTML 收藏