arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-11 至 2026-03-11 共收录 100 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 24 篇

2603.08988 2026-03-11 cs.RO 78%

Characterization, Analytical Planning, and Hybrid Force Control for the Inspire RH56DFX Hand

Inspire RH56DFX手的表征、分析规划与混合力控

Xuan Tan, William Xie, Nikolaus Correll

机构 * Department of Computer Science, University of Colorado Boulder(计算机科学系,科罗拉多大学博尔德分校)

专题命中 规划推理 :planning(title,abstract)

AI总结 本文通过硬件表征、MuJoCo模型和混合力控方法改进Inspire RH56DFX手,提升其在抓取任务中的性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09481 2026-03-11 cs.AI 77%

GenePlan: Evolving Better Generalized PDDL Plans using Large Language Models

GenePlan: 利用大语言模型改进PDDL计划的进化方法

Andrew Murray, Danial Dervovic, Alberto Pozanco, Michael Cashmore

专题命中 规划推理 :chain-of-thought(abstract);CoT(abstract);planning(abstract);分类 cs.AI

AI总结 GenePlan利用大语言模型改进PDDL计划的进化方法,通过优化问题生成高效且低成本的通用计划器,实现了与最先进方法相近的性能。

Comments 54 pages, 4 figures. Accepted to ICAPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18988 2026-03-11 cs.CL 77%

Markovian Transformers for Informative Language Modeling

马尔可夫变换器用于信息语言建模

Scott Viteri, Max Lamparth, Peter Chatain, Clark Barrett

机构 * Department of Computer Science Stanford University(计算机科学系 斯坦福大学)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 马尔可夫变换器通过引入CoT瓶颈提升语言模型的推理能力,实验显示其在问答任务中表现优异,且对CoT依赖性强。

Comments 21 pages, 6 figures, Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15242 2026-03-11 cs.LG 77%

Bradley-Terry Policy Optimization for Generative Preference Modeling

基于布雷德利-蒂尔利模型的生成偏好建模政策优化

Shengyu Feng, Yun He, Shuang Ma, Beibin Li, Yuanhao Xiong, Songlin Li, Karishma Mandyam, Julian Katz-Samuels, Shengjie Bi, Licheng Yu, Hejia Zhang, Karthik Abinav Sankararaman, Han Fang, Yiming Yang, Manaal Faruqui

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 本文提出布雷德利-蒂尔利政策优化(BTPO),通过引入链式推理改变偏好建模的似然结构,实现对生成偏好模型的有效训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12667 2026-03-11 cs.AI 70%

Empowering All-in-Loop Health Management of Spacecraft Power System in the Mega-Constellation Era via Human-AI Collaboration

通过人机协作赋能航天器电力系统在 mega-星座时代中的全闭环健康管理

Yi Di, Zhibin Zhao, Fujin Wang, Xue Liu, Jiafeng Tang, Jiaxin Ren, Zhi Zhai, Xuefeng Chen

专题命中 规划推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种基于人机协作的航天器电力系统全闭环健康管理框架,通过开源工具和数据集实现了高效的健康管理与故障诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08954 2026-03-11 cs.AI cs.CL cs.DC cs.IR cs.LG 67%

A Consensus-Driven Multi-LLM Pipeline for Missing-Person Investigations

基于共识的多语言模型流水线用于失踪人员调查

Joshua Castillo, Ravi Mukkamala

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于共识的多语言模型流水线,用于失踪人员调查,通过协调多个任务专用的 LLM 模型和共识引擎,提升信息提取和处理的效率与准确性。

Comments Accepted to CAC: Applied Computing & Automation Conferences 2026. 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09916 2026-03-11 eess.SY cs.AI cs.SY 57%

AI-Enabled Data-driven Intelligence for Spectrum Demand Estimation

基于人工智能的数据驱动智能用于频谱需求估计

Colin Brown, Mohamad Alkadamani, Halim Yanikomeroglu

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出基于人工智能的数据驱动方法,利用机器学习模型准确预测频谱需求,通过验证代理提升预测精度,助力频谱资源的动态规划与管理。

Comments Presented at an IEEE ICC 2025 Workshop and published in the conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09716 2026-03-11 cs.AI 57%

AutoAgent: Evolving Cognition and Elastic Memory Orchestration for Adaptive Agents

AutoAgent:为自适应智能体演化认知与弹性记忆编排

Xiaoxing Wang, Ning Liao, Shikun Wei, Chen Tang, Feiyu Xiong

机构 * MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)科技有限公司) Shanghai Jiao Tong University(上海交通大学) Institute for Advanced Algorithms Research, Shanghai(上海先进算法研究所)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 AutoAgent通过自我进化多智能体框架,实现动态认知演化与弹性记忆编排,提升智能体在动态环境中的适应性和任务执行效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09250 2026-03-11 cs.IR 50%

Evoking User Memory: Personalizing LLM via Recollection-Familiarity Adaptive Retrieval

唤起用户记忆:通过回忆-熟悉度适应检索个性化LLM

Yingyi Zhang, Junyi Li, Wenlin Zhang, Penyue Jia, Xianneng Li, Yichao Wang, Derong Xu, Yi Wen, Huifeng Guo, Yong Liu, Xiangyu Zhao

专题命中 规划推理 :reasoning(abstract)

AI总结 RF-Mem通过双路径记忆检索实现个性化LLM,结合回忆与熟悉度机制提升记忆检索效率和准确性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 13 篇

2603.09163 2026-03-11 cs.RO 80%

SPAN-Nav: Generalized Spatial Awareness for Versatile Vision-Language Navigation

SPAN-Nav: 通用空间感知用于多功能视觉-语言导航

Jiahang Liu, Tianyu Xu, Jiawei Chen, Lu Yue, Jiazhao Zhang, Zhiyong Wang, Minghan Li, Qisheng Zhao, Anqi Li, Qi Su, Zhizheng Zhang, He Wang

机构 * Peking University(北京大学) Galbot BAAI(北京人工智能研究院)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)

AI总结 SPAN-Nav通过端到端模型和空间感知机制,在复杂环境中实现高效的视觉-语言导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09774 2026-03-11 cs.AI 79%

World2Mind: Cognition Toolkit for Allocentric Spatial Reasoning in Foundation Models

World2Mind: 用于基础模型的方位认知工具包

Shouwei Ruan, Bin Wang, Zhenyu Wu, Qihui Zhu, Yuxiang Zhang, Hang Su, Yubin Wang

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University(清华大学人工智能院计算机科学与技术系、清华大学-博世联合机器学习中心、THBI实验室、BNRist中心、清华大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 World2Mind通过构建空间认知地图和三阶段推理链,提升基础模型的空间推理能力,使纯文本模型也能实现复杂3D空间推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24427 2026-03-11 cs.CL 79%

SynthWorlds: Controlled Parallel Worlds for Disentangling Reasoning and Knowledge in Language Models

SynthWorlds: 用于语言模型中推理与知识分离的受控并行世界

Ken Gu, Advait Bhat, Mike A Merrill, Robert West, Xin Liu, Daniel McDuff, Tim Althoff

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学) EPFL(苏黎世联邦理工学院) Google Research(谷歌研究)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL

AI总结 SynthWorlds通过构建两个结构相同的并行世界,分离语言模型的推理与知识能力,揭示了模型在仅依赖参数化知识和知识增强设置下的性能差异。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03733 2026-03-11 cs.CV 78%

RegionReasoner: Region-Grounded Multi-Round Visual Reasoning

RegionReasoner: 基于区域的多轮视觉推理

Wenfang Sun, Hao Chen, Yingjun Du, Yefeng Zheng, Cees G. M. Snoek

机构 * University of Amsterdam(阿姆斯特丹大学) Anhui University(安徽大学) Westlake University(西湖大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 RegionReasoner通过强化学习框架,结合接地保真度和全局-局部语义对齐,提升多轮视觉推理的准确性和一致性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09079 2026-03-11 cs.CV cs.AI cs.RO 77%

GST-VLA: Structured Gaussian Spatial Tokens for 3D Depth-Aware Vision-Language-Action Models

GST-VLA: 结构化高斯空间标记用于3D深度感知视觉-语言-动作模型

Md Selim Sarowar, Omer Tariq, Sungho Kim

机构 * Yeungnam University(延世大学) Korea Advanced Institute of Science and Technology, KAIST(韩国科学技术院)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 GST-VLA通过结构化高斯空间标记和深度感知链式思维提升3D视觉-语言-动作模型的精度和性能。

Comments The results presented in this paper are preliminary. Please note that the experiments are currently ongoing, and the final data is subject to change upon the completion of the study. All ideas, results, methods, and any content herein are the sole property of the authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17439 2026-03-11 cs.RO cs.AI cs.CV cs.LG 62%

From Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priors

从空间到动作:在空间先验基础上构建视觉-语言-动作模型

Zhengshen Zhang, Hao Li, Yalun Dai, Zhengbang Zhu, Lei Zhou, Chenchen Liu, Dong Wang, Francis E. H. Tay, Sijin Chen, Ziwei Liu, Yuxiao Liu, Xinghang Li, Pan Zhou

机构 * ByteDance Seed(字节跳动种子) NUS(新加坡国立大学) NTU(国立技术大学) THU(清华大学) SMU(南方大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 FALCON通过引入丰富的3D空间标记,改进了视觉-语言-动作模型的空间表示、模态可转移性和对齐能力,在多个基准和现实任务中取得最佳性能。

Comments Accepted at ICLR 2026. Project page: https://falcon-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08173 2026-03-11 cs.RO cs.AI cs.CL cs.CV 62%

NavSpace: How Navigation Agents Follow Spatial Intelligence Instructions

NavSpace: 导航代理如何遵循空间智能指令

Haolin Yang, Yuxing Long, Zhuoyuan Yu, Zihan Yang, Minghan Wang, Jiapeng Xu, Yihan Wang, Ziyan Yu, Wenzhe Cai, Lei Kang, Hao Dong

机构 * CFCS, School of Computer Science, Peking University(计算机学院,北京大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 NavSpace基准测试通过评估导航代理的空间感知与推理能力,提出SNav模型在指令遵循任务中表现优异,为具身智能研究提供新基准。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09740 2026-03-11 cs.RO cs.CV 50%

Let's Reward Step-by-Step: Step-Aware Contrastive Alignment for Vision-Language Navigation in Continuous Environments

逐步奖励:面向连续环境的视觉语言导航中的步骤感知对比对齐

Haoyuan Li, Rui Liu, Hehe Fan, Yi Yang

机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou, China(浙江大学计算机科学与技术学院,杭州,中国)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出SACA框架,通过步骤感知对比对齐提升连续环境中视觉语言导航的性能,解决传统方法在错误恢复和训练稳定性方面的不足。

Comments 28 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09538 2026-03-11 cs.CV 50%

Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization

迈向统一多模态交错生成的群体相对策略优化

Ming Nie, Chunwei Wang, Jianhua Han, Hang Xu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Noah’s Ark Lab, Huawei(华为诺亚实验室) Yinwang Intelligent Technology Co., Ltd.(亿恒智能科技有限公司)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出基于强化学习的后训练策略,通过群体相对策略优化框架提升统一多模态模型的交错生成能力,实验表明其在质量与连贯性上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09466 2026-03-11 cs.CV 50%

TopoOR: A Unified Topological Scene Representation for the Operating Room

TopoOR: 一种用于手术室的统一拓扑场景表示

Tony Danjun Wang, Ka Young Kim, Tolga Birdal, Nassir Navab, Lennart Bastian

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Imperial College London(伦敦帝国理工学院) Kyung Hee University(韩国庆熙大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 TopoOR通过更高阶拓扑结构建模手术室的多模态特性,提升场景表达能力,优于传统图和LLM基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09173 2026-03-11 cs.CV 50%

Point Cloud as a Foreign Language for Multi-modal Large Language Model

点云作为多模态大语言模型的外语

Sneha Paul, Zachary Patterson, Nizar Bouguila

机构 * Concordia University(康科迪亚大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 SAGE是首个端到端3D多模态大语言模型,通过轻量级3D分词器直接处理点云,提升3D任务的推理能力与鲁棒性。

Comments Accepted in The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09100 2026-03-11 cs.SE 50%

Class Model Generation from Requirements using Large Language Models

基于大型语言模型的需求生成类模型

Jackson Nguyen, Rui En Koe, Fanyu Wang, Chetan Arora, Alessio Ferrari

专题命中 视觉空间推理 :chain-of-thought(abstract)

AI总结 本文研究了大型语言模型在自动从自然语言需求生成UML类图方面的有效性,通过双验证框架评估模型生成的准确性和一致性。

Comments Accepted by The Eighth Workshop on Modeling and Simulation of Software-Intensive Systems (MSSiS 2026), ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09070 2026-03-11 cs.RO 50%

3D UAV Trajectory Estimation and Classification from Internet Videos via Language Model

通过语言模型从互联网视频中估计和分类3D无人机轨迹

Haoxiang Lei, Daotong Wang, Shenghai Yuan, Jianbo Su

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出通过语言模型从互联网视频中估计和分类无人机3D轨迹,无需人工标注,实现了高效的数据采集与轨迹推断。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 1 篇

2603.09052 2026-03-11 cs.AI cs.CL cs.LG 67%

From Days to Minutes: An Autonomous AI Agent Achieves Reliable Clinical Triage in Remote Patient Monitoring

从天到分钟:一个自主AI代理在远程患者监测中实现可靠的临床分诊

Seunghwan Kim, Tiffany H. Kung, Heena Verma, Dilan Edirisinghe, Kaveh Sedehi, Johanna Alvarez, Diane Shilling, Audra Lisa Doyle, Ajit Chary, William Borden, Ming Jack Po

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Sentinel通过自主AI代理实现远程患者监测的高效分诊,超越个体医生的灵敏度,提供可扩展且临床可行的解决方案。

Comments 46 pages, 11 figures, Abstract in metadata is shortened to meet arXiv character limits; see PDF for full version

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 10 篇

2511.08317 2026-03-11 cs.CL 79%

Automatic Paper Reviewing with Heterogeneous Graph Reasoning over LLM-Simulated Reviewer-Author Debates

基于异构图推理的自动论文评审:LLM模拟的评审者-作者辩论

Shuaimin Li, Liyang Fan, Yufang Lin, Zeyang Li, Xian Wei, Shiwen Ni, Hamid Alinejad-Rokny, Min Yang

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 ReViewGraph通过异构图推理分析LLM模拟的评审者-作者辩论,提升论文评审的准确性和细致程度。

Journal ref AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09641 2026-03-11 cs.AI cs.IR 74%

PRECEPT: Planning Resilience via Experience, Context Engineering & Probing Trajectories A Unified Framework for Test-Time Adaptation with Compositional Rule Learning and Pareto-Guided Prompt Evolution

PRECEPT:通过经验、上下文工程与轨迹探测进行规划韧性 一个具有组合规则学习和帕累托引导提示演化的测试时间适应统一框架

Arash Shahmansoori

专题命中 复杂问题求解 :planning(title);分类 cs.AI

AI总结 PRECEPT通过经验、上下文工程与轨迹探测,结合组合规则学习和帕累托引导提示演化,提升测试时间适应的鲁棒性和泛化能力。

Comments 50 pages, 14 figures. Code and reproducibility resources: https://github.com/arash-shahmansoori/precept-framework

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09152 2026-03-11 cs.AI cs.DB cs.IR 70%

DataFactory: Collaborative Multi-Agent Framework for Advanced Table Question Answering

DataFactory: 用于高级表格问答的协作多智能体框架

Tong Wang, Chi Jin, Yongkang Chen, Huan Deng, Xiaohui Kuang, Gang Zhao

机构 * Institute of Systems Engineering, Academy of Military Sciences(系统工程研究所,军事科学院) School of Information Resource Management, Renmin University of China(信息资源管理学院,中国人民大学)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 DataFactory通过多智能体协作框架提升表格问答的准确性和鲁棒性,采用ReAct范式和自动知识转换,显著提高查询精度和多跳推理能力。

Comments Published in Information Processing & Management, 2026

Journal ref Information Processing & Management, 63(6):104723, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22607 2026-03-11 cs.AI cs.CL 62%

From Self-Evolving Synthetic Data to Verifiable-Reward RL: Post-Training Multi-turn Interactive Tool-Using Agents

从自演化合成数据到可验证奖励强化学习:训练后多轮交互工具使用智能体

Jiaxuan Gao, Jiaao Chen, Chuyi He, Shusheng Xu, Di Jin, Yi Wu

专题命中 复杂问题求解 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EigenData框架,结合自演化数据代理与验证器强化学习,通过合成数据提升多轮交互工具使用智能体的训练效率和性能。

Comments Submitted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08754 2026-03-11 cs.LG cs.AI 62%

Hindsight Credit Assignment for Long-Horizon LLM Agents

长远时间LLM智能体的回顾信用分配

Hui-Ze Tan, Xiao-Wen Yang, Hao Chen, Jie-Jing Shao, Yi Wen, Yuteng Shen, Weihong Luo, Xiku Du, Lan-Zhe Guo, Yu-Feng Li

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 HCAPO通过整合回顾信用分配提升LLM智能体在长期任务中的探索效率和决策简洁性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17102 2026-03-11 cs.AI 57%

Reinforcement Learning for Self-Improving Agent with Skill Library

基于技能库的自我改进智能体强化学习

Jiongxiao Wang, Qiaojing Yan, Yawei Wang, Yijun Tian, Soumya Smruti Mishra, Zhichao Xu, Megha Gandhi, Panpan Xu, Lin Lee Cheong

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) AWS Agentic AI(AWS智能代理)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SAGE框架,通过强化学习结合技能库,提升智能体在新环境中的自我改进能力,实验显示其在准确性和效率上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09018 2026-03-11 cs.AI 57%

Meissa: Multi-modal Medical Agentic Intelligence

Meissa:多模态医疗代理智能

Yixiong Chen, Xinyi Bai, Yue Pan, Zongwei Zhou, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学) Cornell University(康奈尔大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 Meissa是一种轻量级多模态医疗代理智能模型,通过离线学习策略选择与执行,实现高效医疗决策。

详情

展开后加载摘要…

URL PDF HTML 收藏