arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-18 至 2026-03-18 共收录 28 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 28 篇

2603.14730 2026-03-18 cs.LG 88%

GNNVerifier: Graph-based Verifier for LLM Task Planning

GNNVerifier:基于图的LLM任务规划验证器

Yu Hao, Qiuyu Wang, Cheng Yang, Yawen Li, Zhiqiang Zhang, Chuan Shi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 规划推理 :planning(title,abstract);verifier(title,abstract);分类 cs.LG

AI总结 本文提出基于图的验证器,通过构建任务计划的图结构,利用图神经网络评估计划的合理性,从而纠正LLM生成的计划中的错误。

Comments 17pages,12figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15771 2026-03-18 cs.RO cs.AI 85%

CorrectionPlanner: Self-Correction Planner with Reinforcement Learning in Autonomous Driving

CorrectionPlanner:基于强化学习的自主驾驶自纠正规划器

Yihong Guo, Dongqiangzi Ye, Sijia Chen, Anqi Liu, Xianming Liu

机构 * Department of Computer Science, Johns Hopkins University, Baltimore, USA.(约翰霍普金斯大学计算机科学系)

专题命中 规划推理 :self-correction(title,abstract);reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出CorrectionPlanner,通过自纠正机制在规划过程中生成安全动作,减少碰撞率,提升规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16777 2026-03-18 cs.AI 83%

Anticipatory Planning for Multimodal AI Agents

多模态AI代理的前瞻性规划

Yongyuan Liang, Shijie Zhou, Yu Gu, Hao Tan, Gang Wu, Franck Dernoncourt, Jihyung Kil, Ryan A. Rossi, Ruiyi Zhang

机构 * University of Maryland, College Park(马里兰大学学院公园分校) The Ohio State University(俄亥俄州立大学) Adobe Research(Adobe研究) State University of New York at Buffalo(纽约州立大学布法罗分校)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 本文提出TraceR1框架,通过前瞻性轨迹推理提升多模态代理的规划能力,实现更稳定的执行和泛化性能。

Comments Published at CVPR 2026 Findings Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15255 2026-03-18 cs.AI cs.MA 83%

SAGE: Multi-Agent Self-Evolution for LLM Reasoning

SAGE:多智能体自进化用于大语言模型推理

Yulin Peng, Xinxin Zhu, Chenxing Wei, Nianbo Zeng, Leilei Wang, Ying Tiffany He, F. Richard Yu

机构 * College of Computer Science and Software Engineering, Shenzhen University, China(深圳大学计算机科学与软件工程学院,中国) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ), China(广东省人工智能与数字经济实验室(深圳)) School of Information Technology, Carleton University, Canada(卡尔顿大学信息科技学院,加拿大)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 SAGE通过四智能体协同进化提升LLM推理能力,利用小种子集实现稳定自训练,在数学和代码生成基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16028 2026-03-18 cs.RO 82%

Geometry-Aligned LLM Fine-Tuning for Sequential Narrow-Opening Planning

几何对齐的LLM微调用于序列狭窄开口规划

Al Jaber Mahmud, Xuan Wang

机构 * George Mason University(乔治·马歇尔大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 本文提出几何对齐的LLM微调框架,通过多阶段狭窄开口序列规划实现长视距几何推理,采用失败驱动LoRA监督微调与GRPO优化提升路径可行性。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09295 2026-03-18 cs.MA 82%

MACRO-LLM: LLM-Empowered Multi-Agent Collaborative Reasoning under Spatiotemporal Partial Observability

MACRO-LLM:基于时空部分可观测性的LLM赋能多智能体协作推理

Handi Chen, Running Zhao, Xiuzhe Wu, Edith C. H. Ngai

专题命中 规划推理 :reasoning(title,abstract);planning(abstract)

AI总结 本文提出MACRO-LLM,通过三个模块解决多智能体在时空部分可观测性下的协作推理问题,验证了其在复杂任务中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16017 2026-03-18 cs.CL cs.AI 81%

Understanding Moral Reasoning Trajectories in Large Language Models: Toward Probing-Based Explainability

理解大型语言模型中的道德推理轨迹:迈向基于探测的可解释性

Fan Huang, Haewoon Kwak, Jisun An

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了大型语言模型在道德决策中的推理轨迹,通过分析六个模型和三个基准,发现道德推理涉及多框架 deliberation,提出MRC指标以衡量模型一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15377 2026-03-18 cs.LG cs.AI 81%

More Test-Time Compute Can Hurt: Overestimation Bias in LLM Beam Search

更宽的搜索可能有害:LLM束搜索中的过估计偏差

Gal Dalal, Assaf Hallak, Gal Chechik, Yftah Ziser

机构 * NVIDIA Research(NVIDIA研究实验室) Bar-Ilan University(巴伊兰大学) University of Groningen(格罗宁根大学)

专题命中 规划推理 :test-time compute(title);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了束搜索宽度对LLM输出质量的影响,通过极值理论分析发现,过宽的搜索会引入系统性过估计偏差,提出基于信噪比的束宽选择方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09037 2026-03-18 cs.AI cs.CL 81%

A Survey of Frontiers in LLM Reasoning: Inference Scaling, Learning to Reason, and Agentic Systems

大语言模型推理前沿的综述:推理扩展、学习推理与代理系统

Zixuan Ke, Fangkai Jiao, Yifei Ming, Xuan-Phi Nguyen, Austin Xu, Do Xuan Long, Minzhi Li, Chengwei Qin, Peifeng Wang, Silvio Savarese, Caiming Xiong, Shafiq Joty

机构 * Salesforce AI Research(Salesforce AI研究) National University of Singapore(国立新加坡大学) Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) A*STAR, Singapore(新加坡A*STAR)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文综述了大语言模型推理的前沿方法,从推理阶段和架构两个维度分类,探讨了推理扩展到学习推理及代理系统的发展趋势,涵盖监督微调、强化学习等算法及代理工作流设计。

Comments 72 pages, 6 figures. Accepted to TMLR, with Survey Certification award

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23592 2026-03-18 cs.RO cs.AI cs.SE 79%

KEEP: A KV-Cache-Centric Memory Management System for Efficient Embodied Planning

KEEP: 一种面向高效具身规划的KV缓存中心化内存管理系统

Zebin Yang, Tong Xie, Baotong Lu, Shaoshan Liu, Bo Yu, Meng Li

机构 * Institute for Artificial Intelligence(人工智能研究院) School of Integrated Circuits, Peking University(集成电路学院,北京大学) Shenzhen Institute of Artificial Intelligence(深圳人工智能研究院) Microsoft Research(微软研究院) Beijing Advanced Innovation Center for Integrated Circuits(北京集成电路先进创新中心)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出KEEP系统,通过静态动态内存构建算法、多跳内存重计算算法和层平衡内存加载,提升具身规划效率,实验表明在ALFRED数据集上速度提升2.68倍,优于CacheBlend方法。

Comments DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15663 2026-03-18 cs.CV cs.AI 79%

OrthoAI v2: From Single-Agent Segmentation to Dual-Agent Treatment Planning for Clear Aligners

OrthoAI v2:从单智能体分割到双智能体治疗计划的清晰矫治器

Lansiaux Edouard, Leman Margaux

机构 * STaR-AI Research Group, Emergency Department, Lille University Hospital(STaR-AI研究组,急诊科,里尔大学医院)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 OrthoAI v2通过双智能体框架提升正畸治疗计划精度,实现牙科地标检测、复合生物力学评分模型和多帧治疗模拟,显著提升规划质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14497 2026-03-18 cs.CV cs.RO 78%

WorldVLM: Combining World Model Forecasting and Vision-Language Reasoning

WorldVLM:结合世界模型预测与视觉语言推理

Stefan Englmeier, Katharina Winter, Fabian B. Flohr

机构 * Munich University of Applied Sciences(慕尼黑应用科学大学)

专题命中 规划推理 :reasoning(title,abstract)

AI总结 WorldVLM结合视觉语言模型与世界模型,通过统一架构提升自动驾驶中的环境预测与决策能力,解决空间理解受限问题。

Comments 8 pages, 6 figures, 5 tables; submitted to IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15777 2026-03-18 cs.HC 78%

Lessons from Real-World Deployment of a Cognition-Preserving Writing Tool: Students Actively Engage with Critical Thinking and Planning Affordances

从真实世界部署认知保留写作工具中的经验:学生主动参与批判性思维和规划 affordances

Yinuo Yang, Zheng Zhang, Ningzhi Tang, Xu Wang, Alex Ambrose, Nathaniel Myers, Patrick Clauss, Toby Jia-Jun Li

专题命中 规划推理 :planning(title,abstract)

AI总结 本文研究了AI写作工具VISAR在真实课堂中的应用,发现学生通过认知保留支架获得学习提升,且与写作质量、概念理解及批判性AI素养正相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06993 2026-03-18 cs.AI cs.CV 74%

IMAIA: Interactive Maps AI Assistant for Travel Planning and Geo-Spatial Intelligence

IMAIA:交互式地图AI助手用于旅行规划和地理空间智能

Jieren Deng, Zhizhang Hu, Ziyan He, Aleksandar Cvetkovic, Pak Kiu Chung, Dragomir Yankov, Chiqun Zhang

机构 * Microsoft(微软) Amazon(亚马逊)

专题命中 规划推理 :planning(title);分类 cs.AI

AI总结 IMAIA通过自然语言交互整合矢量地图和卫星影像,结合地理空间信息提升地图相关问答和摄像头到地点的关联能力,实现空间感知的对话式地图系统。

Comments Accepted to The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16822 2026-03-18 cs.AI 70%

Surg$Σ$: A Spectrum of Large-Scale Multimodal Data and Foundation Models for Surgical Intelligence

Surg$Σ$: 一种大规模多模态数据和基础模型的光谱,用于外科智能

Zhitao Zeng, Mengya Xu, Jian Jiang, Pengfei Guo, Yunqiu Xu, Zhu Zhuo, Chang Han Low, Yufan He, Dong Yang, Chenxi Lin, Yiming Gu, Jiaxin Guo, Yutong Ban, Daguang Xu, Qi Dou, Yueming Jin

机构 * NUS(新加坡国立大学) CUHK(香港中文大学) SJTU(上海交通大学) NVIDIA(英伟达)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出Surg$Σ$,通过大规模多模态数据和基础模型提升外科智能,解决现有框架任务特定、泛化能力差的问题,展示统一语义设计和结构化推理标注的改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21790 2026-03-18 econ.EM cs.AI 70%

Can large language models assist choice modelling? Insights into prompting strategies and current models capabilities

大语言模型能否协助选择建模?关于提示策略和当前模型能力的洞察

Georges Sfeir, Gabriel Nova, Stephane Hess, Sander van Cranenburgh

机构 * Choice Modelling Centre & Institute for Transport Studies, University of Leeds(选择建模中心及交通研究学院,利兹大学) CityAI Lab, Transport and Logistics group, Engineering Systems and Services Department, TU Delft(CityAI实验室,运输与物流组,工程系统与服务部门,代尔夫特理工大学)

专题命中 规划推理 :reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 本文研究大语言模型在离散选择建模中的潜力,通过实验框架评估七种领先模型在不同提示策略和信息可用性下的表现,揭示其在模型规范和估计中的能力与限制。

Comments 35 pages, 8 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15653 2026-03-18 cs.CL cs.AI cs.LG 67%

Recursive Language Models Meet Uncertainty: The Surprising Effectiveness of Self-Reflective Program Search for Long Context

递归语言模型与不确定性:自我反思程序搜索在长上下文中的意外效果

Keivan Alizadeh, Parshin Shojaee, Minsik Cho, Mehrdad Farajtabar

机构 * Apple(苹果公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SRLM框架,通过引入不确定性感知的自我反思,提升长上下文处理能力,实验显示其在多种任务中优于现有基线,且无需递归机制。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16171 2026-03-18 cs.IR cs.AI 57%

MemX: A Local-First Long-Term Memory System for AI Assistants

MemX:面向AI助手的本地优先长期记忆系统

Lizheng Sun

机构 * Lizheng Sun(孙立政)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 MemX是一种本地优先的长期记忆系统,通过向量召回、关键词召回和RRF等方法提升检索稳定性,实验表明其在中文基准测试中达到91.3%的Hit@1精度,且在长文本检索中表现出色。

Comments 18 pages, 2 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15946 2026-03-18 cs.AI 57%

Argumentative Human-AI Decision-Making: Toward AI Agents That Reason With Us, Not For Us

论证型人机决策:迈向与我们共思而非为我们决策的AI代理

Stylianos Loukas Vasileiou, Antonio Rago, Francesca Toni, William Yeoh

机构 * New Mexico State University(新墨西哥州立大学) King's College London(伦敦国王学院) Imperial College London(伦敦帝国学院) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨论证型人机决策的新范式,结合论证框架挖掘、合成与推理,使AI代理能与人类进行辩证互动,提升高风险领域的人工智能可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05469 2026-03-18 cs.AI cs.CV cs.CY cs.HC 57%

From Image Generation to Infrastructure Design: a Multi-agent Pipeline for Street Design Generation

从图像生成到基础设施设计:一种多智能体管道用于街道设计生成

Chenguang Wang, Xiang Yan, Yilong Dai, Ziyi Wang, Susu Xu

机构 * Johns Hopkins University(约翰霍普金斯大学) Stony Brook University(石溪大学) University of Florida(佛罗里达大学) University of Maryland(马里兰大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出一种多智能体系统,直接在真实街道视图上编辑和重新设计自行车设施,整合车道定位、提示优化、设计生成和自动评估,生成符合情境的街道设计。

Comments 25 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15809 2026-03-18 cs.MA cs.AI 57%

Don't Trust Stubborn Neighbors: A Security Framework for Agentic Networks

不要信任固执的邻居:代理网络的安全框架

Samira Abedini, Sina Mavali, Lea Schönherr, Martin Pawelczyk, Rebekka Burkholz

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心) University of Vienna, Faculty of Computer Science(维也纳大学计算机科学系)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文研究了基于大语言模型的多代理系统中恶意代理传播虚假信息的风险,提出理论框架并通过实验验证了增加良性代理、提升固执度或降低对敌方信任可增强系统安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15707 2026-03-18 cs.SE cs.AI 57%

SEMAG: Self-Evolutionary Multi-Agent Code Generation

SEMAG:自演化多智能体代码生成

Yulin Peng, Haowen Hou, Xinxin Zhu, Ying Tiffany He, F. Richard Yu

机构 * College of Computer Science and Software Engineering, Shenzhen University, China(深圳大学计算机科学与软件工程学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ), China(广东省人工智能与数字经济发展实验室(深圳)) School of Information Technology, Carleton University, Canada(卡尔顿大学信息技术学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 SEMAG通过自演化多智能体框架提升代码生成适应性,实现更高准确率和更强的模型自适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15623 2026-03-18 cs.IR cs.AI 57%

Finder: A Multimodal AI-Powered Search Framework for Pharmaceutical Data Retrieval

Finder:一种多模态AI驱动的制药数据检索框架

Suyash Mishra, Srikanth Patil, Satyanarayan Pati, Sagar Sahu, Baddu Narendra

机构 * Researcher, Global Product Strategy F. Hoffmann-La Roche Ltd. Basel, Switzerland(全球产品战略研究员 罗氏有限公司 巴塞尔,瑞士) Associate Vice President (Gen AI) Involead Services Pvt Ltd. Pune, India(高级副总裁(生成式人工智能) Involead服务私人有限公司 普纳,印度) Lead Data Scientist Involead Services Pvt Ltd. Delhi, India(首席数据科学家 Involead服务私人有限公司 德里,印度) Data Scientist Involead Services Pvt Ltd. Bhubaneswar, India(数据科学家 Involead服务私人有限公司 奇塔拉,印度)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 Finder利用混合向量搜索统一文本、图像、音频和视频的检索,通过稀疏词汇和密集语义模型提升多模态内容处理能力,支持自然语言推理搜索,已处理超过29万文档、3.1万视频和1192音频文件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16860 2026-03-18 cs.RO 50%

DreamPlan: Efficient Reinforcement Fine-Tuning of Vision-Language Planners via Video World Models

DreamPlan: 通过视频世界模型高效强化微调视觉语言规划器

Emily Yue-Ting Jia, Weiduo Yuan, Tianheng Shi, Vitor Guizilini, Jiageng Mao, Yue Wang

机构 * USC Physical Superintelligence Lab(USC物理超智能实验室) Toyota Research Institute(丰田研究院)

专题命中 规划推理 :reasoning(abstract)

AI总结 DreamPlan通过视频世界模型高效强化微调视觉语言规划器,利用零样本VLM生成探索数据训练动作条件视频生成模型,再通过ORPO在虚拟环境中微调VLM,提升物体 manipulation 成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16382 2026-03-18 cs.CR 50%

Rotated Robustness: A Training-Free Defense against Bit-Flip Attacks on Large Language Models

旋转鲁棒性:一种对抗大语言模型位翻转攻击的无训练防御方法

Deng Liu, Song Chen

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出旋转鲁棒性(RoR),通过正交Householder变换对激活空间进行旋转,有效消除激活异常值与敏感权重之间的对齐,提升大语言模型的可靠性。

Comments 13 pages, 8 figures. Preprint. Under review at IEEE Transactions on Information Forensics and Security

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16054 2026-03-18 cs.DC 50%

inference-fleet-sim: A Queueing-Theory-Grounded Fleet Capacity Planner for LLM Inference

inference-fleet-sim: 一个基于排队论的LLM推理舰队容量规划器

Huamin Chen, Xunzhuo Liu, Yuhan Liu, Junchen Jiang, Bowei He, Xue Liu

专题命中 规划推理 :planning(abstract)

AI总结 本文提出inference-fleet-sim,结合分析排队模型与离散事件模拟,解决LLM推理GPU舰队的容量规划问题,通过物理感知的GPU性能模型和多种拓扑结构,实现实验验证。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10349 2026-03-18 cs.CV 50%

EmoStory: Emotion-Aware Story Generation

EmoStory:情感感知的故事生成

Jingyuan Yang, Rucong Chen, Weibin Luo, Hui Huang

机构 * CSSE, Shenzhen University(安全科学与工程学院,深圳大学)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出EmoStory,一种情感感知的故事生成方法,通过两阶段框架整合基于代理的故事规划与区域感知生成,提升情感准确性、提示对齐和主体一致性。

Comments accepted to ICME

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21676 2026-03-18 cs.RO cs.NI 50%

Real-World Deployment of Cloud-based Autonomous Mobility Systems for Outdoor and Indoor Environments

云原生自主移动系统在户外和室内环境中的实际部署

Yufeng Yang, Minghao Ning, Keqi Shu, Aladdin Saleh, Ehsan Hashemi, Amir Khajepour

机构 * Department of Mechanical and Mechatronics Engineering, University of Waterloo(滑铁卢大学机械与机电工程系) Technology Partnerships and Innovations, Rogers Communications, Canada Inc.(罗杰斯通讯加拿大有限公司技术伙伴关系与创新部) Mechanical Engineering Department, University of Alberta(阿尔伯塔大学机械工程系)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出云原生自主移动框架,通过基础设施智能传感与云计算协调提升自主操作能力,实验证明在城市环岛和医院类室内环境中的感知鲁棒性和安全性提升。

Comments This paper has been submitted to IEEE Robotics and Automation Magazine

详情

展开后加载摘要…

URL PDF HTML 收藏