arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10960 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 10960 篇

2603.01357 2026-03-03 cs.AI 88%

ASTRA-bench: Evaluating Tool-Use Agent Reasoning and Action Planning with Personal User Context

ASTRA-bench: 通过个人用户上下文评估工具使用代理的推理与行动规划

Zidi Xiu, David Q. Sun, Kevin Cheng, Maitrik Patel, Josh Date, Yizhe Zhang, Jiarui Lu, Omar Attia, Raviteja Vemulapalli, Oncel Tuzel, Meng Cao, Samy Bengio

机构 * Apple(苹果公司)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

AI总结 ASTRA-bench通过模拟真实用户情境,评估AI代理在复杂个人上下文中进行推理与多步骤计划的能力,揭示当前模型在处理高复杂度任务时的性能瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24378 2026-03-03 cs.AI 88%

ACPBench Hard: Unrestrained Reasoning about Action, Change, and Planning

ACPBench Hard: 关于行动、变化和规划的无约束推理

Harsha Kokel, Michael Katz, Kavitha Srinivas, Shirin Sohrabi

机构 * IBM Research San Jose(IBM桑 Jose 研究所) IBM Thomas J. Watson Research Center(IBM 托马斯·J·沃森研究中心)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

AI总结 ACPBench Hard通过开放性问题测试模型在行动、变化和规划上的推理能力,发现现有模型在复杂任务上表现有限。

Comments Accepted at Proceedings of the Fourteenth International Conference on Learning Representations (ICLR 2026), see https://openreview.net/forum?id=WIXohR7mEo

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05669 2026-03-03 cs.AI 88%

ACPBench: Reasoning about Action, Change, and Planning

ACPBench: 关于行动、变化和规划的推理

Harsha Kokel, Michael Katz, Kavitha Srinivas, Shirin Sohrabi

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

AI总结 ACPBench是一个用于评估规划领域推理能力的基准,包含7个推理任务和13个规划领域,评估了多种LLM和推理模型的性能差异。

Comments In Proceedings of the AAAI Conference on Artificial Intelligence (AAAI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16671 2026-02-19 cs.SE cs.AI 88%

SPARC: Scenario Planning and Reasoning for Automated C Unit Test Generation

SPARC:面向自动化C单元测试生成的场景规划与推理

Jaid Monwar Chowdhury, Chi-An Fu, Reyhaneh Jabbarvand

机构 * Bangladesh University of Engineering and Technology(孟加拉工程科技大学) National Taiwan University(台湾国立大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 规划推理 :reasoning(title,abstract);planning(title);self-correction(abstract);分类 cs.AI

AI总结 SPARC通过神经符号方法和场景规划,提升C语言单元测试生成的覆盖率和代码质量,显著优于传统方法。

Comments 9 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09485 2026-02-11 cs.AI 88%

Bridging Efficiency and Transparency: Explainable CoT Compression in Multimodal Large Reasoning Models

连接效率与透明性:可解释的CoT压缩在多模态大推理模型中

Yizhi Wang, Linan Yue, Min-Ling Zhang

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of Computer Network and Information Integration (SEU), Ministry of Education, China(计算机网络与信息集成重点实验室(SEU))

专题命中 规划推理 :reasoning(title,abstract);CoT(title,abstract);分类 cs.AI

AI总结 XMCC通过强化学习优化的顺序决策过程,实现多模态大推理模型中可解释的CoT压缩,同时保持推理正确性和生成可解释的压缩解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08390 2026-02-10 cs.AI 88%

On Reasoning Strength Planning in Large Reasoning Models

在大推理模型中关于推理强度规划的研究

Leheng Sheng, An Zhang, Zijian Wu, Weixiang Zhao, Changshuo Shen, Yi Zhang, Xiang Wang, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 规划推理 :reasoning(title,abstract);planning(title);CoT(abstract);分类 cs.AI

AI总结 本研究揭示了大推理模型通过预先分配方向向量来规划推理强度,为控制其推理行为提供了新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21826 2026-02-06 cs.CL 88%

Mil-SCORE: Benchmarking Long-Context Geospatial Reasoning and Planning in Large Language Models

Mil-SCORE:大型语言模型中长上下文地理空间推理与规划的基准测试

Aadi Palnitkar, Mingyang Mao, Nicholas Waytowich, Vinicius G. Goecks, Xiaomin Lin

机构 * University of Maryland, College Park MD, USA(马里兰大学) ERA Lab, University of South Florida, Tampa FL, USA(佛罗里达大学埃拉实验室) DEVCOM Army Research Laboratory, Aberdeen Proving Ground MD, USA(国防部陆军研究实验室) EEHPC Lab, Johns Hopkins University, Baltimore MD, USA(约翰霍普金斯大学EEHPC实验室)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.CL

AI总结 Mil-SCORE是首个针对复杂军事规划情景的多跳问题数据集,旨在评估大型语言模型在长上下文地理空间推理与规划中的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20856 2026-01-29 cs.AI 88%

SokoBench: Evaluating Long-Horizon Planning and Reasoning in Large Language Models

SokoBench:评估大型语言模型的长周期规划与推理能力

Sebastiano Monti, Carlo Nicolini, Gianni Pellegrini, Jacopo Staiano, Bruno Lepri

机构 * Ipazia SpA(Ipazia公司) University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯瑟尔基金会)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

AI总结 SokoBench通过简化俄罗斯方块谜题评估大型语言模型的长周期规划与推理能力,揭示了其在复杂任务中的性能限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20014 2026-01-29 cs.AI 88%

Teaching LLMs to Ask: Self-Querying Category-Theoretic Planning for Under-Specified Reasoning

教大语言模型提问:面向不充分推理的自查询范畴规划

Shuhui Qu

机构 * Stanford University(斯坦福大学)

专题命中 规划推理 :planning(title,abstract);reasoning(title);verifier(abstract);分类 cs.AI

AI总结 SQ-BCP通过自查询和桥梁假设解决不充分推理问题,显著降低资源违规率并保持高质量计划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03164 2026-01-08 cs.CL 88%

WebAnchor: Anchoring Agent Planning to Stabilize Long-Horizon Web Reasoning

WebAnchor: 通过锚定代理规划稳定长周期网络推理

Xinmiao Yu, Liwen Zhang, Xiaocheng Feng, Yong Jiang, Bing Qin, Pengjun Xie, Jingren Zhou

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.CL

AI总结 WebAnchor通过两阶段强化学习框架,解决长周期网络推理中规划不稳定的问题,提升任务成功率和工具效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20616 2025-12-09 cs.LG cs.SY eess.SY 88%

Training Task Reasoning LLM Agents for Multi-turn Task Planning via Single-turn Reinforcement Learning

通过单次强化学习训练多轮任务规划的LLM代理

Hanjiang Hu, Changliu Liu, Na Li, Yebin Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) Harvard University(哈佛大学) Mitsubishi Electric Research Laboratories (MERL)(三菱电机研究实验室(MERL))

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.LG

AI总结 本文通过单次强化学习训练LLM代理进行多轮任务规划,利用GRPO实现高效策略优化,实验显示其在复杂任务规划中的表现优于大参数基线模型。

Comments Accepted by IEEE Control Systems Letters (L-CSS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14533 2025-11-19 cs.AI 88%

A Neuro-Symbolic Framework for Reasoning under Perceptual Uncertainty: Bridging Continuous Perception and Discrete Symbolic Planning

Jiahao Wu, Shengwen Yu

机构 * The University of Hong Kong(香港大学) Guangzhou College of Commerce(广州商学院)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

Comments 29 pages, 10 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18442 2025-11-06 cs.AI 88%

PlanU: Large Language Model Reasoning through Planning under Uncertainty

Ziwei Deng, Mian Deng, Chenjing Liang, Zeming Gao, Chennan Ma, Chenxing Lin, Haipeng Zhang, Songzhu Mei, Siqi Shen, Cheng Wang

机构 * Fujian Key Laboratory of Sensing and Computing for Smart Cities, School of Informatics, Xiamen University(福建智慧城市感知与计算重点实验室,信息学院,厦门大学) Key Laboratory of Multimedia Trusted Perception and Efficient Computing, XMU(多媒体可信感知与高效计算重点实验室,XMU) School of Computer, National University of Defense Technology(计算机学院,国防科技大学)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

Comments 38 pages, 19 figures, NeurIPS 2025 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23822 2025-10-30 cs.AI 88%

ReCAP: Recursive Context-Aware Reasoning and Planning for Large Language Model Agents

Zhenyu Zhang, Tianyi Chen, Weiran Xu, Alex Pentland, Jiaxin Pei

机构 * Department of Computer Science, Stanford University(斯坦福大学计算机科学系) Stanford Institute for Human-Centered AI(斯坦福大学人本人工智能研究所) MIT Media Lab(麻省理工学院媒体实验室)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

Journal ref 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07493 2025-10-02 cs.RO cs.AI 88%

LLM-guided Task and Motion Planning using Knowledge-based Reasoning

Muhayy Ud Din, Jan Rosell, Waseem Akram, Isiah Zaplana, Maximo A Roa, Irfan Hussain

机构 * Khalifa University Center for Autonomous Robotic Systems (KUCARS)(卡利法大学自主机器人系统中心) Institute of Industrial and Control Engineering (IOC)(工业与控制工程研究所) Institute of Robotics and Mechatronics(机器人与机电研究所)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

Comments Submitted to knowledge based systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12846 2025-09-26 cs.RO cs.AI 88%

Enter the Mind Palace: Reasoning and Planning for Long-term Active Embodied Question Answering

Muhammad Fadhil Ginting, Dong-Ki Kim, Xiangyun Meng, Andrzej Reinke, Bandi Jai Krishna, Navid Kayhani, Oriana Peltzer, David D. Fan, Amirreza Shaban, Sung-Kyun Kim, Mykel J. Kochenderfer, Ali-akbar Agha-mohammadi, Shayegan Omidshafiei

机构 * Field AI Research Institute (FAIRI)(Field AI研究机构) Stanford University(斯坦福大学)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10053 2025-08-28 cs.AI 88%

AirRAG: Autonomous Strategic Planning and Reasoning Steer Retrieval Augmented Generation

Wenfeng Feng, Chuzhan Hao, Yuewei Zhang, Guochao Jiang, Jingyi Song, Hao Wang

机构 * Alibaba Cloud Computing(阿里巴巴云 computing)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

Comments 20 pages, EMNLP25 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08537 2025-07-25 cs.AI cond-mat.mtrl-sci 88%

Chemical reasoning in LLMs unlocks strategy-aware synthesis planning and reaction mechanism elucidation

Andres M Bran, Theo A Neukomm, Daniel P Armstrong, Zlatko Jončev, Philippe Schwaller

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院(EPFL)) National Centre of Competence in Research (NCCR) Catalysis(催化领域国家竞争力研究中心)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12012 2025-06-16 cs.AI 88%

Tracing LLM Reasoning Processes with Strategic Games: A Framework for Planning, Revision, and Resource-Constrained Decision Making

Xiaopeng Yuan, Xingjian Zhang, Ke Xu, Yifan Xu, Lijun Yu, Jindong Wang, Yushun Dong, Haohan Wang

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

Comments 19 pages, 7 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19410 2025-05-27 cs.CL 88%

Self-Reflective Planning with Knowledge Graphs: Enhancing LLM Reasoning Reliability for Question Answering

Jiajun Zhu, Ye Liu, Meikai Bao, Kai Zhang, Yanghai Zhang, Qi Liu

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02177 2025-03-31 cs.CL 88%

ProTrix: Building Models for Planning and Reasoning over Tables with Sentence Context

Zirui Wu, Yansong Feng

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.CL

Comments EMNLP 2024 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00965 2025-03-10 cs.RO cs.AI 88%

HBTP: Heuristic Behavior Tree Planning with Large Language Model Reasoning

Yishuai Cai, Xinglin Chen, Yunxin Mao, Minglong Li, Shaowu Yang, Wenjing Yang, Ji Wang

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05291 2025-02-07 cs.AI 88%

WorkArena++: Towards Compositional Planning and Reasoning-based Common Knowledge Work Tasks

Léo Boisvert, Megh Thakkar, Maxime Gasse, Massimo Caccia, Thibault Le Sellier De Chezelles, Quentin Cappart, Nicolas Chapados, Alexandre Lacoste, Alexandre Drouin

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00029 2025-02-06 cs.AI 88%

Planning vs Reasoning: Ablations to Test Capabilities of LoRA layers

Neel Redkar

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

Comments 7 pages, 5 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16689 2025-01-30 cs.AI 88%

MACI: Multi-Agent Collaborative Intelligence for Adaptive Reasoning and Temporal Planning

Edward Y. Chang

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

Comments 21 pages, 19 tables

Journal ref Stanford University InfoLab Technical Report, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17397 2024-12-24 cs.LG cs.CV 88%

Towards Intrinsic Self-Correction Enhancement in Monte Carlo Tree Search Boosted Reasoning via Iterative Preference Learning

Huchen Jiang, Yangyang Ma, Chaofan Ding, Kexin Luan, Xinhan Di

专题命中 规划推理 :reasoning(title,abstract);self-correction(title,abstract);分类 cs.LG

Comments 6 Pages,3 figures, accepted by AAAI 2025 Workshop NeurMAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00081 2024-11-04 cs.RO cs.AI 88%

PARTNR: A Benchmark for Planning and Reasoning in Embodied Multi-agent Tasks

Matthew Chang, Gunjan Chhablani, Alexander Clegg, Mikael Dallaire Cote, Ruta Desai, Michal Hlavac, Vladimir Karashchuk, Jacob Krantz, Roozbeh Mottaghi, Priyam Parashar, Siddharth Patki, Ishita Prasad, Xavier Puig, Akshara Rai, Ram Ramrakhya, Daniel Tran, Joanne Truong, John M. Turner, Eric Undersander, Tsung-Yen Yang

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

Comments Alphabetical author order

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.13577 2024-10-24 cs.AI 88%

Physical Reasoning and Object Planning for Household Embodied Agents

Ayush Agrawal, Raghav Prabhakar, Anirudh Goyal, Dianbo Liu

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

Comments Journal: TMLR(May/2024) Total: 39 pages (17 pages main content, 15 Figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12452 2024-10-07 cs.CL 88%

Unlocking Reasoning Potential in Large Langauge Models by Scaling Code-form Planning

Jiaxin Wen, Jian Guan, Hongning Wang, Wei Wu, Minlie Huang

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10196 2024-09-17 cs.RO cs.AI cs.CV 88%

NEUSIS: A Compositional Neuro-Symbolic Framework for Autonomous Perception, Reasoning, and Planning in Complex UAV Search Missions

Zhixi Cai, Cristian Rojas Cardenas, Kevin Leo, Chenyuan Zhang, Kal Backman, Hanbing Li, Boying Li, Mahsa Ghorbanali, Stavya Datta, Lizhen Qu, Julian Gutierrez Santiago, Alexey Ignatiev, Yuan-Fang Li, Mor Vered, Peter J Stuckey, Maria Garcia de la Banda, Hamid Rezatofighi

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏