arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-15 至 2026-04-15 共收录 119 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 9 篇

2505.14264 2026-04-15 cs.LG cs.CL 88%

AAPO: Enhancing the Reasoning Capabilities of LLMs with Advantage Margin

AAPO: 通过优势边际增强大语言模型的推理能力

Jian Xiong, Jingbo Zhou, Jingyong Ye, Qiang Huang, Dejing Dou

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Frontier Research Department, Baidu Inc.(百度公司前沿研究部)

专题命中 数学推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 AAPO通过引入基于边际的估计方案优化交叉熵损失,有效解决传统分组相对优势估计方法的训练效率问题,在数学推理基准上表现出色。

Comments Accepted to ACL2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17995 2026-04-15 cs.CL cs.AI cs.LG 86%

Variation in Verification: Understanding Verification Dynamics in Large Language Models

验证的多样性:理解大型语言模型中的验证动态

Yefan Zhou, Austin Xu, Yilun Zhou, Janvijay Singh, Jiang Gui, Shafiq Joty

机构 * Salesforce AI Research(Salesforce AI研究院) Dartmouth College(达特茅斯学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);verifier(abstract)

AI总结 研究大型语言模型中验证动态,分析问题难度、生成器能力及验证器生成能力三个维度,发现验证有效性与问题难度相关,优化TTS应用中的基本验证策略。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19728 2026-04-15 cs.LG 84%

Hard Negative Sample-Augmented DPO Post-Training for Small Language Models

增强的DPO后训练用于小型语言模型

Haocheng Lu, Minjun Zhu, Henry Yu

机构 * Computer Science NYU Shanghai(纽约大学上海学院)

专题命中 数学推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);verifier(abstract)

AI总结 本文提出一种轻量级后训练方法,通过MathVerifier检测结构化错误,改进DPO以提升小型模型在数学推理中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10898 2026-04-15 cs.LG cs.AI cs.CL 82%

ZoomR: Memory Efficient Reasoning through Multi-Granularity Key Value Retrieval

ZoomR:通过多粒度键值检索实现内存高效的推理

David H. Yang, Yuxuan Zhu, Mohammad Mohammadi Amiri, Keerthiram Murugesan, Tejaswini Pedapati, Subhajit Chaudhury, Pin-Yu Chen

机构 * Rensselaer Polytechnic Institute(罗切斯特理工学院) IBM Research(IBM研究院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ZoomR通过多粒度键值检索实现内存高效的推理,减少内存使用,适用于长输出生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12736 2026-04-15 cs.CL 81%

Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Sequence-Level Likelihood

令牌级策略优化:通过序列级似然将群体级奖励与令牌级聚合联系起来

Xingyu Lin, Yilin Wen, Du Su, Jinchang Hou, En Wang, Wenbin Liu, Chenfu Bao, Zhonghou Lv

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Key Laboratory of Symbolic Computation and Knowledge Engineering of MOE, Jilin University(教育部符号计算与知识工程重点实验室,吉林大学) Baidu Inc.(百度公司) Tsinghua University(清华大学) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全重点实验室,计算技术研究所)

专题命中 数学推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出TEPO,通过序列级似然将群体奖励与单个令牌联系,并引入KL散度掩码约束以提升训练稳定性,实验显示其在数学推理任务中表现优异且收敛时间减少50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12632 2026-04-15 cs.LG cs.AI 81%

Calibration-Aware Policy Optimization for Reasoning LLMs

面向推理大语言模型的校准感知策略优化

Ziqi Wang, Xingzhou Lou, Meiqi Wu, Zhengqi Wen, Junge Zhang

机构 * National Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institution of Automation, Chinese Academy of Sciences(认知与复杂系统决策智能国家实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing National Research Center for Information Science and Technology, Tsinghua University(北京信息科学与技术国家研究中心,清华大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出CAPO方法,通过引入logistic AUC替代损失和噪声掩码机制,提升推理大语言模型的校准与准确性,实验显示其在多个数学推理基准上校准提升达15%,并在下游任务中进一步提升准确性。

Comments Published as a conference paper at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12229 2026-04-15 cs.AI cs.CL 81%

HintMR: Eliciting Stronger Mathematical Reasoning in Small Language Models

HintMR:在小型语言模型中激发更强的数学推理

Jawad Hossain, Xiangyu Guo, Jiawei Zhou, Chong Liu

机构 * University at Albany(阿尔巴尼大学) University at Buffalo(布法罗大学) Stony Brook University(石溪大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出HintMR框架,通过提示辅助引导小型语言模型进行多步数学问题解决,通过协作的双模型系统提升推理准确性,实验表明在多种数学基准上显著提升性能。

Comments 15 pages, 5 figures, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10387 2026-04-15 cs.DC 78%

Leveraging Mathematical Reasoning of LLMs for Efficient GPU Thread Mapping

利用大语言模型的数学推理实现高效的GPU线程映射

Jose Maureira, Cristóbal A. Navarro, Hector Ferrada, Luis Veas-Castillo

专题命中 数学推理 :reasoning(title,abstract)

AI总结 本文提出利用大语言模型的符号推理自动化GPU非矩形域线程映射,通过上下文学习推导出精确的O(1)和O(log N)映射方程,显著优于传统符号回归方法,实现高效能资源优化。

Comments 11 pages, 5 figures, 8 tables. Submitted to IEEE Transactions on Parallel and Distributed Systems (TPDS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15467 2026-04-15 cs.CL cs.AI 62%

Joint Flashback Adaptation for Forgetting-Resistant Instruction Tuning

联合回溯适应用于抗遗忘的指令微调

Yukun Zhao, Lingyong Yan, Zhenyang Li, Shuaiqiang Wang, Zhumin Chen, Zhaochun Ren, Dawei Yin

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出联合回溯适应方法,通过引入旧任务的有限提示来缓解增量学习中的灾难性遗忘问题,提升模型在新任务上的泛化能力。

Comments The experimental setting is wrong, i.e., not a real continual learning setting

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 4 篇

2604.12133 2026-04-15 cs.AI 79%

Towards Platonic Representation for Table Reasoning: A Foundation for Permutation-Invariant Retrieval

迈向表格推理的柏拉图表示:一种排列不变检索的基础

Willy Carlos Tchuitcheu, Tan Lu, Ann Dooms

机构 * Department of Mathematics and Data Science, Vrije Universiteit Brussel (VUB)(瓦隆公国布鲁塞尔自由大学数学与数据科学系) Data Science Lab, Royal Library of Belgium (KBR)(比利时皇家图书馆数据科学实验室)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出柏拉图表示假设,主张表格推理需要内在排列不变的潜在空间,通过分析和实验揭示了现有模型在布局变化下的脆弱性,并提出结构感知的表格推理编码器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12881 2026-04-15 cs.SE 78%

Evaluating LLMs Code Reasoning Under Real-World Context

评估大语言模型在现实世界上下文中的代码推理能力

Changshu Liu

专题命中 代码与定理证明 :reasoning(title,abstract)

AI总结 本文提出R2Eval1基准测试,包含135个来自十个广泛使用的Python项目的代码推理问题,通过序列化复合和自定义类型,更真实地评估LLM的通用性。

Comments Accepted by ICES SRC (ACM Student Research Competition)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18203 2026-04-15 cs.CL cs.CY 70%

How Psychological Learning Paradigms Shaped and Constrained Artificial Intelligence

心理学习范式如何塑造和制约人工智能

Alex Anvi Eponon, Ildar Batyrshin, Christian E. Maldonado-Sifuentes, Grigori Sidorov

专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文探讨人工智能系统在系统性组合推理中的不足,指出其根源在于心理学习理论对AI架构的限制,并提出ReSynth框架以实现结构化系统性行为。

Comments preprint journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12610 2026-04-15 cs.CL 57%

Transforming External Knowledge into Triplets for Enhanced Retrieval in RAG of LLMs

将外部知识转化为三元组以增强LLM中RAG的检索

Xudong Wang, Chaoning Zhang, Qigan Sun, Zhenzhen Huang, Chang Lu, Sheng Zheng, Zeyu Ma, Caiyan Qin, Yang Yang, Hengtao Shen

机构 * School of Computing, Kyung Hee University(韩国庆熙大学计算机学院) School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) School of Robotics and Advanced Manufacture, Harbin Institute of Technology(哈尔滨工业大学机器人与先进制造学院) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL

AI总结 Tri-RAG通过结构化三元组构建提升检索效率,减少冗余信息,提高生成质量与资源利用率。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 8 篇

2604.12214 2026-04-15 cs.SE 93%

Structural Anchors and Reasoning Fragility:Understanding CoT Robustness in LLM4Code

结构锚点与推理脆弱性:理解LLM4Code中的CoT鲁棒性

Yang Liu, Da Song, Armstrong Foundjem, Heng Li, Foutse Khomh

专题命中 逻辑推理 :CoT(title,title_cn);reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本文研究了CoT提示在LLM4Code中的鲁棒性,通过系统扰动分析发现其性能依赖于模型家族、任务结构和提示明确性,并识别出三种轨迹变形模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10026 2026-04-15 cs.CV 92%

LaV-CoT: Language-Aware Visual CoT with Multi-Aspect Reward Optimization for Real-World Multilingual VQA

LaV-CoT:具有多方面奖励优化的语言感知视觉CoT

Jing Huang, Zhiya Tan, Shutao Gong, Fanwei Zeng, Joey Tianyi Zhou, Changtao Miao, Huazhe Tan, Weibin Yao, Jianshu Li

机构 * Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) CFAR, Agency for Science, Technology and Research(科技研究局CFAR)

专题命中 逻辑推理 :CoT(title,title_cn);reasoning(abstract);chain-of-thought(abstract);logical reasoning(abstract)

AI总结 LaV-CoT通过多阶段推理流程和多方面奖励优化,提升多语言视觉问答的准确性和泛化能力,实现在公开数据集上的9.5%准确率提升。

Comments Accepted by WWW 2026 Industry Track - Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12184 2026-04-15 cs.AI 83%

TRUST Agents: A Collaborative Multi-Agent Framework for Fake News Detection, Explainable Verification, and Logic-Aware Claim Reasoning

TRUST代理:一种用于虚假新闻检测、可解释验证和逻辑感知声明推理的协作多智能体框架

Gautama Shastry Bulusu Venkata, Santhosh Kakarla, Maheedhar Omtri Mohan, Aishwarya Gaddam

机构 * George Mason University(乔治·马歇尔大学)

专题命中 逻辑推理 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 TRUST代理通过协作多智能体框架提升虚假新闻检测的可解释性和逻辑推理能力,引入分解器、陪审团和逻辑聚合器提升复杂声明的验证效果。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12426 2026-04-15 cs.LG cs.CL 82%

Do Transformers Use their Depth Adaptively? Evidence from a Relational Reasoning Task

Transformer 是否会根据深度进行自适应使用?来自关系推理任务的证据

Alicia Curth, Rachel Lawrence, Sushrut Karmalkar, Niranjani Prasad

机构 * Microsoft Research Cambridge(微软研究院剑桥分部)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.LG;logical reasoning(comments)

AI总结 本文通过控制多跳关系推理任务研究Transformer是否自适应使用深度,发现预训练模型在简单任务中使用较少层,而微调模型在更复杂的任务中更一致地自适应调整深度。

Comments Accepted at the ICLR 2026 Workshop on Logical Reasoning of Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21990 2026-04-15 cs.CE cs.AI 79%

ChemDFM-R: A Chemical Reasoning LLM Enhanced with Atomized Chemical Knowledge

ChemDFM-R: 一种增强原子化化学知识的化学推理大语言模型

Zihan Zhao, Ziping Wan, Lu Chen, Xuanze Lin, Shiyang Yu, Situo Zhang, Da Ma, Zichen Zhu, Danyang Zhang, Huayang Wang, Zhongyang Dai, Liyang Wen, Bo Chen, Xin Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(X-LANCE实验室、计算机科学学院、上海交通大学、上海、中国) Suzhou Laboratory, Suzhou, China(苏州实验室、苏州、中国) Shanghai Innovation Institution, Shanghai, China(上海创新研究院、上海、中国) Jiangsu Key Lab of Language Computing, Suzhou, China(江苏省语言计算重点实验室、苏州、中国) School of Chemistry and Chemical Engineering, Shanghai Jiao Tong University, Shanghai, China(化学与化工学院、上海交通大学、上海、中国)

专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出ChemDFM-R,通过构建原子化化学知识库ChemFG并采用混合源蒸馏方法,提升模型对化学原理和反应逻辑的理解,实现优于通用和领域大模型的化学推理能力。

Comments 20 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12227 2026-04-15 cs.AI cs.CL 62%

Designing Reliable LLM-Assisted Rubric Scoring for Constructed Responses: Evidence from Physics Exams

设计可靠的LLM辅助评分系统用于构造响应:来自物理考试的证据

Xiuxiu Tang, G. Alex Ambrose, Ying Cheng

机构 * Department of Psychology, University of Notre Dame(诺特大学心理学系) Notre Dame Learning, University of Notre Dame(诺特大学学习中心)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了GPT-4o在物理考试构造响应评分中的可靠性,发现细粒度检查清单式评分优于整体评分,提示清晰的评分标准对AI辅助评分至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04850 2026-04-15 physics.chem-ph cs.AI cs.MA 57%

El Agente Quntur: A research collaborator agent for quantum chemistry

El Agente Quntur:一种用于量子化学研究的协作代理

Juan B. Pérez-Sánchez, Yunheng Zou, Jorge A. Campos-Gonzalez-Angulo, Marcel Müller, Ignacio Gustin, Andrew Wang, Han Hao, Tsz Wai Ko, Changhyeok Choi, Eric S. Isbrandt, Mohammad Ghazi Vakili, Hanyong Xu, Chris Crebolder, Varinia Bernales, Alán Aspuru-Guzik

机构 * University of Toronto(多伦多大学) Vector Institute for Artificial Intelligence(向量人工智能研究所) Canadian Institute for Advanced Research (CIFAR)(加拿大高级研究 institute) NVIDIA Institute of Medical Science(医学科学研究所)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出El Agente Quntur,一种多代理AI系统,旨在通过推理驱动决策和指导深度研究,提升量子化学计算工具的可访问性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06846 2026-04-15 cs.CR 50%

CKG-LLM: LLM-Assisted Detection of Smart Contract Access Control Vulnerabilities Based on Knowledge Graphs

CKG-LLM:基于知识图谱的智能合约访问控制漏洞检测框架

Xiaoqi Li, Hailu Kuang, Wenkai Li, Zongwei Li, Shipeng Ye

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出CKG-LLM框架,利用大语言模型能力将自然语言漏洞模式转化为知识图谱查询,提升智能合约访问控制漏洞检测性能。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 18 篇

2604.12076 2026-04-15 cs.CL cs.AI cs.CY 90%

Narrative over Numbers: The Identifiable Victim Effect and its Amplification Under Alignment and Reasoning in Large Language Models

数字之外的叙事:可识别受害者效应及其在对齐和推理中的放大

Syed Rifat Raiyan

机构 * Systems and Software Lab (SSL), Department of Computer Science and Engineering(系统与软件实验室(SSL),计算机科学与工程系)

专题命中 规划推理 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了大语言模型中可识别受害者效应的普遍存在及其受对齐训练的影响,发现指令调优模型表现出极端效应,而推理专精模型则逆转了该效应,且标准CoT提示放大了该效应。

Comments Under review, 49 pages, 20 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19917 2026-04-15 cs.CL 83%

PILOT: Planning via Internalized Latent Optimization Trajectories for Large Language Models

PILOT:通过内部化潜在优化轨迹进行大语言模型的规划

Haoyu Zheng, Yun Zhu, Yuqian Yuan, Bo Yuan, Wenqiao Zhang, Siliang Tang, Jun Xiao

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL

AI总结 PILOT通过内部化潜在优化轨迹,帮助大语言模型克服长周期任务中的推理不稳定问题,实验显示其在数学和编码基准测试中性能优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10929 2026-04-15 cs.RO 82%

Ro-SLM: Onboard Small Language Models for Robot Task Planning and Operation Code Generation

Ro-SLM:机器人任务规划与操作代码生成的 onboard 小语言模型

Wenhao Wang, Yanyan Li, Long Jiao, Jiawei Yuan

机构 * Department of Computer & Information Science, University of Massachusetts Dartmouth(达特茅斯大学计算机与信息科学系) Department of Computer Science & Engineering, California State University San Marcos(加州州立大学桑马克斯分校计算机科学与工程系)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 本文提出Ro-SLM框架,通过蒸馏大语言模型知识提升机器人任务规划与代码生成能力,实验证明其性能接近大语言模型。

Comments 25 pages, 2 figures, ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21440 2026-04-15 cs.CL cs.AI 81%

KG-Hopper: Empowering Compact Open LLMs with Knowledge Graph Reasoning via Reinforcement Learning

KG-Hopper:通过强化学习赋能紧凑型开放式大语言模型进行知识图谱推理

Shuai Wang, Yinan Yu

机构 * Department of Computer Science(计算机科学系) Engineering Chalmers University of Technology(工程学院查尔姆斯理工大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 KG-Hopper通过强化学习框架,使紧凑型开放式大语言模型能够在一个推理回合内完成多跳知识图谱推理,优于更大系统并达到与专有模型相当的性能。

Comments Accepted to IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11047 2026-04-15 cs.CL cs.LG 81%

CoG: Controllable Graph Reasoning via Relational Blueprints and Failure-Aware Refinement over Knowledge Graphs

CoG:通过关系蓝图和故障感知细化实现可控图推理

Yuanxiang Liu, Songze Li, Xiaoke Guo, Zhaoyan Gong, Qifei Zhang, Huajun Chen, Wen Zhang

机构 * Zhejiang University(浙江大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出CoG框架,通过关系蓝图和故障感知细化模块,解决知识图谱中推理稳定性与效率问题,实验显示其在准确性和效率上均优于现有方法。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12493 2026-04-15 cs.CL cs.AI 81%

Latent Planning Emerges with Scale

在规模下显现的潜在规划

Michael Hanna, Emmanuel Ameisen

机构 * ILLC, University of Amsterdam(伊拉斯姆斯自由大学,阿姆斯特丹大学) Anthropic

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM在简单规划任务中潜在规划能力随规模增加而增强的现象,发现模型能通过内部表示生成未来词并影响上下文,但复杂任务如押韵对句中规划能力有限。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12627 2026-04-15 cs.AI 79%

KnowRL: Boosting LLM Reasoning via Reinforcement Learning with Minimal-Sufficient Knowledge Guidance

KnowRL: 通过最小充分知识引导的强化学习提升大语言模型推理

Linhao Yu, Tianmeng Yang, Siyu Ding, Renren Jin, Naibin Gu, Xiangzhao Hao, Shuaiyi Nie, Deyi Xiong, Weichong Yin, Yu Sun, Hua Wu

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University, China(天津大学计算机科学与技术学院TJUNLP实验室) Baidu Inc.(百度公司) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 KnowRL通过最小充分知识引导的强化学习框架提升大语言模型推理能力,通过分解知识点并优化子集选择,在八个基准测试中超越现有基线,达到70.08的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25758 2026-04-15 cs.AI 79%

Thinking Sparks!: Emergent Attention Heads in Reasoning Models During Post Training

思考火花!:推理模型后训练期间的涌现注意力头

Yein Park, Minbyul Jeong, Jaewoo Kang

机构 * Korea University(韩国大学) Upstage AI AIGEN Sciences(AIGEN 科技)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究探讨了后训练技术如何通过涌现的注意力头提升推理能力,分析不同训练方法对注意力头演化的影响,并揭示了复杂推理与基础计算之间的性能权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12126 2026-04-15 cs.AI cs.CL 79%

Long-Horizon Plan Execution in Large Tool Spaces through Entropy-Guided Branching

在大规模工具空间中通过熵引导分支实现长周期计划执行

Rongzhe Wei, Ge Shi, Min Cheng, Na Zhang, Pan Li, Sarthak Ghosh, Vaibhav Gorde, Leman Akoglu

机构 * Georgia Institute of Technology(佐治亚理工学院) Amazon(亚马逊)

专题命中 规划推理 :reasoning(abstract);planning(abstract);self-correction(abstract);分类 cs.CL、cs.AI

AI总结 本文提出熵引导分支算法,解决大规模工具库中长周期任务执行的挑战,通过动态扩展高预测熵的决策分支,提升任务成功率和计算效率。

Comments This work was completed during an internship at Amazon

详情

展开后加载摘要…

URL PDF HTML 收藏