arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-23 至 2026-04-23 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 6 篇

2604.20659 2026-04-23 cs.LG cs.AI 81%

GRPO-VPS: Enhancing Group Relative Policy Optimization with Verifiable Process Supervision for Effective Reasoning

GRPO-VPS:通过可验证的过程监督增强组相对策略优化以实现有效的推理

Jingyi Wang, Lei Zhu, Tengjin Weng, Song-Li Wu, Haochen Tan, Jierun Chen, Chaofan Tao, Haoli Bai, Lu Hou, Lifeng Shang, Xiao-Ping Zhang

机构 * Tsinghua University(清华大学) Shenzhen University(深圳大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出GRPO-VPS,通过在推理轨迹中探测模型对正确答案的信心,改进GRPO的轨迹级反馈,实现更精准高效的策略更新,实验显示在数学和通用领域任务中均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07527 2026-04-23 cs.LG 79%

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning

卡尔曼滤波增强的GRPO用于基于强化学习的语言模型推理

Hu Wang, Congbo Ma, Ian Reid, Mohammad Yaqub

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出KRPO,通过卡尔曼滤波估计潜在提示级奖励基线,提升语言模型推理的训练奖励和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19780 2026-04-23 cs.CL 77%

Avoiding Overthinking and Underthinking: Curriculum-Aware Budget Scheduling for LLMs

避免过度思考与不足思考:面向大语言模型的课程感知预算调度

Amirul Rahman, Aisha Karim, Kenji Nakamura, Yi-Fan Ng

机构 * University of Malaya(马来大学)

专题命中 数学推理 :reasoning(abstract,abstract_cn);test-time compute(abstract);分类 cs.CL

AI总结 本文提出BCAE框架,通过预算感知课程调度和截断感知密集奖励机制,优化LLM的推理质量和token效率,实验表明在多种数学推理基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21373 2026-04-23 cs.LG cs.CL 62%

PLR: Plackett-Luce for Reordering In-Context Learning Examples

PLR:基于Plackett-Luce模型的上下文学习示例重排

Pawel Batorski, Paul Swoboda

机构 * Heinrich Heine Universität Düsseldorf(杜塞尔多夫海因里希-海涅大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 PLR提出一种基于Plackett-Luce模型的概率方法,通过学习上下文学习示例的排列概率分布,提高小样本分类任务的准确性,尤其在数学推理任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19837 2026-04-23 cs.AI cs.MA 57%

Forage V2: Knowledge Evolution and Transfer in Autonomous Agent Organizations

Forage V2:自主代理组织中的知识进化与转移

Huaqing Xie

机构 * Independent Researcher(独立研究者)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 Forage V2通过构建学习型组织架构,实现知识积累与跨模型转移,提升自主代理任务的可靠性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02989 2026-04-23 cs.CL 57%

Mechanistic Interpretability of Large-Scale Counting in LLMs through a System-2 Strategy

通过系统2策略解析大语言模型中大规模计数的机制

Hosein Hasani, Mohammadali Banayeeanzade, Ali Nafisi, Sadegh Mohammadian, Fatemeh Askari, Mobin Bagherian, Amirmohammad Izadi, Mahdieh Soleymani Baghshah

机构 * Sharif University of Technology(谢里夫理工大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种系统2策略,通过分解大计数任务为小问题来提升LLM计数精度,揭示了计数机制并验证了其有效性。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏