arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-29 至 2026-06-29 共收录 5 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 5 篇

2606.28166 2026-06-29 cs.AI 新提交 70%

Tandem Reinforcement Learning with Verifiable Rewards

具有可验证奖励的串联强化学习

Difan Jiao, Raghav Singhal, Robert West, Ashton Anderson

机构 * University of Toronto(多伦多大学) EPFL(瑞士联邦理工学院洛桑分校)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出串联强化学习(TRL),通过强弱模型交替生成推理链并共同奖励,在保持独立推理能力的同时提升模型间兼容性和可读性。

Comments 21 pages,7 figures,8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27731 2026-06-29 cs.CL cs.AI cs.CE cs.LG 新提交 67%

Enhancing Numerical Prediction in LLMs via Smooth MMD Alignment

通过平滑MMD对齐增强LLM中的数值预测

Zhuo Zuo, Li Yue, Wenhao Zheng, Chenpeng Wang, Xianggen Liu

机构 * College of Computer Science, Sichuan University, Chengdu, China(四川大学计算机学院,成都,中国)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLM在数值预测任务中精度不足的问题,提出平滑最大均值差异(SMMD)方法,通过数值令牌的距离核和图平滑对齐预测分布,在数学推理等任务中显著提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18874 2026-06-29 cs.LG cs.CL 版本更新 62%

Retaining by Doing: The Role of On-Policy Data in Mitigating Forgetting

在做中保留:在线策略数据在缓解遗忘中的作用

Howard Chen, Noam Razin, Karthik Narasimhan, Danqi Chen

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文系统比较了监督微调(SFT)和强化学习(RL)在语言模型后训练中的遗忘模式,发现RL因使用在线策略数据而更少遗忘,并验证了在线策略数据是缓解遗忘的关键因素。

Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03243 2026-06-29 cs.LG cs.AI cs.DC cs.PF 版本更新 62%

Ranking Before Serving: Low-Latency LLM Serving via Pairwise Learning-to-Rank

先排序后服务:通过成对学习排序实现低延迟LLM服务

Yiheng Tao, Yihe Zhang, Matthew Dearing, Xin Wang, Yuping Fan, Michael E. Papka, Zhiling Lan

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Argonne National Laboratory(阿贡国家实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出PARS调度器,通过成对排序预测任务响应长度,近似最短作业优先调度,减少队头阻塞,在vLLM上实现高达15.7倍延迟降低。

Comments 13 pages, 4 figures. Published in ISC High Performance 2026 Research Paper Proceedings (41st International Conference)

Journal ref ISC High Performance 2026 Research Paper Proceedings (41st International Conference), Hamburg, Germany, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27570 2026-06-29 cs.LO 新提交 50%

Auditing AI Investment Recommendations as Executable Actions

审计AI投资建议作为可执行行动

Sidnei Barbieri, Wellington Vargas, Ágney Lopes Roth Ferraz

专题命中 数学推理 :verifier(abstract)

AI总结 提出将AI投资建议作为可执行金融行动进行审计,通过确定性基线协议评估有效性、稳定性和一致性,发现一致性单独评估具有误导性。

详情

展开后加载摘要…

URL PDF HTML 收藏