arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-10 至 2026-04-10 共收录 3 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3 篇

2604.08527 2026-04-10 cs.CL cs.LG 73%

Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models

解开OPD之谜:大型语言模型中的长度膨胀与稳定策略

Feng Luo, Yu-Neng Chuang, Guanchu Wang, Zicheng Xu, Xiaotian Han, Tianyi Zhang, Vladimir Braverman

机构 * Department of Computer Science, Rice University, Houston, USA(莱斯大学计算机科学系,美国休斯顿) Department of Computer Science, University of North Carolina at Charlotte, Charlotte, USA(北卡罗来纳大学夏洛特分校计算机科学系,美国夏洛特) Department of Computer Science, Johns Hopkins University, Baltimore, USA(约翰霍普金斯大学计算机科学系,美国巴尔的摩) Department of Computer and Data Sciences, Case Western Reserve University(凯斯西储大学计算机与数据科学系)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了OPD训练中长度膨胀问题,提出StableOPD框架结合参考 divergence 约束和rollout混合蒸馏,有效稳定训练并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03703 2026-04-10 cs.LG cs.AI 73%

TreeAdv: Tree-Structured Advantage Redistribution for Group-Based RL

TreeAdv:基于群体的强化学习中的树状优势再分配

Lang Cao, Hui Ruan, Yongqian Li, Peng Chao, Wu Ning, Haonan Song, Renhong Chen, Yitong Li

机构 * Huawei Technologies Co., Ltd., China(华为技术有限公司)

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract);分类 cs.AI、cs.LG

AI总结 TreeAdv通过引入树状结构显式化群体回放的探索和优势分配,提升群体强化学习在复杂推理任务中的效率与逻辑深度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04418 2026-04-10 cs.HC cs.AI 57%

Justified or Just Convincing? Error Verifiability as a Dimension of LLM Quality

合理还是有说服力?错误可验证性作为LLM质量的一个维度

Xiaoyuan Zhu, Kimberly Le Truong, Riccardo Fogliato, Gokul Swamy, Weijian Zhang, Minglai Yang, Longtian Ye, Bangya Liu, Minghao Liu, Andrew Ilyas, Steven Wu

机构 * University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) Microsoft Core AI(微软核心人工智能)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出错误可验证性作为LLM质量的新维度,通过实验发现传统方法无法提升该维度,引入两种方法提升可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏