arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 44946 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3220 篇

2608.16072 2026-08-18 cs.LG cs.AI 新提交 62%

Learn What's Left, Not What's Mastered: Saturation Aware Advantage Reweighting for Multi-Reward Policy Optimization

学习剩余内容,而非已掌握内容:面向多奖励策略优化的饱和感知优势重加权方法

Yixuan Wang, Yifei Chen, Haichao Zhang, Haozheng Luo, Xander Wu, Jie Ni, Yun Fu, Nuno Vasconcelos, Yijiang Li

机构 * University of Florida(佛罗里达大学) UC San Diego(加州大学圣迭戈分校) Northeastern University(东北大学) Northwestern University(西北大学) Stanford University(斯坦福大学) Universität Innsbruck(因斯布鲁克大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对多奖励策略优化中现有方法的缺陷,提出SA-MRPO方法,动态分配优化资源,在数学推理、自适应推理、编码任务中均实现性能提升。

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15360 2026-08-18 cs.LG cs.AI 新提交 62%

SAPE: Sandwich Adapters for Parameter Efficiency in Large Language Model Fine-Tuning

SAPE:用于大语言模型微调参数效率的三明治适配器

Mohammad Aref Jafari-Raddani, Morteza Mohajjel Kafshdooz

机构 * Qom University of Technology(库姆理工大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 SAPE是一种基于三明治式硬权重共享拓扑的PEFT框架,通过隔离边界变换降低内存与计算开销,在低参数约束下,于RoBERTa-large、LLaMA-3.2等模型的多项任务中取得优于现有方法的性能。

Comments 16 pages, 4 figures, 10 tables, includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10537 2026-08-12 cs.AI cs.LG 新提交 62%

Measuring Semantic Abstractness of SAE Features via Nonlocality

通过非局部性测量SAE特征的语义抽象性

Chuqiao Lin, Shivaji Sondhi, Xiao-Liang Qi

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出特征非局部性(FNL)指标,可区分SAE特征的抽象层级,用于审计越狱缓解特征及引导DeepSeek-R1模型特征提升数学推理准确率。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09893 2026-08-11 cs.CL cs.AI 新提交 62%

Fusion Training for Mathematical Generalization in Large Language Models

大型语言模型中数学泛化的融合训练

Congfeng Cao, Pengyu Zhang, Jelke Bloem

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对思维模式融合(TMF)训练动态开展系统性研究,揭示两种模式间的非对称相互作用与负相关关系,为设计TMF训练设置提供指导。

Comments ACL SRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09836 2026-08-11 cs.AI cs.CL 新提交 62%

Mismatch Matters: On-Policy Distillation Beyond Token Agreement

失配很重要:超越token一致性的在线蒸馏

Zichao Yu, Chengzhi Yu, Shengze Xu, Yujin Han, Bingqing Jiang, Xu Wang, Difan Zou

机构 * The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文针对在线蒸馏存在的退化一致性失效问题,提出TIDE方法修正师生失配,在数学推理基准上显著提升性能、缩短响应长度并减少格式错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09745 2026-08-11 cs.LG cs.AI stat.ML 新提交 62%

SR-OPSD: Self-Referenced On-Policy Self-Distillation

SR-OPSD:自引用同策略自蒸馏

Zhuo Sun, Entong Li, Yanlong Zhao, Xiaoyuan Cheng, Wenxuan Yuan, Kaiyu Li, Che Liu, Huihang Liu, Harrison Bo Hua Zhu, Li Zeng

机构 * Shanghai University of Finance and Economics(上海财经大学) Imperial College London(伦敦帝国学院) University of Science and Technology of China(中国科学技术大学) University College London(伦敦大学学院) Nanyang Technological University(南洋理工大学) Technical University of Denmark(丹麦技术大学) University of Copenhagen(哥本哈根大学) Peking University(北京大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对同策略自蒸馏的优化不稳定问题,提出SR-OPSD方法,通过几何插值结合Rényi散度优化蒸馏目标,在多任务大语言模型实验中取得最优或竞争性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08726 2026-08-11 cs.LG cs.AI 新提交 62%

PAST: Privileged Adaptation from Complete Student Trajectories for On-Policy Self-Distillation

PAST:基于完整学生轨迹的特权适配用于在线策略自蒸馏

Yangyang Feng, Zhuoyan Feng, Junlan Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Sun Yat-sen University(中山大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 PAST将完整学生轨迹作为OPSD教师的额外特权信息,通过前向KL蒸馏等方法优化教师,在三个数学推理基准上使Avg@12宏观平均值较Vanilla OPSD提升5.6个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11505 2026-08-11 cs.LG cs.AI 版本更新 62%

Proxy OPD: On-Policy Distillation with Transferable Relative Proxy Update

代理探索与可重用引导:基于代理引导更新信号的模块化大语言模型训练后范式

Daocheng Fu, Rong Wu, Yu Yang, Jianbiao Mei, Licheng Wen, Pinlong Cai, Xuemeng Yang, Yong Liu, Botian Shi, Yu Qiao

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型训练后优化信号耦合问题,提出PUST框架,通过代理模型探索、提取并传输相对改进信号,解耦更新信号探索与分布对齐,减少计算开销,支持异步处理与跨模型转移,提升训练后范式的模块化、可重用性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22510 2026-08-11 cs.LG cs.AI 版本更新 62%

Shattered Compositionality: Counterintuitive Learning Dynamics of Transformers for Arithmetic

破碎的组合性:变换器在算术中的反直觉学习动态

Xingyu Zhao, Darsh Sharma, Rheeya Uppaal, Yiqiao Zhong

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Department of Computer Sciences, University of Wisconsin–Madison(威斯康星大学麦迪逊分校计算机科学系) Department of Statistics, University of Wisconsin–Madison(威斯康星大学麦迪逊分校统计学系)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究发现变换器在学习算术任务时表现出反直觉的组合性,其学习动态受训练数据相关性影响而非因果或程序性组合。

Comments 37 pages, 29 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06819 2026-08-10 cs.CL cs.AI 新提交 62%

FutureBridge: Token Selection Beyond Local Preference in Collaborative Decoding

FutureBridge:协作解码中超越局部偏好的令牌选择

Quanquan Li, Hongbo Zhang, Yihe Chi, Jingyu Li, Xidong Xi, Liuyang Song, Hongzhen Zhang, Yuxiang Huang, Jing Ke, Siyuan Ma, Junyi Lin, Guitao Cao

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 FutureBridge通过联合LLM-SLM令牌对SLM后续推理的支持度排序,在5个数学推理基准上使Qwen3-1.7B SLM的数学平均得分较贪心解码提升35.1%,超越了仅依赖LLM局部偏好的现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06735 2026-08-10 cs.AI cs.CL 新提交 62%

IB-RL: Isolated Bilateral Reinforcement Learning for Strategic Dialogue Agents

IB-RL:用于策略性对话智能体的孤立双边强化学习

Senhao Wang, Chenghao Cai, Haitao Hu, Mingxing Huang, Xingguang Wang, Wenhao Li, Zecheng Lin

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对现有RL训练范式的静态对应智能体不匹配问题,提出IB-RL方法,在Vehicle TeleSales和Deal-or-NoDeal任务上较单边RL基线显著提升了策略对未见过对应智能体的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22251 2026-08-10 cs.LG cs.AI 版本更新 62%

IFCLoRA: Topology-Aware Rank Allocation for Parameter-Efficient Fine-Tuning

IFCLoRA:用于参数高效微调的拓扑感知秩分配

Wei Zhang, Xinwu Liu, Yihang Cheng

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对LoRA方法中秩分配问题,提出IFCLoRA拓扑感知秩分配方法,利用小校准集和冻结模型构建交互图,结合全局拓扑先验与局部梯度敏感性计算得分来分配秩,在多场景下优于其他方法,还揭示了任务依赖的秩分布特点。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21257 2026-08-10 cs.LG cs.AI 版本更新 62%

An Empirical Study of openPangu Quantization on Ascend NPUs

OpenPangu在昇腾NPU上量化的实证研究

Tong Shi, Jiacheng Wang, Hui Xie, Ying Li, Aishan Liu, Jinyang Guo, Xianglong Liu

机构 * State Key Laboratory of Complex & Critical Software Environment, Beihang University(北京航空航天大学复杂关键软件环境国家重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文在昇腾910B1 NPU上系统评估了OpenPangu 1B和7B模型在多种后训练量化方法下的表现,发现8-bit权重量化无损,4-bit对7B模型可行但对1B模型有显著损害,极低比特量化仍具挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04761 2026-08-07 cs.CL cs.AI 版本更新 62%

InsightEmb: Learning Action-Intent Embeddings for Agentic Insight Retrieval

InsightEmb:面向智能体洞察检索的动作-意图嵌入学习

Tsz Ting Chung, Jiangnan Li, Jie Zhou, Mo Yu

机构 * The Hong Kong University of Science and Technology(香港科技大学) WeChat AI, Tencent(腾讯微信人工智能)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对智能体洞察检索任务,提出对比嵌入框架InsightEmb,利用数学推理数据学习可迁移的检索几何结构,在无特定环境训练时优于现有模型,验证了匹配几何结构的跨域迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04588 2026-08-06 cs.CL cs.AI 新提交 62%

EASy: Towards Efficient LLM-Based Agentic System

EASy:迈向高效的基于大语言模型的智能体系统

Junnan Liu, Linhao Luo, Thuy-Trang Vu, Gholamreza Haffari

机构 * Monash University(莫纳什大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 EASy是一种可训练的智能体框架,通过强化学习优化任务性能与计算效率,采用里程碑-规划-执行工作流,在多类基准上实现了更优的性能-效率权衡。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10367 2026-08-06 cs.CL cs.AI 版本更新 62%

Large-Small Model Collaboration for Enhancing Edge-Deployed Small Models

用于增强边缘部署小模型的大小模型协作

Peigen Liu, Yijiang Fan, Zixuan Xu, Yuren Mao, Longbin Lai, Ying Zhang

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出自适应边缘-云框架G-Boost,通过动态选择推理或对数融合的协作方式,提升边缘部署小语言模型的任务性能,在两个数学推理数据集上优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03447 2026-08-05 cs.LG cs.AI 新提交 62%

Approximate Speculative Decoding

近似投机解码

Yuannuo Feng, Zegang Peng, Yuxin Xie, Yubing Ye, Yizhe Chen, Wenshuai Yao, Wenyong Zhou, Wang Kang

专题命中 数学推理 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出无需训练的Approximate Speculative Decoding(ASD),通过带预算的最长前缀选择优化投机解码,提升了生成吞吐量与验证器接受率,且无需新草稿模型或微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02867 2026-08-05 cs.CL cs.AI 新提交 62%

BODHI: Do LLMs Branch Out and Discover Heterogeneous Inferences?

BODHI:大型语言模型是否会分支拓展并发现异构推理?

Soumadeep Saha, Krish Sharma, Akshay Chaturvedi, Nicholas Asher

机构 * ANITI, Université de Toulouse(图卢兹大学ANITI) LINAGORA Labs(LINAGORA实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究通过迷宫求解实验和BODHI-Trees分析,发现RLVR训练的LLMs存在策略熵崩溃,其采样效率提升以推理分支多样性下降为代价。

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14636 2026-08-05 cs.LG cs.AI 版本更新 62%

When Search Teaches Style: Causal Internalization of Tactical Priors in AlphaZero

AlphaZero-Edu:普及AlphaZero的访问

Ruitong Li, Binjie Guo, Aisheng Mo, Guowei Su, Han Wang, Jie Li, Ru Zhang

机构 * Department of Communication Studies, School of Communication, Hong Kong Baptist University(通讯学院传播研究系,香港 Baptist 大学) Department of Neurobiology and Department of Rehabilitation Medicine, First Affiliated Hospital, Zhejiang University School of Medicine(神经生物学系和康复医学系,浙江大学医学院第一附属医院) Personal participation(个人参与)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AlphaZero-Edu,一种轻量级教育导向的实现,通过模块化架构和高效训练,提升AlphaZero的可访问性和可重复性,实现单GPU训练和并行自对弈加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11482 2026-08-05 cs.AI cs.CL 62%

Meta Prompting for AI Systems

为AI系统引入元提示

Yifan Zhang, Yang Yuan, Andrew Chi-Chih Yao

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过元提示框架提升大语言模型的推理能力,实现高效的问题解决与自我优化。

Comments Project Page: https://github.com/meta-prompting/meta-prompting

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01418 2026-08-04 cs.AI cs.LG 新提交 62%

Reusing Rollouts under Policy Lag: Prefix-Normalized Policy Optimization for LLM Reinforcement Learning

策略滞后下的回滚复用:面向大语言模型强化学习的前缀归一化策略优化

Wenhao Zhang, Yibo Xie, Rui Wang, Jiahua Yang, Lei Jiang, Zibo Yang, Yawei Wang, Jiali Xu, jasperawang, Haoyang Long, Huan Xiong, alantzhao

机构 * Tencent(腾讯) Harbin Institute of Technology(哈尔滨工业大学) Jinan University(暨南大学) University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对大语言模型强化学习中回滚复用导致的离策略问题,提出前缀归一化策略优化(PNPO),在4个更新周期时其数学推理性能优于GSPO,可降低更新批次需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00434 2026-08-04 cs.CL cs.AI 新提交 62%

AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction

AdaMTP:一种面向多令牌预测的自适应训练范式

Ziqiang Cui, Han Shi, Bowei He, Yu Pan, Peiyang Liu, Shengyin Sun, Yankai Chen, Haoli Bai, Yichun Yin, Xue Liu, Chen Ma

机构 * City University of Hong Kong(香港城市大学) Huawei Technologies(华为技术有限公司) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) McGill University(麦吉尔大学) Peking University(北京大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 AdaMTP是适配序列内在可预测性的自适应MTP训练范式,通过熵算法划分语义边界抑制噪声梯度,在三类主干模型的多任务基准中均优于标准MTP,兼具性能与推理速度优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07475 2026-08-04 cs.CL cs.LG 版本更新 62%

A Comparative analysis of Layer-wise Representational Capacity in AR and Diffusion LLMs

对AR和扩散LLM中逐层表示能力的比较分析

Raghavv Goel, Risheek Garrepalli, Sudhanshu Agrawal, Chris Lott, Mingu Lee, Fatih Porikli

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文比较了AR和扩散LLM的表示能力,发现扩散模型产生更全局的表示,而AR模型产生紧密耦合的局部表示,扩散训练引入深度冗余以实现原理性压缩。

Comments v4: improving writing and adding Qwen2.5-Instruct results with all v3 changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11133 2026-08-04 cs.LG cs.CL 版本更新 62%

Just on Time: Token-Level Early Stopping for Diffusion Language Models

准时完成:扩散语言模型的标记级早期停止

Zakhar Kohut, Severyn Shykula, Mykola Vysotskyi, Serhii Dmytryshyn, Dmytro Khamula, Michal Zakrzewski, Damian Rynczak, Jacek Małecki, Taras Rumezhak, Volodymyr Karpiv

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种无需训练的标记级早期停止方法,通过动态确定标记收敛点,减少扩散步骤并提升生成效率。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14917 2026-08-03 cs.CL cs.HC cs.LG 62%

Self-reflecting Large Language Models: A Hegelian Dialectical Approach

Sara Abdali, Michael Solodko, Can Goksen, Saeed Amizadeh, Julie E. Maybee, Kazuhito Koishida, Pashmina Cameron

机构 * Microsoft Applied Sciences Group (ASG)(微软应用科学组) Department of Philosophy, Lehman College, City University of New York(哲学系,莱曼学院,新 York 城市大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27787 2026-07-31 cs.LG cs.AI 新提交 62%

LoRA Scaffolded Policy Optimization (LSPO): A Sampling-Time Low-Rank Scaffold for Recovering Reinforcement-Learning Gradient on Zero-Reward Cliff Prompts

LoRA 支架策略优化(LSPO):零奖励悬崖提示下恢复强化学习梯度的采样时低秩支架

Ken Ding

机构 * NVIDIA(英伟达)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对数学推理 RLVR 的悬崖提示梯度丢失问题,提出 LSPO 采样时机制,通过 LoRA 适配器恢复梯度,在 DeepMath-103K 数据集上 16 项基准指标均优于 DAPO,平均提升 3.8 分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20145 2026-07-31 cs.CL cs.AI 版本更新 62%

SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD

SLAI T-Rex:在升腾超级集群上对DeepSeek-V4系列进行全参数训练后优化

Dongfang Li, Xiaodong Luo, Ruoyu Sun, Xuhui Chen, Linyuan Qiu, Jian Meng, Zhengxuan Lu, Yiting Wang, Yucheng Xie, Tao Guo, Tianxiang Fang, Jing Li, Sihang Chen, Shihao Hong, Chang Liu, Weihua Dai, Zirong Zeng, Ziwei Zhu, Zhuohan Wang, Zhengjun Yue, Igor Vasilyev, Min Liu, Weijian Sun, Xin Chen, Yingmeng Gao, Jinhua Zhou, Taolue Chen, Chenwei Wu, Dong Zhang, Wenlong Jin, Jinmin Xiang, Barkova Maria, Ushakov Anton, Xianfei Jin, Tian Ding, Zhihang Lin, Qian Chen, Linxin Yang, Mingzhe Yang, Bingwei Zhang, Hongzhang Yang, Fangxue Zhang, Shijun Qin, Jie Yu, Cuihua Hu, Tolstykh Vasiliy, Nosov Ivan, Abdullin Amir, Zhicheng Zhou, Xin Zhang, Zhixiong Ning, Xutong Zhao, Junjie Huang, Jiajun Liu, Weiyan Kong, Zheng Zhang, Wenhan Luo, Lin Hu, Yangbo Guo, Li Zeng, Shihao Zhang, Baotian Hu, Min Zhang, Haizhou Li, Zhiquan Luo

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对万亿参数规模MoE模型全参数训练后优化的系统挑战,在升腾NPU超级集群上以DeepSeek-V4为目标工作负载开发分层优化框架,建立CPT和SFT工作流程,提升模型性能,推动复杂推理前沿模型系统发展。

Comments 73 pages, 22 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03126 2026-07-31 cs.LG cs.AI 版本更新 62%

ACPO: Asymmetric Credit Policy Optimization via Mode-Local Entropy Surrogate

ACPO:通过细粒度替代熵实现自适应信用策略优化

Zijun Xie, Yuyang You, Yongzhi Li, Enlei Gong, Quan Chen, Yanhua Cheng, Peng Jiang, Binbin Zheng, Xiaolong Liu, Zeyu Chen, Yadong Mu

机构 * Peking University(北京大学) Baidu Inc.(百度公司) Kuaishou Inc(快手公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对强化学习中稀疏奖励致令牌级信用分配难的问题,提出基于模式局部替代熵的ACPO框架,通过不对称调制策略更新改进信用分配,实验表明其优于多种强化学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26862 2026-07-30 cs.LG cs.AI 新提交 62%

ReCo: Reweighting GRPO Against Distributional Concentration

ReCo:针对分布集中问题的GRPO重加权方法

Junoh Park, Junseo Hwang, Wonguk Cho, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对GRPO过度关注高概率响应导致推理覆盖度下降的问题,提出ReCo重加权方法,在多个数学推理基准上提升了大k值下的Pass@k表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19450 2026-07-30 cs.LG cs.AI 版本更新 62%

REGEN: Replay-recycling for Expert-to-Generalist distillation with Offline Reinforcement Learning

REGEN:用于从专家到通用模型蒸馏的离线强化学习的重放回收

Yunjie Chen, Xiaoxin Chen, Fang Wang

机构 * vivo AI Lab(vivo人工智能实验室) Department of Computer Science, Sun Yat-Sen University(中山大学计算机科学系)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对大语言模型强化学习扩展的挑战,提出REGEN方法,通过回收重放记忆并运用离线强化学习算法训练通用模型,解耦训练过程,降低成本,在多任务上以低成本达类似准确率,还可能变革在线强化学习及扩展训练阶段。

详情

展开后加载摘要…

URL PDF HTML 收藏