arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 44946 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3220 篇

2602.14169 2026-06-15 cs.LG cs.AI cs.CL 版本更新 67%

Deep Dense Exploration for LLM Reinforcement Learning via Pivot-Driven Resampling

基于枢轴驱动重采样的LLM强化学习深度密集探索

Yiran Guo, Zhongjian Qiao, Yingqi Xie, Jie Liu, Dan Ye, Ruiqing Zhang, Shuang Qiu, Lijie Xu

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) City University of Hong Kong(香港城市大学) Baidu(百度)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对大语言模型强化学习中探索效率低的问题,提出深度密集探索(DDE)策略,通过识别失败轨迹中的可恢复枢轴状态并局部密集重采样,结合双流优化目标,在数学推理基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13598 2026-06-12 cs.AI cs.CL cs.LG cs.MA 新提交 67%

Reward Modeling for Multi-Agent Orchestration

多智能体编排的奖励建模

King Yeung Tsang, Zihao Zhao, Vishal Venkataramani, Haizhou Shi, Zixuan Ke, Semih Yavuz, Shafiq Joty, Hao Wang

机构 * Rutgers University(罗杰斯大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出OrchRM框架,通过自监督学习从多智能体执行中间产物构建奖励模型,无需人工标注,实现高效编排器训练和测试时扩展,在多个领域提升性能并降低计算成本。

Comments Preprint; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23982 2026-06-11 cs.CL cs.AI cs.CY cs.LG cs.NE 版本更新 67%

Toward Preference-aligned Large Language Models via Residual-based Model Steering

基于残差模型引导的偏好对齐大型语言模型

Lucio La Cava, Andrea Tagarelli

机构 * DIMES Dept., University of Calabria, Italy(卡利博大学DIMES系)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PaLRS方法,利用残差流中的偏好信号提取轻量级引导向量,无需训练即可在推理时对齐模型偏好,在数学推理和代码生成任务上取得一致提升,同时节省大量时间。

Comments Accepted at IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07810 2026-06-09 cs.CL cs.AI cs.LG 新提交 67%

SLMJury: Can Small Language Models Judge as Well as Large Ones?

SLMJury:小型语言模型能否像大型模型一样进行评判?

Anish Laddha, Nitesh Pradhan, Gaurav Srivastava

机构 * LNMIIT Virginia Tech(弗吉尼亚理工大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SLMJury框架,评估小型语言模型作为评判者的能力,发现领域依赖的过度思考效应、领域泛化差异、闭端与开端评判能力分离,以及多智能体辩论降低准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07527 2026-06-09 cs.CL cs.AI cs.LG 新提交 67%

Post-training is (Massive) Supervised Learning

后训练是(大规模)监督学习

Michael Hassid, Yossi Adi, Roy Schwartz

机构 * FAIR, Meta AI(Meta AI 基础人工智能研究团队) The Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文论证当前LLM后训练阶段(SFT+RL)实质是回归到BERT时代的“预训练-微调”范式,通过实验表明从零开始后训练的模型也能取得显著性能,并提出应转向“学会学习”的训练方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09085 2026-06-09 cs.LG cs.AI cs.CL cs.IR 版本更新 67%

MMR-GRPO: Accelerating GRPO-Style Training through Diversity-Aware Reward Reweighting

MMR-GRPO:通过多样性感知奖励重加权加速GRPO风格训练

Kangda Wei, Ruihong Huang

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MMR-GRPO方法,利用最大边际相关性根据完成多样性重加权奖励,减少冗余样本,加速GRPO训练,在保持性能的同时平均减少47.9%训练步数和70.2%时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05152 2026-06-08 cs.LG cs.AI cs.CL 版本更新 67%

Reinforcement Learning from Rich Feedback with Distributional DAgger

利用丰富反馈的强化学习与分布式DAgger

Rishabh Agrawal, Jacob Fein-Ashley, Paria Rashidinejad

机构 * University of Southern California(南加州大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出DistIL算法,通过分布式DAgger利用丰富反馈(如执行轨迹、工具输出等)进行前向交叉熵优化,实现单调策略改进和更好的Pass@N性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04244 2026-06-04 cs.AI cs.CL cs.CV cs.LG 67%

VAMPS: Visual-Assisted Mathematical Problem Solving Benchmark

VAMPS: 视觉辅助数学问题求解基准

Amirhossein Dabiriaghdam, Shayan Vassef, Mohammadreza Bakhtiari, Yasamin Medghalchi, Ilker Hacihaliloglu, Mesrob Ohannessian, Lele Wang, Giuseppe Carenini

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出VAMPS基准,通过1,168道双语多选题评估多模态大模型在借助绘图工具进行数学推理时的表现,发现直接解析求解优于工具辅助视觉求解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03391 2026-06-03 cs.LG cs.AI cs.CL 67%

When Model Merging Breaks Routing: Training-Free Calibration for MoE

当模型合并破坏路由:MoE的无训练校准

Canbin Huang, Tianyuan Shi, Xiaojun Quan, Jingang Wang, Jianfei Zhang, Qifan Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对MoE架构中模型合并导致的路由崩溃问题,提出基于二阶曲率的无训练校准方法HARC,通过闭式解和共轭梯度法高效重对齐路由器,显著提升数学推理和代码生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01058 2026-05-29 cs.LG cs.AI cs.CL 67%

Good SFT Optimizes for SFT, Better SFT Prepares for Reinforcement Learning

好的SFT优化SFT,更好的SFT为强化学习做准备

Dylan Zhang, Yufeng Xu, Haojin Wang, Qingzhi Chen, Hao Peng

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) New York University (Shanghai)(纽约大学(上海))

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对当前SFT-RL流程中离线SFT数据分布与在线RL策略分布不匹配的问题,提出基于策略评估的离线学习损失重加权方法PEAR,通过重要性采样重加权SFT损失,提升后续RL训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20369 2026-05-21 cs.CL cs.AI cs.LG 67%

DEL: Digit Entropy Loss for Numerical Learning of Large Language Models

DEL:用于大语言模型数值学习的数字熵损失

Zhaohui Zheng, Chenhang He, Shihao Wang, Yuxuan Li, Ming-Ming Cheng, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) VCIP, College of Computer Science, Nankai University(南开大学计算机学院VCIP)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Digit Entropy Loss (DEL)用于大语言模型的自回归数值学习,通过重新设计传统无监督熵优化,引入数字条件概率和二元交叉熵,使熵优化转向监督方式,同时推广整数基于的数值学习到浮点数优化,从而提升数值预测的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04998 2026-05-20 cs.LG cs.AI cs.CL 67%

Learning Rate Matters: Vanilla LoRA May Suffice for LLM Fine-tuning

学习率至关重要:Vanilla LoRA可能足以用于LLM微调

Yu-Ang Lee, Ching-Yun Ko, Pin-Yu Chen, Mi-Yen Yeh

机构 * National Taiwan University(国立台湾大学) IBM Research(IBM研究院) Academia Sinica(台湾“学术院”)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过广泛的超参数搜索重新评估了九种代表性的LoRA变体和Vanilla LoRA,在数学推理、常识推理、代码生成和指令遵循等任务上,发现不同的LoRA方法偏好不同的学习率范围。当学习率正确调整时,所有方法都能达到相似的峰值性能,这表明Vanilla LoRA仍然是一个有竞争力的基线,而单一训练配置下的改进可能并不反映一致的方法优势。

Comments Project page: https://github.com/yuang-lee/lr-matters-lora

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18864 2026-05-20 cs.LG cs.AI cs.CL 67%

SAGE: Shaping Anchors for Guided Exploration in RLVR of LLMs

SAGE: 通过塑造锚点引导LLMs的RLVR探索

Chanuk Lee, Minki Kang, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SAGE框架,通过重塑反KL锚分布来实现可控的经验支持扩展,从而在数学推理基准中提升pass@1和pass@k的表现。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13846 2026-05-19 cs.CL cs.AI cs.LG 67%

LightTransfer: Your Long-Context LLM is Secretly a Hybrid Model with Effortless Adaptation

LightTransfer: 你的长上下文LLM实际上是一个具有轻松适应能力的混合模型

Xuan Zhang, Fengzhuo Zhang, Cunxiao Du, Chao Du, Tianyu Pang, Wei Gao, Min Lin

机构 * Singapore Management University(新加坡国立大学) National University of Singapore(新加坡国立大学) Sea AI Lab, Singapore(新加坡海智实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LightTransfer方法,通过将LLaMA等模型转换为混合架构,实现更高效的生成,实验表明在长上下文理解任务中,即使有半数层被识别为懒层,也能在性能损失小于1.5%的情况下提升2.17倍的吞吐量,并在数学基准AIME24上达到53.3%的分数。

Comments Accepted by TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17037 2026-05-19 cs.LG cs.AI cs.CL 67%

D$^2$Evo: Dual Difficulty-Aware Self-Evolution for Data-Efficient Reinforcement Learning

D$^2$Evo: 双重难度感知的自进化方法用于数据高效的强化学习

Ru Zhang, Renda Li, Ziyu Ma, Weijie Qiu, Chongyang Tao, Yong Wang, Xiangxiang Chu

机构 * Zhejiang University(浙江大学) AMAP, Alibaba Group(AMAP,阿里巴巴集团)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出D$^2$Evo方法,通过双重难度感知的自进化机制,解决强化学习中有效数据稀缺和动态难度变化的问题,从而在数学推理基准上以少于2K真实数学样本实现优于现有方法的性能。

Comments Accepted by ICML 2026. First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03812 2026-05-18 cs.LG cs.AI cs.CL 67%

Antidistillation Fingerprinting

对抗蒸馏指纹

Yixuan Even Xu, John Kirchenbauer, Yash Savani, Asher Trockman, Alexander Robey, Tom Goldstein, Fei Fang, J. Zico Kolter

机构 * Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学) University of Maryland, College Park, MD, USA(马里兰大学学院市分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出对抗蒸馏指纹方法,通过代理模型识别并采样最大化指纹检测性的token,提升检测效果同时减少对模型性能的影响。

Comments 28 pages, 13 figures, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15012 2026-05-15 cs.LG cs.AI cs.CL 67%

Boosting Reinforcement Learning with Verifiable Rewards via Randomly Selected Few-Shot Guidance

通过随机选择的少样本引导提升可验证奖励的强化学习

Kai Yan, Alexander G. Schwing, Yu-Xiong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出FEST算法,通过随机选择的少样本引导提升可验证奖励的强化学习,仅需128个演示即可获得优于基线的结果,关键在于监督信号、在线信号和衰减权重。

Comments 25 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13369 2026-05-15 cs.CL cs.AI cs.LG 67%

Query-Conditioned Test-Time Self-Training for Large Language Models

基于查询的测试时自我训练用于大语言模型

Chaehee Song, Minseok Seo, Yeeun Seong, Doyi Kim, Changick Kim

机构 * School of Electrical Engineering, KAIST(韩国科学技术院电子工程学院) Graduate School of Green Growth and Sustainability, KAIST(韩国科学技术院可持续增长与绿色发展研究生院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出QueST框架,通过直接从输入查询生成查询条件对,实现测试时参数自适应,无需外部数据,在多个基准测试中优于现有方法。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11853 2026-05-15 cs.LG cs.AI cs.CL 67%

GEAR: Granularity-Adaptive Advantage Reweighting for LLM Agents via Self-Distillation

GEAR:通过自蒸馏实现的粒度自适应优势重加权用于LLM智能体

Sijia Li, Yuchen Huang, Zifan Liu, Yanping Li, Jingjing Fu, Li Zhao, Jiang Bian, Ling Zhang, Jun Zhang, Rui Wang

机构 * Hong Kong University of Science and Technology(香港科技大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GEAR通过自蒸馏获取token和片段级信号,实现粒度自适应的优势重加权,提升长时间跨度任务中的智能体性能,实验表明在数学推理和工具使用任务中优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18104 2026-05-15 cs.CL cs.AI cs.LG 67%

Training and Evaluating Language Models with Template-based Data Generation

基于模板的数据生成训练和评估语言模型

Yifan Zhang

机构 * University of California Los Angeles(加州大学洛杉矶分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Template-based Data Generation方法,通过生成高质量数学问题及可验证解,解决大语言模型在复杂推理任务中的数据稀缺问题,并引入TemplateMath Part I: TemplateGSM数据集。

Comments Published in ICLR 2025 DATA-FM Workshop. Project Page: https://github.com/iiis-ai/TemplateMath

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11403 2026-05-13 cs.LG cs.AI cs.CL 67%

fg-expo: Frontier-guided exploration-prioritized policy optimization via adaptive kl and gaussian curriculum

fg-expo: 基于前沿引导的探索优先策略优化:通过自适应KL和高斯课程学习

Mingxiong Lin, Zhangquan Gong, Maowen Tang, Qian Li, Chuangchuang Wang, Jian Ma, Sutian Huang, Kai Tang, Haonan Lu

机构 * OPPO AI Center(OPPO人工智能中心)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出FG-ExPO算法,通过自适应KL缩放和高斯课程采样提升策略优化效率,实验表明其在数学推理任务中性能显著优于GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11167 2026-05-13 cs.CL cs.AI cs.LG 67%

The Bicameral Model: Bidirectional Hidden-State Coupling Between Parallel Language Models

双通道模型:并行语言模型之间双向隐藏状态耦合

Cedric Flamant, Udaya Ghai, Kanna Shimizu

机构 * AWS Agentic AI(AWS智能AI)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出双通道模型,通过可训练的神经接口在两个预训练语言模型的中间隐藏状态之间建立双向耦合,实现任务驱动与工具执行的协同,提升多任务性能。

Comments 9 pages main text, 5 figures, 24 pages appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04894 2026-05-13 cs.CL cs.AI cs.LG 67%

Asymmetric Advantage Modulation Calibrates Entropy Dynamics in RLVR

不对称优势调制校准RLVR中的熵动态

Hengrui Gu, Xiaotian Han, Yujing Bian, Feiyi Wang, Kaixiong Zhou

机构 * North Carolina State University(北卡罗来纳州立大学) Case Western Reserve University(凯斯西储大学) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究RLVR中探索受限问题,提出AsymGRPO通过分离正负优势调制强度,精准控制熵动态以提升推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03783 2026-05-12 cs.LG cs.AI cs.CL 67%

Efficient Estimation of Kernel Surrogate Models for Task Attribution

高效估计用于任务归因的核替代模型

Zhenshuo Zhang, Minxuan Duan, Hongyang R. Zhang

机构 * Northeastern University(东北大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出核替代模型用于高效估计任务归因,通过第二阶分析建立线性替代模型与影响函数的联系,并在多个任务设置中验证其有效性,实现更高的相关性和可扩展性。

Comments 27 pages. Appeared in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07865 2026-05-11 cs.LG cs.AI cs.CL 67%

KL for a KL: On-Policy Distillation with Control Variate Baseline

KL 为 KL:带有控制变量基线的在线蒸馏

Minjae Oh, Sangjun Song, Gyubin Choi, Yunho Choi, Yohan Jo

机构 * Graduate School of Data Science(数据科学研究生院) Seoul National University(首尔国立大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出vOPD,通过引入控制变量基线将在线蒸馏转化为策略梯度强化学习,有效降低梯度方差,提升稳定性,并在多个基准上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00847 2026-05-08 cs.CL cs.AI cs.LG 67%

H-Probes: Extracting Hierarchical Structures From Latent Representations of Language Models

H-Probes:从语言模型的潜在表示中提取层次结构

Cutter Dawes, Aryan Sharma, Angelos Ioannis Lagos, Shivam Raval

机构 * Supervised Program for Alignment Research(对齐研究监督计划) Yale University(耶鲁大学) Harvard University(哈佛大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 H-Probes通过线性探针从语言模型的潜在表示中提取层次结构,揭示模型在语法、概念及推理过程中的深层抽象能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16989 2026-04-27 cs.CL cs.AI cs.LG cs.LO 67%

Bolzano: Case Studies in LLM-Assisted Mathematical Research

Bolzano:大语言模型辅助数学研究的案例研究

Martin Balko, Jan Grebík, Pavel Hubáček, Martin Koutecký, Matěj Kripner, Václav Rozhoň, Robert Šámal, Adrián Zámečník

机构 * Computer Science Institute, Charles University(查尔斯大学计算机科学研究所) Institute of Mathematics, Czech Academy of Sciences(捷克科学院数学研究所) Institute of Formal and Applied Linguistics, Charles University(查尔斯大学形式与应用语言学研究所) Department of Applied Mathematics, Charles University(查尔斯大学应用数学系)

专题命中 数学推理 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过八个数学和理论计算机科学问题,展示Bolzano系统如何通过多代理交互生成可发表的研究成果,其中五项几乎完全自主完成。

Comments 33 pages, 1 figure. Project page: https://bolzano.app

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19485 2026-04-22 cs.LG cs.AI cs.CL 67%

EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training

EVPO:用于大语言模型后训练中自适应批评者利用的解释方差策略优化

Chengjun Pan, Shichun Liu, Jiahang Lin, Dingwei Zhu, Jiazheng Zhang, Shihan Dou, Songyang Gao, Zhenhua Han, Binghai Wang, Rui Zheng, Xuanjing Huang, Tao Gui, Yansong Feng

机构 * Peking University(北京大学) Fudan University(复旦大学) Shanghai Qiji Zhifeng Co., Ltd.(上海启智科技有限公司) Shanghai AI Lab(上海人工智能实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出EVPO,通过监控批量方差并自适应切换基于批评者或批量均值估计,证明在每一步都能达到更小的方差。在四个任务中,EVPO优于PPO和GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17614 2026-04-21 cs.AI cs.CL cs.LG 67%

Characterizing Model-Native Skills

刻画模型内禀技能

Feiyang Kang, Mahavir Dabas, Myeongseob Ko, Ruoxi Jia

机构 * Virginia Tech(弗吉尼亚理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出模型内禀技能的刻画方法,通过从序列激活中恢复紧凑正交基,实现行为变化轴的自组织,验证了在推理和安全对齐中的有效性,优于人类定义的技能。

Comments We argue that when the goal is to intervene on model behavior, skill characterization should be *model-native*: grounded in the model's own representations rather than imposed through external ontologies

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07084 2026-04-21 cs.LG cs.AI cs.CL 67%

Countdown-Code: A Testbed for Studying The Emergence and Generalization of Reward Hacking in RLVR

Countdown-Code:研究RLVR中奖励黑客现象涌现与泛化的测试平台

Muhammad Khalifa, Zohaib Khan, Omer Tafveez, Hao Peng, Lu Wang

机构 * University of Michigan(密歇根大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Countdown-Code测试环境,通过分离代理奖励与真实奖励,研究LLM在监督微调中无意学习奖励黑客行为及其在强化学习中的泛化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏