arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3220 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3220 篇

2605.22177 2026-05-22 cs.LG cs.CL 62%

Maestro: Reinforcement Learning to Orchestrate Hierarchical Model-Skill Ensembles

Maestro:通过强化学习协调分层模型-技能集合

Jinyang Wu, Guocheng Zhai, Ruihan Jin, Yuhao Shen, Zhengxi Lu, Fan Zhang, Haoran Luo, Zheng Lian, Zhengqi Wen, Jianhua Tao

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学) Tongji University(同济大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Maestro框架,通过强化学习协调多模态任务,利用分层模型-技能集合提升多模态任务性能,实现高效且通用的协调策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04537 2026-05-22 cs.LG cs.CL 62%

Linear Dynamics in the RLVR Training of Large Language Models

在大语言模型RLVR训练中的线性动力学

Tianle Wang, Jiayu Liu, Zhongyuan Wu, Shenghao Jin, Wei Chen, Hao Xu, Ning Miao

机构 * Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) Hong Kong Institute of AI for Science, City University of Hong Kong(香港城市大学人工智能科学研究院) Li Auto Inc. Beihang University(北航大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了强化学习可验证奖励(RLVR)在大语言模型训练中的内部动态,发现RLVR在多种模型和训练配置下均进入线性区域,通过实验和理论分析证明这种线性特性源于训练信号的高方差和噪声,且具有预测性和实用性。

Comments Major revision: substantially reorganized the manuscript and added a theoretical explanation section. The replacement is intended for the same arXiv paper; the core topic and contribution remain the same

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21468 2026-05-21 cs.LG cs.CL 62%

You Only Need Minimal RLVR Training: Extrapolating LLMs via Rank-1 Trajectories

你只需要最小的RLVR训练:通过秩-1轨迹来扩展LLMs

Zhepei Wei, Xinyu Zhu, Wei-Lin Chen, Chengsong Huang, Jiaxin Huang, Yu Meng

机构 * University of Virginia(弗吉尼亚大学) Washington University in St. Louis(华盛顿大学圣路易斯分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了通过秩-1轨迹扩展LLMs的方法,发现RLVR参数轨迹具有极低的秩和高度可预测性,并提出RELEX方法,通过简单的线性回归在无需训练模型的情况下实现高效的超量扩展。

Comments preprint. Code: https://github.com/weizhepei/RELEX

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21467 2026-05-21 cs.LG cs.CL 62%

DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards

DelTA: 一种用于可验证奖励强化学习的判别性token信用分配

Kaiyi Zhang, Wei Wu, Yankai Lin

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院 Gallagher 学院) Ant International(蚂蚁国际)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出DelTA方法,通过估计token系数来增强特定侧的token梯度方向,从而改进可验证奖励强化学习中的token概率更新,提升了模型在数学基准测试中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21266 2026-05-21 cs.LG cs.AI 62%

How Much Online RL is Enough? Informative Rollouts for Offline Preference Optimization in RLVR

在线强化学习需要多少?用于RLVR中离线偏好优化的信息性回放

Richa Verma, Balaraman Ravindran

机构 * TCS Research Department of CSE(TCS计算机科学系研究部) IIT Madras(印度理工学院马德拉斯分校) Department of Data Science & AI(数据科学与人工智能系) Wadhwani School of Data Science & AI(Wadhwani数据科学与人工智能学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出G2D方法,通过短时GRPO预热、构建静态偏好数据集和离线DPO微调,以较低的计算成本实现优于GRPO的性能,强调偏好数据信息性而非数量的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20994 2026-05-21 cs.CL cs.AI 62%

Towards Context-Invariant Safety Alignment for Large Language Models

面向大语言模型的上下文不变安全对齐

Yixu Wang, Yang Yao, Xin Wang, Yifeng Gao, Yan Teng, Xingjun Ma, Yingchun Wang

机构 * Fudan University, Shanghai, China(复旦大学,上海,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种上下文不变的安全对齐方法,通过引入锚点不变正则化(AIR)来提升模型在不同上下文中的鲁棒性,从而增强安全约束对对抗性框架的抵抗力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20722 2026-05-21 cs.LG cs.AI 62%

AGPO: Adaptive Group Policy Optimization with Dual Statistical Feedback

AGPO: 基于双统计反馈的自适应群体策略优化

Miaobo Hu, Shuhao Hu, Bokun Wang, Ruohan Wang, Xin Wang, Xiaobo Guo, Daren Zha, Jun Xiao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AGPO,一种无 critic 的 GRPO 改进方法,通过群体层面的统计信息控制更新幅度和探索。在九个英语和中文数学/STEM 基准上,Qwen2.5-14B 在相同生成 token 预算下优于 PPO/GRPO,达到 GSM8K 67.3% 和 MATH 40.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18924 2026-05-20 cs.LG cs.AI 62%

Noise-corrected GRPO: From Noisy Rewards to Unbiased Gradients

噪声校正的GRPO:从噪声奖励到无偏梯度

Omar El Mansouri, Fathinah Asma Izzati, Mohamed El Amine Seddik, Salem Lahlou

机构 * Department of Machine Learning, Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, UAE Technology Innovation Institute, Abu Dhabi, UAE Department of Robotics, Khalifa University, Abu Dhabi, UAE

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种噪声鲁棒的GRPO框架,通过校正奖励中的噪声来获得无偏梯度估计,从而提升强化学习在噪声环境中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19523 2026-05-20 cs.CL cs.AI cs.CV 62%

Investigating Cross-Modal Skill Injection: Scenarios, Methods, and Hyperparameters

探究跨模态技能注入:场景、方法与超参数

Zhiyu Xu, Lean Wang, Yuanxin Liu, Lei Li, Hao Zhou, Fandong Meng, Jie Zhou, Xu Sun

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) WeChat AI, Tencent Inc., China(腾讯公司,中国) The University of Hong Kong(香港大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了跨模态技能注入在不同场景下的表现,分析了其方法和超参数的影响,发现其在指令遵循和跨语言任务中表现良好,但在数学推理中存在困难,同时指出经典方法如TA和DARE在性能上优于其他融合方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19425 2026-05-20 cs.LG cs.AI 62%

When to Stop Reusing: Dynamic Gradient Gating for Sample-Efficient RLVR

何时停止重用:动态梯度门控用于样本高效的RLVR

Yuchun Miao, Sen Zhang, Yuqi Zhang, Yaorui Shi, Qi Gu, Xunliang Cai, Lefei Zhang

机构 * National Engineering Research Center for Multimedia Software, School of Computer Science, Wuhan University(国家多媒体软件工程研究中心,武汉大学计算机学院) Meituan Longcat Team(美团Longcat团队) The University of Sydney(悉尼大学) University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出动态梯度门控(DGG)方法,通过实时监控lm_head梯度范数来检测并阻止有害的梯度传播,从而提高样本效率和训练速度。

Comments 23 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17003 2026-05-20 cs.LG cs.AI 62%

Learning-Zone Energy: Online Data Selection for Efficient RL Post-Training

学习区能量:用于高效RL后训练的在线数据选择

Peng Cui, Boyao Yang, Jun Zhu

机构 * Dept. of Comp. Sci. & Tech.(计算机科学与技术系) Institute for AI(人工智能研究院) BNRist Center(BNRist中心) Tsinghua-Bosch Joint ML Center(清华大学-博世联合机器学习中心) THBI Lab(THBI实验室) Tsinghua University(清华大学) Dept. of Automation(自动化系)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出学习区能量(LZE)方法,通过在线数据选择框架集中计算在模型的主动学习前沿,提高RL后训练的效率,实验表明在多个数据集上表现优异,且计算资源消耗减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06462 2026-05-20 cs.CL cs.LG 62%

Diffusion-State Policy Optimization for Masked Diffusion Language Models

扩散状态策略优化用于掩码扩散语言模型

Daisuke Oba, Hiroki Furuta, Naoaki Okazaki

机构 * Institute of Science Tokyo(东京科学研究院)

专题命中 数学推理 :planning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Diffusion-State Policy Optimization(DiSPO),一种用于掩码扩散语言模型的插件信用分配层,通过直接优化中间填充决策来改进生成过程,实验表明其在数学和规划基准测试中优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14292 2026-05-19 cs.LG cs.CL 62%

Minimal-Intervention KV Retention via Set-Conditioned Diversity

通过集合条件多样性实现最小干预的KV保留

Libo Sun, Po-wei Harn, Peixiong He, Xiao Qin

机构 * Department of Computer Science and Software Engineering(计算机科学与软件工程系) Department of Information Management(信息管理系) Auburn University(阿伯丁大学) National Central University(国立中央大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究通过改进TriAttention保留评分器,在有限预算下提升KV缓存压缩效果,采用V空间冗余惩罚机制,验证了最小修改优于结构性重设计。

Comments 15 pages, 3 figures, 3 tables. Code and data: https://github.com/libophd/minimal-kv-retention

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19590 2026-05-19 cs.LG cs.CL 62%

Learning to Reason without External Rewards

无需外部奖励的学习推理

Xuandong Zhao, Zhewei Kang, Aosong Feng, Sergey Levine, Dawn Song

机构 * UC Berkeley(加州大学伯克利分校) Yale University(耶鲁大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Intuitor方法,通过内在反馈实现无需外部奖励的自主学习,实验表明其在数学基准和代码生成等任务中表现优异,为无监督学习提供了新途径。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16470 2026-05-19 cs.LG cs.AI 62%

Strategic Over-Parameterization for Generalizable Low-Rank Adaptation

战略性过参数化以实现通用的低秩适应

Jing Gao, Zhong-Yi Lu, Pan Zhang, Ze-Feng Gao

机构 * School of Fundamental Physics and Mathematical Sciences, Hangzhou Institute for Advanced Study, UCAS, Hangzhou 310024, China(1 基础物理与数学科学学院,杭州先进研究院,UCAS,杭州 310024,中国) School of Physical Sciences, University of Chinese Academy of Sciences, No. 19A Yuquan Road, Beijing 100049, China(2 物理科学学院,中国科学院大学,玉泉路19A号,北京 100049,中国) CAS Key Laboratory of Theoretical Physics, Institute of Theoretical Physics, Chinese Academy of Sciences, Beijing 100190, China(3 中国科学院理论物理重点实验室,理论物理研究所,中国科学院,北京 100190,中国) School of Physics and Key Laboratory of Quantum State Construction and Manipulation (Ministry of Education), Renmin University of China, Beijing 100872, China(4 物理学院和量子态构造与操控(教育部)重点实验室,中国人民大学,北京 100872,中国)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LoRA-Over框架,通过训练时丰富优化景观并推理时压缩,提升低秩适应的泛化能力,实验显示其在多个任务上优于传统LoRA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19470 2026-05-19 cs.LG cs.AI 62%

Adaptive Layerwise Perturbation: Unifying Off-Policy Corrections for LLM RL

自适应分层扰动:统一LLM RL中的非策略修正

Chenlu Ye, Xuanchang Zhang, Yifan Hao, Zhou Yu, Ziji Zhang, Abhinav Gullapalli, Hao Chen, Jing Huang, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出自适应分层扰动(ALP),通过在更新过程中向每一层的输入隐藏状态注入可控噪声,缓解策略退化和训练-推理不匹配问题,提升训练稳定性与探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15726 2026-05-18 cs.AI cs.CL 62%

Nudging Beyond the Comfort Zone: Efficient Strategy-Guided Exploration for RLVR

走出舒适区:为RLVR的高效策略引导探索

Chanuk Lee, Sangwoo Park, Minki Kang, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出NudgeRL框架,通过策略引导实现结构化和多样性探索,提升RLVR在数学基准上的表现,相比标准GRPO和oracle引导方法更高效。

Comments 28 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15604 2026-05-18 cs.LG cs.CL 62%

VSPO: Vector-Steered Policy Optimization for Behavioral Control

VSPO:用于行为控制的向量引导策略优化

Xuechen Zhang, Zijian Huang, Kai Yang, Weijia Zhang, Jiasi Chen, Samet Oymak

机构 * University of Michigan(密歇根大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 VSPO通过引入与目标行为关联的引导向量,控制生成轨迹的行为强度,解决多目标优化中的稀疏奖励问题,提升策略优化效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15565 2026-05-18 cs.LG cs.AI 62%

AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs

AstraFlow:面向代理大语言模型的数据流强化学习

Haizhong Zheng, Yizhuo Di, Jiahui Wang, Shuowei Jin, Xueshen Liu, Yongji Wu, Z. Morley Mao, Ion Stoica, Jiawei Zhao, Beidi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学) UC Berkeley(加州大学伯克利分校) Meta

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 AstraFlow通过数据流导向的强化学习系统,实现复杂多策略协作训练和高效利用异构计算资源,提升代理LLM的推理与工具使用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15436 2026-05-18 cs.CL cs.LG 62%

Neural Activation Patterns Across Language Model Architectures: A Comprehensive Analysis of Cognitive Task Performance

神经激活模式在语言模型架构中的跨分析:对认知任务性能的全面研究

Mahdi Naser-Moghadasi, Faezeh Ghaderi

机构 * Research Division, BrightMind AI(BrightMind AI 研究部) Texas Tech University(德克萨斯理工大学) University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文分析了六种大型语言模型架构在十二种认知任务上的神经激活模式,揭示了编码器和解码器架构在处理不同任务时的差异,发现数学推理产生最高注意力熵,解码器模型在稀疏性上更高。

Comments 8 pages, accepted at IEEE BigData 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19241 2026-05-18 cs.LG cs.AI 62%

ActiveDPO: Active Direct Preference Optimization for Sample-Efficient Alignment

ActiveDPO: 用于高效对齐的主动直接偏好优化

Xiaoqiang Lin, Arun Verma, Zhongxiang Dai, Daniela Rus, See-Kiong Ng, Bryan Kian Hsiang Low

机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) Singapore-MIT Alliance for Research and Technology Centre(新加坡-麻省理工联盟研究技术中心) The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) CSAIL, Massachusetts Institute of Technology(麻省理工学院计算机科学与人工智能实验室) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 ActiveDPO通过理论支撑的非线性奖励函数选择方法,利用LLM自身参数化奖励模型,提升对齐效率和数据收集效果。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14841 2026-05-15 cs.LG cs.AI 62%

GPart: End-to-End Isometric Fine-Tuning via Global Parameter Partitioning

GPart:通过全局参数划分实现端到端等距微调

Paolo Mandica, Michał Brzozowski, Zuzanna Dubanowska, Neo Christopher Chung

机构 * Samsung AI Center(三星人工智能中心) University of Warsaw(华沙大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 GPart通过全局参数划分方法实现端到端等距微调,无需低秩结构,仅需一个随机投影即可高效微调模型,实现存储成本低且性能优越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13935 2026-05-15 cs.LG cs.CL 62%

Beyond Mode-Seeking RL: Trajectory-Balance Post-Training for Diffusion Language Models

超越模式寻求强化学习:扩散语言模型的轨迹平衡后训练

Saba Ahmadi, Prasanna Parthasarathi, Yufei Cui

机构 * Noah’s Ark Lab(Noah’s Ark 实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出TraFL方法,通过轨迹平衡目标提升扩散语言模型的后训练效果,在多个基准测试中均优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13695 2026-05-14 cs.CL cs.AI 62%

RTLC -- Research, Teach-to-Learn, Critique: A three-stage prompting paradigm inspired by the Feynman Learning Technique that lifts LLM-as-judge accuracy on JudgeBench with no fine-tuning

RTLC -- 研究、教以学、批判:一种受费曼学习技术启发的三阶段提示范式,无需微调即可提升LLM-as-judge在JudgeBench上的准确性

Andrea Morandi

机构 * Cisco(思科)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 RTLC通过三阶段提示方法提升LLM在JudgeBench上的准确性,无需微调或外部工具,其核心方法包括研究、教以学和批判三个阶段,显著提升客观正确性评分的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13295 2026-05-14 cs.CL cs.AI cs.MA 62%

CANTANTE: Optimizing Agentic Systems via Contrastive Credit Attribution

CANTANTE:通过对比信用分配优化代理系统

Tom Zehle

机构 * University of Freiburg(弗赖堡大学) ELLIS Institute(埃里克·林斯研究所) Tübingen(图宾根)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CANTANTE框架,通过对比多个联合配置的rollouts分解系统奖励为单个代理的更新信号,提升多代理系统优化效果,在编程、数学推理和多跳问答任务中均取得最佳排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13399 2026-05-14 cs.AI cs.CL 62%

Differentiable Evolutionary Reinforcement Learning

可微分进化强化学习

Sitao Cheng, Tianle Li, Xuhan Huang, Xunjian Yin, Difan Zou

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DERL,通过可微分的元优化器自动发现最优奖励结构,实现复杂任务中的高效强化学习,优于传统非可微方法。

Comments Work in Progress. We release our code and model at https://github.com/sitaocheng/DERL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11274 2026-05-14 cs.CL cs.LG 62%

Learning a Continue-Thinking Token for Enhanced Test-Time Scaling

学习一个持续思考标记以增强测试时扩展

Liran Ringel, Elad Tolochinsky, Yaniv Romano

机构 * Department of Computer Science, Technion – Israel Institute of Technology(计算机科学系,技术学院–以色列理工学院) Department of Electrical and Computer Engineering, Technion – Israel Institute of Technology(电气与计算机工程系,技术学院–以色列理工学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了通过学习专用持续思考标记来提升测试时扩展性能的方法,实验表明该方法在数学基准测试中优于固定标记方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05410 2026-05-14 cs.AI cs.CL 62%

ChatSR: Multimodal Large Language Models for Scientific Formula Discovery

ChatSR:用于科学公式发现的多模态大语言模型

Yanjie Li, Lina Yu, Weijun Li, Min Wu, Liping Zhang, Jingyi Liu, Yusong Deng, Mingzhu Wan, Xin Ning

机构 * AnnLab, Institute of Semiconductors, Chinese Academy of Sciences, Beijing, China(安 lab,半导体研究所,中国科学院,北京,中国) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences, Beijing, China(电子、电气与通信工程学院,中国科学院大学,北京,中国) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing 101408, China(先进交叉科学学院,中国科学院大学,北京101408,中国) College of Materials Science and Opto-Electronic Technology, University of Chinese Academy of Sciences, Beijing, 100049, China(材料科学与光电技术学院,中国科学院大学,北京100049,中国) School of Integrated Circuits, University of Chinese Academy of Sciences, Beijing 100049, China(集成电路学院,中国科学院大学,北京100049,中国)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ChatSR通过设计专用编码器和模态对齐机制,将科学数据映射到可被大语言模型处理的表示空间,从而生成符合领域先验的数学公式,推动科学发现自动化。

Comments 14 pages,

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11491 2026-05-13 cs.LG cs.AI 62%

Understanding and Preventing Entropy Collapse in RLVR with On-Policy Entropy Flow Optimization

理解与防止RLVR中的熵崩溃:基于策略熵流的在线优化

Huimin Xu, Shuai Zhao, Xiaobao Wu, Anh Tuan Luu

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) VinUniversity(文大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出OPEFO方法,通过平衡熵动态缓解RLVR中的熵崩溃问题,提升训练稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11235 2026-05-13 cs.LG cs.AI 62%

Internalizing Curriculum Judgment for LLM Reinforcement Fine-Tuning

将课程判断内部化以优化大语言模型强化微调

Han Zheng, Yining Ma, Karthick Gunasekaran, Bharathan Balaji, Zheng Du, Shiv Vitaladevuni, Cathy Wu

机构 * MIT(麻省理工学院) Amazon AGI(亚马逊人工智能实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出METIS框架,通过内部化课程判断提升LLM强化微调效率与性能,利用训练结果动态分配训练资源,实现闭环优化。

详情

展开后加载摘要…

URL PDF HTML 收藏