arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-08 至 2026-05-08 共收录 144 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 12 篇

2605.06660 2026-05-08 cs.LG cs.AI cs.CL 89%

Verifier-Backed Hard Problem Generation for Mathematical Reasoning

基于验证器的数学推理硬问题生成

Yuhang Lai, Jiazhan Feng, Yee Whye Teh, Ning Miao

机构 * Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) Hong Kong Institute of AI for Science, City University of Hong Kong(香港城市大学人工智能科学研究所) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Department of Statistics, University of Oxford(牛津大学统计系)

专题命中 数学推理 :reasoning(title,abstract);verifier(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出VHG框架,通过引入独立验证器约束问题生成器的奖励,提升生成问题的有效性和难度,实验显示其在不定积分和数学推理任务中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18857 2026-05-08 cs.AI cs.LG 84%

CORE: Concept-Oriented Reinforcement for Bridging the Definition-Application Gap in Mathematical Reasoning

CORE:面向概念的强化学习,弥合定义与应用之间的数学推理差距

Zijun Gao, Zhikun Xu, Xiao Ye, Ben Zhou

机构 * University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Arizona State University(亚利桑那州立大学)

专题命中 数学推理 :reasoning(title,abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 CORE通过引入概念导向的强化学习框架,解决大语言模型在数学推理中概念应用不足的问题,通过合成概念对齐习题和注入概念片段提升模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10443 2026-05-08 cs.SE cs.AI 81%

Are Large Language Models Robust in Understanding Code Against Semantics-Preserving Mutations?

大型语言模型在语义保持变异下的理解鲁棒性如何?

Pedro Orvalho, Marta Kwiatkowska

机构 * Department of Computer Science University of Oxford(计算机科学系牛津大学)

专题命中 数学推理 :reasoning(summary_cn,abstract);分类 cs.AI

AI总结 本文评估了大型语言模型在Python程序上的推理能力,通过五种语义保持的代码变异测试,发现模型在语义变换下表现出显著的脆弱性,正确预测基于 flawed reasoning 的比例在10%-50%之间,且预测稳定性差。

Comments 17 pages, 5 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06188 2026-05-08 cs.AI cs.CL 81%

OPSD Compresses What RLVR Teaches: A Post-RL Compaction Stage for Reasoning Models

OPSD 压缩 RLVR 教授的内容:一种为推理模型设计的后 RL 压缩阶段

Jaehoon Kim, Dongha Lee

机构 * Yonsei University(延世大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 OPSD 在数学推理中作为压缩机制更可靠,通过仅训练正确轨迹可保持准确性并显著缩短响应,而训练错误轨迹则损害准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04066 2026-05-08 cs.CL cs.ET cs.LG 81%

Adapt to Thrive! Adaptive Power-Mean Policy Optimization for Improved LLM Reasoning

适应与繁荣!面向改进大语言模型推理的自适应幂均策略优化

Yiming Huang, Zhenbo Shi, Shuzheng Gao, Cuiyun Gao, Peiyi Han, Chuanyi Liu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出自适应幂均策略优化方法,通过引入幂均目标和反馈自适应裁剪,提升大语言模型的推理性能,实验显示其在多个任务中表现优于现有方法。

Comments Accepted to ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04065 2026-05-08 cs.CL cs.ET cs.LG 81%

Free Energy-Driven Reinforcement Learning with Adaptive Advantage Shaping for Unsupervised Reasoning in LLMs

基于自发自由能的强化学习与自适应优势塑造的无监督推理在大语言模型中的应用

Yiming Huang, Zhenbo Shi, Xin-Cheng Wen, Jichuan Zeng, Cuiyun Gao, Peiyi Han, Chuanyi Liu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出FREIA算法,通过自发自由能奖励和自适应优势塑造提升大语言模型的无监督推理能力,在三个任务中表现优异。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05365 2026-05-08 cs.AI cs.CL 73%

ZAYA1-8B Technical Report

ZAYA1-8B 技术报告

Robert Washbourne, Rishi Iyer, Tomas Figliolia, Henry Zheng, Ryan Lorig-Roach, Sungyeon Yang, Pritish Yuvraj, Quentin Anthony, Yury Tokpanov, Xiao Yang, Ganesh Nanduru, Stephen Ebert, Praneeth Medepalli, Skyler Szot, Srivatsan Rajagopal, Alex Ong, Bhavana Mehta, Beren Millidge

机构 * Zyphra

专题命中 数学推理 :reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.AI

AI总结 ZAYA1-8B 是基于 MoE++ 架构的推理聚焦混合专家模型,通过全栈 AMD 平台训练,在数学和编程基准中表现优异,采用 RL 策略和 Markovian RSA 方法提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00847 2026-05-08 cs.CL cs.AI cs.LG 67%

H-Probes: Extracting Hierarchical Structures From Latent Representations of Language Models

H-Probes:从语言模型的潜在表示中提取层次结构

Cutter Dawes, Aryan Sharma, Angelos Ioannis Lagos, Shivam Raval

机构 * Supervised Program for Alignment Research(对齐研究监督计划) Yale University(耶鲁大学) Harvard University(哈佛大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 H-Probes通过线性探针从语言模型的潜在表示中提取层次结构,揭示模型在语法、概念及推理过程中的深层抽象能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05750 2026-05-08 cs.LG cs.CL 62%

RVPO: Risk-Sensitive Alignment via Variance Regularization

基于方差正则化的风险敏感对齐:RVPO

Ivan Montero, Tomasz Jurczyk, Bhuwan Dhingra

机构 * Apple(苹果公司)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出RVPO框架,通过在优势聚合中惩罚奖励方差,将目标从最大化总和转为最大化一致性,提升多目标对齐的可靠性。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06412 2026-05-08 cs.LG cs.CL 62%

Sample-efficient LLM Optimization with Reset Replay

基于重置回放的高效大语言模型优化

Zichuan Liu, Jinyu Wang, Lei Song, Jiang Bian

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出LoRR方法,通过高重播训练和周期性重置策略提升偏好优化的样本效率,实验表明其在数学和通用推理基准上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06650 2026-05-08 cs.CL 57%

Beyond Negative Rollouts: Positive-Only Policy Optimization with Implicit Negative Gradients

超越负回滚:仅正回滚的策略优化

Mingwei Xu, Hao Fang

机构 * University of Washington(华盛顿大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出POPO框架,通过仅使用在线正回滚进行学习,避免负回滚,并通过siamese网络和相似性惩罚提升稳定性,实验证明其在数学基准测试中性能优于GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01400 2026-05-08 cs.CL 57%

EternalMath: A Living Benchmark of Frontier Mathematics that Evolves with Human Discovery

EternalMath: 一个与人类发现同步演化的前沿数学基准

Jicheng Ma, Guohua Wang, Xinhua Feng, Yiming Liu, Zhichao Hu, Yuhong Liu

机构 * School of Mathematics, Renmin University of China(中国人民大学数学学院) Tencent(腾讯)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一个自动化数学推理评估框架,通过将最新数学文献转化为可执行任务,构建可扩展的EternalMath基准,揭示LLM在前沿数学上的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 7 篇

2604.06269 2026-05-08 q-bio.QM cs.AI 87%

MAT-Cell: A Multi-Agent Tree-Structured Reasoning Framework for Batch-Level Single-Cell Annotation

MAT-Cell: 一种多智能体树状推理框架用于批量单细胞注释

Yehui Yang, Zelin Zang, Xienan Zheng, Yuzhe Jia, Changxi Chi, Jingbo Zhou, Chang Yu, Jinlin Wu, Fuji Yang, Jiebo Luo, Zhen Lei, Stan Z. Li

机构 * Westlake University(西湖大学) Shenzhen University of Advanced Technology(深圳先进技术大学) Center for Artificial Intelligence and Robotics(人工智能与机器人中心) Hong Kong Institute of Science and Innovation(香港科学与创新研究院) Chinese Academy of Sciences(中国科学院) University Key Laboratory of Information and Communication Security Backup and Recovery(信息与通信安全备份与恢复大学重点实验室)

专题命中 代码与定理证明 :reasoning(title,abstract);CoT(abstract,abstract_cn);verifier(abstract);分类 cs.AI

AI总结 MAT-Cell通过分离证据基础与标签决策,结合反向验证查询和多轮辩论,提升批量单细胞注释的准确性与可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05485 2026-05-08 cs.CL cs.AI 81%

ReaComp: Compiling LLM Reasoning into Symbolic Solvers for Efficient Program Synthesis

ReaComp:将LLM推理编译为符号求解器以实现高效的程序合成

Atharva Naik, Yash Mathur, Prakam, Carolyn Rose, David Mortensen

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 通过编译推理轨迹生成符号求解器,提升程序合成效率与准确性,同时减少对LLM的依赖,适用于多个基准测试任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15119 2026-05-08 cs.AI cs.CL cs.LG cs.RO 67%

Flexible Agent Alignment with Goal Inference from Open-Ended Dialog

基于开放对话的目标推断的灵活代理对齐

Rachel Ma, Jingyi Qu, Andreea Bobu, Dylan Hadfield-Menell

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出OU-AGs框架,通过开放对话中目标推断提升代理对齐能力,采用GOOD方法实现动态目标分布,提高多领域任务中的意图对齐效果。

Comments Previous version of the paper was titled: Open-Universe Assistance Games

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02079 2026-05-08 cs.CL cs.AI 62%

Argumentative Large Language Models for Explainable and Contestable Claim Verification

用于可解释和可争议主张验证的论证大型语言模型

Gabriel Freedman, Adam Dejl, Deniz Gorur, Xiang Yin, Antonio Rago, Francesca Toni

机构 * Department of Computing, Imperial College London, UK(伦敦帝国学院计算机系)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出论证大型语言模型(ArgLLMs),通过引入论证推理增强LLMs,使其决策可解释且可争议,通过实验验证其在主张验证任务中的性能。

Comments 18 pages, 18 figures. Accepted as an oral presentation at AAAI 2025

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 39(14), 14930-14939. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06601 2026-05-08 cs.CR cs.AI 57%

Patch2Vuln: Agentic Reconstruction of Vulnerabilities from Linux Distribution Binary Patches

Patch2Vuln: 基于Linux发行版二进制补丁的漏洞重构

Isaac David, Arthur Gervais

机构 * University College London(伦敦大学学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨利用语言模型代理从Linux发行版二进制补丁中重构漏洞,提出Patch2Vuln流程,通过提取ELF对、差异分析和代理审计,验证了二进制补丁中漏洞重构的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06434 2026-05-08 cs.AI 57%

Knowledge Graphs, the Missing Link in Agentic AI-based Formal Verification

知识图谱:代理AI形式验证中的缺失链接

Vaisakh Naduvodi Viswambharan, Keerthan Kopparam Radhakrishna, Deepak Narayan Gadde, Aman Kumar

机构 * 1 Infineon Technologies Dresden AG \& Co. KG, Germany 2 Infineon Technologies Semiconductor India Private Limited, India

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于知识图谱的验证方法,通过结构化中间表示提取规范、RTL和工具反馈,提升形式验证中规范到RTL的关联性,并通过多代理工作流生成SVAs及三种修正循环。

Comments To appear at the IEEE International Conference on IC Design and Technology 2026 (ICICDT), June 22 - 24, 2026, Dresden, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19715 2026-05-08 cs.AI 57%

Neuro-Symbolic Proof Generation for Scaling Systems Software Verification

神经符号证明生成用于系统软件验证的扩展

Baoding He, Zenan Li, Wei Sun, Yuan Yao, Taolue Chen, Xiaoxing Ma, Zhendong Su

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) School of Computer Science, Nanjing University, China(南京大学计算机科学学院) Department of Computer Science, ETH Zurich, Switzerland(苏黎世联邦理工学院计算机科学系) School of Computing and Mathematical Sciences, Birkbeck, University of London, UK(伦敦大学伯克贝克学院计算与数学科学学院)

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种神经符号证明生成框架,通过结合大语言模型和交互式定理证明工具,实现系统级验证的自动化证明搜索,有效提升软件验证的可扩展性。

Comments Published as a conference paper at OSDI'2026, and code is available at \url{https://github.com/SoaringE/seL4-proof-search}

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 5 篇

2605.05478 2026-05-08 cs.AI 74%

LANTERN: LLM-Augmented Neurosymbolic Transfer with Experience-Gated Reasoning Networks

LANTERN:基于大语言模型的神经符号迁移与经验门控推理网络

Mahyar Alinejad, Yue Wang, Amrit Singh Bedi, George Atia

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) University of Central Florida(中央佛罗里达大学) Department of Computer Science(计算机科学系)

专题命中 逻辑推理 :reasoning(title);分类 cs.AI

AI总结 LANTERN通过生成自动机、语义聚合和自适应门控方法,实现多源神经符号迁移,提升样本效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06365 2026-05-08 cs.AI cs.MA cs.SE 57%

From Agent Loops to Deterministic Graphs: Execution Lineage for Reproducible AI-Native Work

从代理循环到确定性图:可重复AI原生工作的执行轨迹

Josh Rosen, Seth Rosen

机构 * ThruWire, Inc.(ThruWire公司)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出执行轨迹模型,通过有向无环图表示AI生成工作,确保在变化中保持稳定性。对比实验显示,DAG在保持最终结果和中间状态一致性方面优于循环更新方法。

Comments 16 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06024 2026-05-08 cs.AI 57%

Strat-LLM: Stratified Strategy Alignment for LLM-based Stock Trading with Real-time Multi-Source Signals

Strat-LLM:基于实时多源信号的LLM股票交易分层策略对齐

Wenliang Huang, Zengyi Yu

机构 * School of Economics(经济学院) Zhejiang University of Technology(浙江工业大学) Faculty of Education(教育学院) East China Normal University(华东师范大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Strat-LLM框架,通过分层策略对齐提升LLM在股票交易中的表现,实验显示不同模式下模型在风险控制和收益获取上的差异。

Comments Accepted by the 2026 International Joint Conference on Neural Networks (IJCNN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06630 2026-05-08 eess.SY cs.SY 50%

Quantifying Trade-Offs Between Stability and Goal-Obfuscation

量化稳定性与目标混淆之间的权衡

Yixuan Wang, Dan Guralnik, Warren Dixon

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文研究了在连续状态空间中意图隐私的联合控制问题,通过设计隐私约束与跟踪要求的联合可行性分析,提出了基于PCBF的意图隐私保护方法。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06443 2026-05-08 cs.MA 50%

AgenticPrecoding: LLM-Empowered Multi-Agent System for Precoding Optimization

代理预编码:基于LLM的多智能体系统用于预编码优化

Zijiu Yang, Zixiang Zhang, Shunpu Tang, Qianqian Yang, Zhiguo Shi

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出AgenticPrecoding框架,通过多智能体系统自动推导端到端预编码,提升未来6G网络中异构场景的适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 22 篇

2605.06040 2026-05-08 cs.AI cs.CL 90%

Novelty-based Tree-of-Thought Search for LLM Reasoning and Planning

基于新颖性的树状思维搜索用于大语言模型推理与规划

Leon Hamm, Zlatan Ajanovic

机构 * RWTH Aachen(亚琛工业大学)

专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于新颖性的树状思维搜索方法,通过引入新颖性概念优化语言领域推理与规划任务,减少搜索范围和token成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05963 2026-05-08 cs.AI cs.CL 81%

TheraAgent: Self-Improving Therapeutic Agent for Precise and Comprehensive Treatment Planning

TheraAgent:自我改进的治疗剂用于精准且全面的治疗计划

Junkai Li, Yunghwei Lai, Tianyi Zhu, Zheng Long Lee, Weizhi Ma, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国) Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学,北京,中国) School of Computing, National University of Singapore, Singapore(计算学院,新加坡国立大学,新加坡)

专题命中 规划推理 :planning(title);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 TheraAgent通过迭代生成-判断-改进流程提升治疗计划的精准度和完整性,实验显示其在HealthBench上表现优异,专家评估中胜率高达86%。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25907 2026-05-08 cs.LG cs.AI 81%

How Fast Should a Model Commit to Supervision? Training Reasoning Models on the Tsallis Loss Continuum

模型应如何快速承诺于监督?在Tsallis损失连续体上训练推理模型

Chu-Cheng Lin, Eugene Ie

机构 * Google(谷歌)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Tsallis损失族J_Q,通过q参数在RLVR和密度估计极之间插值,解释SFT-then-RLVR流程,并提出GARL和PAFT方法以缓解冷启动问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01327 2026-05-08 cs.AI cs.LG 81%

Segment-Aligned Policy Optimization for Multi-Modal Reasoning

基于段落对齐的策略优化用于多模态推理

Lei Gao, Zhuoming Li, Mengxi Jia, Jiakang Yuan, Hongbo Sun, Hao Sun, Xuelong Li

机构 * Fudan University(复旦大学) Southeast University(东南大学) China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd.(中国电信人工智能技术(北京)有限公司) Institute of Artificial Intelligence, China Telecom(中国电信人工智能研究院)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出SAPO方法,通过将推理步骤而非token或完整序列作为策略更新的基本单元,提升多模态推理任务的准确性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05826 2026-05-08 cs.AI 79%

AGPO: Asymmetric Group Policy Optimization for Verifiable Reasoning and Search Ads Relevance at JD

AGPO:面向京东可验证推理和搜索广告相关性的非对称分组策略优化

Yang Xu, Kun Yao, Yiming Deng, Zheng Fang, Kai Ming Ting, Ming Pang

机构 * Nanjing University, Nanjing, China(南京大学) Peking University, Beijing, China(北京大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出AGPO方法,通过非对称分组策略优化,抑制错误推理路径,提升模型探索能力,并在数学基准和工业应用中实现高准确率和性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21877 2026-05-08 cs.LG cs.AI 62%

P^2O: Joint Policy and Prompt Optimization

P²O:联合策略和提示优化

Xinyu Lu, Kaiqi Zhang, Jinglin Yang, Boxi Cao, Yaojie Lu, Hongyu Lin, Min He, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) National Computer Network Emergency Response Technical Team/Coordination Center of China(中国国家计算机网络应急技术协调中心)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出P²O方法,通过交替更新连续策略与离散提示,解决RLVR在难样本上的优势崩溃问题,提升模型泛化能力并提升性能9.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏