arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 44877 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3218 篇

2605.09292 2026-05-12 cs.AI cs.CY 79%

Beyond Accuracy: Evaluating Strategy Diversity in LLM Mathematical Reasoning

超越准确性:评估大语言模型数学推理中的策略多样性

Xia Yang, Xuanyi Zhang, Hao Hu, Feng Ji

机构 * University of Toronto(多伦多大学) Upper Canada College(上加拿大学院) East China Normal University(华东师范大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究探讨了大语言模型在数学推理中策略多样性与准确性之间的关系,发现策略多样性是评估数学推理的重要补充维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27977 2026-05-12 cs.AI 79%

SARL: Label-Free Reinforcement Learning by Rewarding Reasoning Topology

SARL:通过奖励推理拓扑实现无标签强化学习

Yifan Wang, Bolian Li, David Cho, Ruqi Zhang, Fanping Sui, Ananth Grama

机构 * Purdue University(普渡大学) Texas Instruments(德州仪器)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出SARL框架,通过奖励推理拓扑而非最终结果来提升大模型的推理能力,在可验证数学任务和非可验证开放任务中均取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10960 2026-05-12 cs.LG math.ST stat.TH 79%

Ranking Reasoning LLMs under Test-Time Scaling

在测试时间扩展下对推理LLM进行排名

Mohsen Hariri, Michael Hinczewski, Jing Ma, Vipin Chaudhary

机构 * Department of Computer and Data Sciences(计算机与数据科学系) Department of Physics(物理系) Case Western Reserve University(凯斯西储大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出Scorio库,通过统计排名方法评估推理模型,在20个数学竞赛基准上验证了多种排名方法的有效性,并展示了在不同测试时间扩展下的性能。

Comments Code is available at https://github.com/mohsenhariri/scorio

Journal ref The 64th Annual Meeting of the Association for Computational Linguistics (ACL), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08061 2026-05-11 cs.AI 79%

Rubric-Grounded RL: Structured Judge Rewards for Generalizable Reasoning

基于评分标准的强化学习:用于通用推理的结构化评判奖励

Manish Bhattarai, Ismael Boureima, Nishath Rajiv Ranasinghe, Scott Pakin, Dan O'Malley

机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出基于评分标准的强化学习框架,通过LLM评判器生成多标准奖励,提升模型在通用推理任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07316 2026-05-11 cs.AI 79%

Implicit Compression Regularization: Concise Reasoning via Internal Shorter Distributions in RL Post-Training

隐式压缩正则化:通过内部更短分布实现简洁推理(在强化学习后训练)

Chen Wang, Hexuan Deng, Yining Zhang, Yuchen Zhang, Jionghao Bai, Zhaochun Li, Ge Lan, Yue Wang

机构 * College of Software, Nankai University(南开大学软件学院) Zhongguancun Academy(中关村学院) Harbin Institute of Technology(哈尔滨工业大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) East China Normal University(华东师范大学) Zhejiang University(浙江大学) Beijing Institute of Technology(北京理工大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出隐式压缩正则化(ICR),通过内部更短分布实现简洁推理,改进强化学习后训练中的推理效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24832 2026-04-28 cs.AI 79%

Scheduling Your LLM Reinforcement Learning with Reasoning Trees

用推理树调度你的LLM强化学习

Hong Wang, Zhezheng Hao, Jian Luo, Chenxing Wei, Yao Shu, Lei Liu, Qiang Lin, Hande Dong, Jiawei Chen

机构 * Cranberry-Lemon University(Cranberry-Lemon 大学) University of the Witwatersrand(独立研究者) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出基于推理树结构的Re-Schedule算法,通过r-score衡量查询难度,提升数据效率和准确性,实验显示在数学推理任务中平均准确率提升3.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23623 2026-04-28 cs.AI 79%

Tandem: Riding Together with Large and Small Language Models for Efficient Reasoning

Tandem: 大小语言模型协同以实现高效的推理

Zichuan Fu, Xian Wu, Guojing Li, Yejing Wang, Yijun Chen, Zihao Zhao, Yixuan Luo, Hanyu Yan, Yefeng Zheng, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Tencent Jarvis Lab(腾讯Jarvis实验室) Renmin University of China(中国人民大学) Westlake University(西湖大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 Tandem通过结合大语言模型和小语言模型,减少计算成本并提升推理质量,实验表明其在数学推理和代码生成任务中性能优越。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21321 2026-04-28 cs.AI 79%

LLM-Assisted Op-Amp Behavioral-Level Design via Agentic Human-Mimicking Reasoning

通过代理人类模拟推理的LLM辅助运算放大器行为级设计

Zihao Chen, Ziyi Sun, Jiayin Wang, Ji Zhuang, Jinyi Shen, Xiaoyue Ke, Li Shang, Xuan Zeng, Fan Yang

机构 * State Key Laboratory of Integrated Chips and Systems(集成芯片与系统国家重点实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出White-Op框架,利用大语言模型代理的类人推理能力,实现运算放大器行为级参数设计,通过符号推理与数值求解分离方法,结合模拟验证和迭代优化,提升设计可解释性与电路功能保持性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14368 2026-04-28 cs.CL 79%

Beyond Math: Stories as a Testbed for Memorization-Constrained Reasoning in LLMs

超越数学:故事作为LLM中受记忆限制推理的测试平台

Yuxuan Jiang, Francis Ferraro

机构 * Department of Computer Science and Electrical Engineering(计算机科学与电气工程系) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文通过故事测试平台探讨LLM在记忆受限推理中的表现,提出减少机械记忆的方法,发现记忆驱动性能下降,揭示现有基准测试的数据污染问题。

Comments published on EACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05038 2026-04-27 cs.CL 79%

Toward Automated Robustness Evaluation of Mathematical Reasoning

迈向数学推理的自动化鲁棒性评估

Yutao Hou, Zeguan Xiao, Fei Yu, Yihan Jiang, Ma Shuguang, Zhaoqian Dai, Hailiang Huang, Yun Chen, Guanhua Chen

机构 * Shanghai University of Finance and Economics(上海金融学院) Ant Group(蚂蚁集团) Southern University of Science and Technology(南方科技大学) MoE Key Laboratory of Interdisciplinary Research of Computation and Economics(计算与经济学交叉学科研究教育部重点实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出Math Stress Tester框架,通过多轮重写验证循环生成对抗样本,提升数学推理任务的鲁棒性评估能力,并验证其在非数学任务中的扩展性。

Comments Accepted by Findings of ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21057 2026-04-24 cs.CL 79%

TRACES: Tagging Reasoning Steps for Adaptive Cost-Efficient Early-Stopping

TRACES:用于适应性成本高效提前停止的推理步骤标记

Yannis Belkhiter, Seshu Tirupathi, Giulio Zizzo, John D. Kelleher

机构 * IBM Research Europe(IBM欧洲研究院) Trinity College Dublin(三一学院) ADAPT Research Centre(ADAPT研究中心)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 TRACES通过实时标记推理步骤,实现大语言模型推理的适应性成本高效提前停止,通过监控特定步骤类型提升数学和知识推理任务的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07527 2026-04-23 cs.LG 79%

Kalman Filter Enhanced GRPO for Reinforcement Learning-Based Language Model Reasoning

卡尔曼滤波增强的GRPO用于基于强化学习的语言模型推理

Hu Wang, Congbo Ma, Ian Reid, Mohammad Yaqub

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出KRPO,通过卡尔曼滤波估计潜在提示级奖励基线,提升语言模型推理的训练奖励和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19567 2026-04-22 cs.AI 79%

Multi-modal Reasoning with LLMs for Visual Semantic Arithmetic

基于LLM的多模态推理用于视觉语义算术

Chuou Xu, Liya Ji, Qifeng Chen

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出两种新型任务和IRPD数据集,通过SAri-RFT方法提升大视觉语言模型的跨模态关系推理能力,实现视觉语义算术的突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15173 2026-04-22 cs.AI 79%

Mind the (DH) Gap! A Contrast in Risky Choices Between Reasoning and Conversational LLMs

注意(DH)差距!理性推理与对话LLM在风险选择中的对比

Luise Ge, Yongyan Zhang, Yevgeniy Vorobeychik

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究通过对比推理模型与对话模型在风险决策中的表现,发现前者更理性,后者更接近人类但受因素影响更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18493 2026-04-21 cs.LG 79%

Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data

过于正确而无法学习:在饱和推理数据上进行强化学习

Zhenwen Liang, Yujun Zhou, Sidi Lu, Xiangliang Zhang, Haitao Mi, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室) University of Notre Dame(诺丁汉大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出CUTS策略,通过约束均匀Top-K采样增强探索,结合Mixed-CUTS框架提升推理多样性,实验显示在AIME25基准上Pass@1准确率提升15.1%。

Comments ACL 2026 Main Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04509 2026-04-21 cs.CL 79%

ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection

ErrorRadar:通过错误检测基准测试多模态大语言模型的复杂数学推理能力

Yibo Yan, Shen Wang, Jiahao Huo, Hang Li, Boyan Li, Jiamin Su, Xiong Gao, Yi-Fan Zhang, Tianlong Xu, Zhendong Chu, Aoxiao Zhong, Kun Wang, Hui Xiong, Philip S. Yu, Xuming Hu, Qingsong Wen

机构 * Squirrel AI HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) MSU(密歇根州立大学) UCAS(中国科学技术大学) University of Illinois at Chicago(伊利诺伊大学香槟分校)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 ErrorRadar通过错误检测任务评估多模态大语言模型在复杂数学推理中的能力,包含2500个高质量K-12数学问题,实验显示GPT-4o仍比人类评价差10%。

Comments Accepted by The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026, Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16972 2026-04-21 cs.AI 79%

MCPO: Mastery-Consolidated Policy Optimization for Large Reasoning Models

MCPO:面向大推理模型的 mastery-consolidated 策略优化

Zhaokang Liao, Yingguo Gao, Yi Yang, Yongheng Hu, Jingting Ding

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出 MCPO 算法,通过引入 hinge-KL 正则化和优先机制,解决高准确度提示下的策略漂移和巩固问题,提升大模型推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16646 2026-04-21 cs.AI cs.SE 79%

Agentic Frameworks for Reasoning Tasks: An Empirical Study

代理框架用于推理任务:一项实证研究

Zeeshan Rasheed, Abdul Malik Sami, Muhammad Waseem, Kai-Kristian Kemell, Mika Saari, Pekka Abrahamsson

机构 * Faculty of Information Technology and Communication Sciences, Tampere University(信息科技与通信科学学院,塔尔塔大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文通过实证研究评估了22种代理框架在BBH、GSM8K和ARC三个推理基准上的表现,发现19种框架完成所有任务,其中12种性能稳定,但数学推理能力下降显著。

Comments 43 Pages, 3 Figures, and 9 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08983 2026-04-21 cs.CL 79%

SpiralThinker: Latent Reasoning through an Iterative Process with Text-Latent Interleaving

SpiralThinker: 通过文本-潜在交织的迭代过程进行潜在推理

Shengmin Piao, Sanghyun Park

机构 * Yonsei University(延世大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 SpiralThinker通过文本-潜在交织的迭代过程实现稳定潜在推理,结合渐进对齐目标和结构化标注,提升推理稳定性与一致性,实现数学、逻辑和常识推理任务的SOTA性能。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15842 2026-04-20 cs.CL 79%

Disentangling Mathematical Reasoning in LLMs: A Methodological Investigation of Internal Mechanisms

解构大语言模型中的数学推理:对内部机制的调查

Tanja Baeumel, Josef van Genabith, Simon Ostermann

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) Saarland University(萨尔兰大学) Center for European Research in Trusted AI (CERTAIN)(可信人工智能欧洲研究中心)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 研究通过分析LLM执行算术任务时的内部机制,揭示模型在早期层识别算术任务,但正确结果生成仅在最终层完成,并发现擅长算术的模型在注意力与MLP模块间有明确分工。

Comments MathNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15490 2026-04-20 cs.CL 79%

Think Multilingual, Not Harder: A Data-Efficient Framework for Teaching Reasoning Models to Code-Switch

多语言思考,而非更难:一种数据高效的框架,用于教授推理模型进行语言混合

Eleanor M. Lin, David Jurgens

机构 * University of Michigan(密歇根大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出一种数据高效的框架,用于识别并教授推理模型更有效的语言混合行为,通过分析不同模型的语言混合行为,开发出有效的微调干预措施,提升推理模型的语言混合能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07774 2026-04-20 cs.CL 79%

Curing Miracle Steps in LLM Mathematical Reasoning with Rubric Rewards

用评分奖励模型治愈大语言模型数学推理中的奇迹步骤

Youliang Yuan, Qiuyang Mang, Jingbang Chen, Hong Wan, Xiaoyuan Liu, Junjielong Xu, Jen-tse Huang, Wenxuan Wang, Wenxiang Jiao, Pinjia He

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen, China(数据科学学院,香港中文大学(深圳)) UC Berkeley(加州大学伯克利分校) Zhejiang University(浙江大学) Johns Hopkins University(约翰霍普金斯大学) Renmin University of China(中国人民大学) Xiaohongshu Inc.(小红书公司)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文通过评分奖励模型解决大语言模型数学推理中的奇迹步骤问题,通过系统分析和人类验证建立失败模式分类,提升推理准确性和可靠性。

Comments Accepted by ACL 2026 Main, 22 pages, 10 figures, 7 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10649 2026-04-17 cs.AI 79%

Unlocking Exploration in RLVR: Uncertainty-aware Advantage Shaping for Deeper Reasoning

解锁RLVR中的探索:面向更深层次推理的不确定性感知优势塑造

Can Xie, Ruotong Pan, Xiangyu Wu, Yunfei Zhang, Jiayi Fu, Tingting Gao, Guorui Zhou

机构 * Kuaishou Technology(快手科技)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出UCAS方法,通过不确定性感知的优势塑造提升RLVR中的推理能力,解决探索效率低和熵崩溃问题,实验表明在多个数学推理基准上表现优异。

Comments 20 pages, 4 figures, ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20214 2026-04-17 cs.AI 79%

When Slower Isn't Truer: Inverse Scaling Law of Truthfulness in Multimodal Reasoning

当慢并非真:多模态推理中真理性的反比例定律

Sitong Fang, Wenjing Cao, Jiahao Li, Xuyao Wang, Juntao Dai, Chi-Min Chan, Sirui Han, Yike Guo, Yaodong Yang, Jiaming Ji

机构 * Institute for AI(人工智能研究院) Peking University(北京大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究探讨了多模态推理中慢思考模式的反比例定律,发现慢思考模型在面对不完整或误导性视觉输入时更易生成虚假细节,揭示了推理模型在处理模糊输入时的脆弱性。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13062 2026-04-16 cs.CL 79%

Mathematical Reasoning Enhanced LLM for Formula Derivation: A Case Study on Fiber NLI Modellin

增强数学推理的LLM用于公式推导:光纤非线性干扰建模的案例研究

Yao Zhang, Yuchen Song, Xiao Luo, Shengnan Li, Xiaotian Jiang, Min Zhang, Danshi Wang

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出一种增强数学推理的生成AI方法,用于光学通信公式推导,聚焦光纤非线性干扰建模,通过结构化提示引导LLM推导出已知闭式ISRS GN表达式并推导出适用于多段C和C+L波段传输的新近似式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06695 2026-04-09 cs.AI 79%

Reasoning Fails Where Step Flow Breaks

推理在步骤流断裂处失效

Xiaoyu Xu, Yulan Pan, Xiaosong Yuan, Zhihong Shen, Minghao Su, Yuanhao Su, Xiaofeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Fuzhou University(福州大学) Jilin University(吉林大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究提出StepFlow方法,通过修复信息流提升多步骤数学、科学和编码任务的推理准确性,揭示了浅层锁定和深层衰减两种信息流失效模式。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01591 2026-04-08 cs.AI 79%

ThinkTwice: Jointly Optimizing Large Language Models for Reasoning and Self-Refinement

ThinkTwice:联合优化大型语言模型以进行推理和自我完善

Difan Jiao, Qianfeng Wen, Blair Yang, Zhenwei Tang, Ashton Anderson

机构 * Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Coolwei AI Lab(Coolwei AI实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 ThinkTwice通过两阶段框架联合优化LLM,提升推理和自我完善性能,基于GRPO方法,在多个数学推理基准上优于现有基线。

Comments 27 pages,7 figures,5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03664 2026-04-07 cs.CL 79%

Document-Level Numerical Reasoning across Single and Multiple Tables in Financial Reports

跨单表和多表的财务报告中数字推理

Yi-Cheng Wang, Wei-An Wang, Chu-Song Chen

机构 * Department of Computer Science and Information Engineering, National Taiwan University(国立台湾大学资讯工程学系) FinTech Center, National Taiwan University(国立台湾大学金融科技中心)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出FinLongDocQA数据集,解决长文档中跨表数字推理问题,发现LLM在长文本中定位和多步计算时存在瓶颈,提出FinLongDocAgent多智能体方法提升可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03506 2026-04-07 cs.AI 79%

BioAlchemy: Distilling Biological Literature into Reasoning-Ready Reinforcement Learning Training Data

生物炼金术:将生物文献提炼为可用于强化学习训练的数据

Brian Hsu, Ozan Gökdemir, Carlo Siebenschuh, Bruce Parrello, Neil Getty, Thomas S. Brettin, Rick L. Stevens, Ian T. Foster, Nicholas Chia, Arvind Ramanathan

机构 * University of Chicago(芝加哥大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出BioAlchemy方法,通过提炼生物文献生成高质量训练数据,提升生物领域推理性能,最终在生物基准测试中实现9.12%的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19893 2026-04-06 cs.CL 79%

Future Policy Approximation for Offline Reinforcement Learning Improves Mathematical Reasoning

为离线强化学习未来政策近似改进数学推理

Minjae Oh, Yunho Choi, Dongmin Choi, Yohan Jo

机构 * Graduate School of Data Science, Seoul National University(首尔大学数据科学研究生院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出未来政策近似方法,通过估计未来策略来优化离线强化学习中的梯度更新,提升长周期推理任务的稳定性与准确性。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏