arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 12115 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 4092 篇

2603.04743 2026-03-06 cs.IR cs.AI cs.CL 62%

DARE: Aligning LLM Agents with the R Statistical Ecosystem via Distribution-Aware Retrieval

DARE: 通过分布感知检索对齐LLM代理与R统计生态系统

Maojun Sun, Yue Wu, Yifei Xie, Ruijian Han, Binyan Jiang, Defeng Sun, Yancheng Yuan, Jian Huang

机构 * Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University, Hong Kong SAR, China(数据科学与人工智能系,香港理工大学,香港特别行政区,中国) Department of Applied Mathematics, The Hong Kong Polytechnic University, Hong Kong SAR, China(应用数学系,香港理工大学,香港特别行政区,中国)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 DARE通过整合数据分布信息提升R包检索效果,构建了面向R的LLM代理以实现更高效的统计分析任务。

Comments 24 pages,7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21668 2026-03-05 cs.AI cs.CL cs.SC 62%

R1-Code-Interpreter: LLMs Reason with Code via Supervised and Multi-stage Reinforcement Learning

R1-Code-Interpreter: LLMs通过监督学习和多阶段强化学习进行代码推理

Yongchao Chen, Yueying Liu, Junwei Zhou, Yilun Hao, Jingquan Wang, Yang Zhang, Na Li, Chuchu Fan

机构 * MIT / Harvard(麻省理工学院/哈佛大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Michigan(密歇根大学) MIT(麻省理工学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Harvard(哈佛大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 R1-Code-Interpreter通过监督学习和多阶段强化学习提升LLM的代码推理能力,实现对多样化任务的高效处理,显著提升模型性能。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18362 2026-03-04 cs.SE cs.CL cs.CV 62%

WAFFLE: Finetuning Multi-Modal Models for Automated Front-End Development

WAFFLE:针对自动化前端开发的多模态模型微调

Shanchao Liang, Nan Jiang, Shangshu Qian, Lin Tan

机构 * Purdue University(普渡大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL

AI总结 WAFFLE通过结构感知注意力机制和对比微调方法,提升多模态模型在UI到HTML代码生成中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01563 2026-03-03 cs.LG cs.AI 62%

LFPO: Likelihood-Free Policy Optimization for Masked Diffusion Models

LFPO:基于掩码扩散模型的似然自由策略优化

Chenxing Wei, Jiazhen Kang, Hong Wang, Jianqing Zhang, Hao Jiang, Xiaolong Xu, Ningyuan Sun, Ying He, F. Richard Yu, Yao Shu, Bo Jiang

机构 * Shenzhen University(深圳大学) Hong Kong University of Science(香港科学大学) Guangdong Laboratory of Artificial Intelligence(广东省人工智能与数字经济实验室) University of Science(科学技术大学) Shanghai Jiao Tong University(上海交通大学) Carleton University(卡尔顿大学) Southeast University(东南大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 LFPO通过似然自由策略优化提升掩码扩散模型的生成质量与推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01089 2026-03-03 cs.CL cs.LG 62%

CARD: Towards Conditional Design of Multi-agent Topological Structures

CARD: 向多智能体拓扑结构的条件设计迈进

Tongtong Wu, Yanming Li, Ziye Tang, Chen Jiang, Linhao Luo, Guilin Qi, Shirui Pan, Gholamreza Haffari

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.LG

AI总结 CARD通过条件图生成框架实现多智能体通信拓扑的动态适应,提升系统在不同环境下的有效性和鲁棒性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19473 2026-03-03 cs.LG cs.AI 62%

WavefrontDiffusion: Dynamic Decoding Schedule for Improved Reasoning

WavefrontDiffusion: 动态解码调度以提升推理性能

Haojin Yang, Rui Hu, Zequn Sun, Rui Zhou, Yujun Cai, Yiwei Wang

机构 * School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) State Key Laboratory for Novel Software Technology, Nanjing University(南京大学软件新技术国家重点实验室) The University of Queensland(昆士兰大学) University of California, Merced(加州大学梅尔德分校)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 WavefrontDiffusion通过动态解码调度提升推理和代码生成的性能与语义连贯性。

Comments 19 pages. 3 figures

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00539 2026-03-03 cs.SE cs.AI 62%

Are LLMs Reliable Code Reviewers? Systematic Overcorrection in Requirement Conformance Judgement

LLMs是否可靠代码审查员?需求符合性判断中的系统性过度纠正

Haolin Jin, Huaming Chen

机构 * University of Sydney(悉尼大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文研究了LLMs在需求符合性判断中的可靠性问题,发现其存在系统性过度纠正现象,并提出Fix-guided Verification Filter以提高代码审查的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00214 2026-03-03 cs.SE cs.AI cs.MS physics.geo-ph 62%

Agentic Scientific Simulation: Execution-Grounded Model Construction and Reconstruction

代理科学模拟:基于执行的模型构建与重建

Knut-Andreas Lie, Olav Møyner, Elling Svee, Jakob Torben

机构 * SINTEF Digital(SINTEF数字研究院) Department of Mathematical Sciences(数学科学系) NTNU(挪威特纳厄大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文提出JutulGPT,通过代理科学模拟实现基于执行的模型构建与重建,解决模拟描述中的歧义问题,并公开所有代码和日志以确保可重现性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24286 2026-03-02 cs.LG cs.AI 62%

CUDA Agent: Large-Scale Agentic RL for High-Performance CUDA Kernel Generation

CUDA Agent: 大规模代理强化学习用于高性能CUDA内核生成

Weinan Dai, Hanlin Wu, Qiying Yu, Huan-ang Gao, Jiahao Li, Chengquan Jiang, Weiqiang Lou, Yufan Song, Hongli Yu, Jiaze Chen, Wei-Ying Ma, Ya-Qin Zhang, Jingjing Liu, Mingxuan Wang, Xin Liu, Hao Zhou

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR)、清华大学) SIA-Lab of Tsinghua AIR(清华大学AIR SIA实验室)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 CUDA Agent通过大规模代理强化学习系统,实现高性能CUDA内核生成,优于现有编译器和大型语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23997 2026-03-02 cs.LG cs.AI 62%

Foundation World Models for Agents that Learn, Verify, and Adapt Reliably Beyond Static Environments

为能够学习、验证和在动态环境中适应的智能体构建基础世界模型

Florent Delgrange

机构 * AI Lab, Vrije Universiteit Brussel \& Flanders Make Brussels Belgium AI Lab, Vrije Universiteit Brussel \& Flanders Make

专题命中 代码生成 :program synthesis(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基础世界模型,通过可学习奖励模型、自适应形式验证、在线抽象校准和测试时合成,使智能体在动态环境中可靠学习、验证和适应。

Comments AAMAS 2026, Blue Sky Idea Track. 4 pages, 1 Figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23407 2026-03-02 cs.CR cs.AI cs.SE 62%

Learning to Generate Secure Code via Token-Level Rewards

通过令牌级奖励学习生成安全代码

Jiazheng Quan, Xiaodong Li, Bin Wang, Guo An, Like Liu, Degen Huang, Lin Liu, Chengbin Hou

机构 * Fuyao University of Science and Technology(福耀科技大学) Xiamen University(厦门大学) Peking University(北京大学) Huawei(华为)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文提出Vul2Safe和SRCode框架,通过令牌级奖励提升代码安全性,有效减少生成代码中的安全漏洞并提高代码质量。

Comments 18 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21189 2026-02-27 cs.LG cs.AI 62%

Why Pass@k Optimization Can Degrade Pass@1: Prompt Interference in LLM Post-training

为何Pass@k优化会损害Pass@1:LLM微调中的提示干扰

Anas Barakat, Souradip Chakraborty, Khushbu Pahwa, Amrit Singh Bedi

机构 * Singapore University of Technology and Design(新加坡科技设计大学) University of Maryland, College Park(马里兰大学学院公园分校) University of Central Florida(佛罗里达中央大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 该研究揭示了在LLM微调中,pass@k优化可能损害pass@1的原因,通过梯度冲突和提示干扰机制,提出了理论解释并验证了实验结果。

Comments updated related work discussion

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00788 2026-02-27 cs.SE cs.AI 62%

Echoes of AI: Investigating the Downstream Effects of AI Assistants on Software Maintainability

AI的回声:探讨AI助手对软件可维护性的影响

Markus Borg, Dave Hewett, Nadim Hagatulah, Noric Couderc, Emma Söderberg, Donald Graham, Uttam Kini, Dave Farley

机构 * CodeScene Equal Experts Continuous Delivery

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本研究探讨AI助手对软件可维护性的影响,发现其在共同开发中未显著提升或降低可维护性,但指出未来需关注代码膨胀和认知债务等潜在风险。

Comments Preprint of study preregistered at ICSME 2025 with In-Principal Acceptance. https://conf.researchr.org/track/icsme-2024/icsme-2024-registered-reports-track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18628 2026-02-24 cs.LG cs.AI 62%

Non-Interfering Weight Fields: Treating Model Parameters as a Continuously Extensible Function

非干扰权重场:将模型参数视为可扩展的连续函数

Sarim Chaudhry

机构 * Purdue University(普渡大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出非干扰权重场(NIWF)框架,通过将模型参数视为可扩展的连续函数,解决大型语言模型中的灾难性遗忘问题,实现能力的版本控制与灵活管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16741 2026-02-20 cs.CR cs.AI cs.LG 62%

Can Adversarial Code Comments Fool AI Security Reviewers -- Large-Scale Empirical Study of Comment-Based Attacks and Defenses Against LLM Code Analysis

对抗性代码注释能否欺骗AI安全审查员 -- 大规模实证研究:基于注释的攻击与防御对抗大语言模型代码分析

Scott Thornton

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了对抗性代码注释对AI安全审查的影响,发现其对漏洞检测无显著影响,静态分析交叉参考效果最佳。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15241 2026-02-18 cs.SE cs.AI 62%

GenAI for Systems: Recurring Challenges and Design Principles from Software to Silicon

生成AI用于系统:从软件到硅片的反复挑战和设计原则

Arya Tschand, Chenyu Wang, Zishen Wan, Andrew Cheng, Ioana Cristescu, Kevin He, Howard Huang, Alexander Ingare, Akseli Kangaslahti, Sara Kangaslahti, Theo Lebryk, Hongjin Lin, Jeffrey Jian Ma, Alexandru Meterez, Clara Mohri, Depen Morwani, Sunny Qin, Roy Rinberg, Paula Rodriguez-Diaz, Alyssa Mia Taliotis, Pernille Undrum Fathi, Rosie Zhao, Todd Zhou, Vijay Janapa Reddi

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文探讨生成AI在计算系统中面临的反复挑战及设计原则,提出跨层视角下的挑战-原则图,强调共享工程方法的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14451 2026-02-17 cs.AI cs.CL 62%

Precedent-Informed Reasoning: Mitigating Overthinking in Large Reasoning Models via Test-Time Precedent Learning

基于先例的推理:通过测试时先例学习缓解大推理模型中的过度思考

Qianyue Wang, Jinwu Hu, Huanxiang Lin, Bolin Chen, Zhiquan Wen, Yaofo Chen, Yu Rong, Mingkui Tan

机构 * South China University of Technology(华南理工大学) Pazhou Laboratory(黄埔实验室) DAMO Academy(达摩院)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 PIR通过测试时先例学习,优化大推理模型的推理过程,减少冗余探索并提升准确率与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13367 2026-02-17 cs.AI cs.CL 62%

Nanbeige4.1-3B: A Small General Model that Reasons, Aligns, and Acts

纳贝格4.1-3B:一个小型通用模型,能够推理、对齐和行动

Chen Yang, Guangyue Peng, Jiaying Zhu, Ran Le, Ruixiang Feng, Tao Zhang, Xiyun Xu, Yang Song, Yiming Jia, Yuntao Wen, Yunzhi Xu, Zekai Wang, Zhenwei An, Zhicong Sun, Zongchao Chen

机构 * Nanbeige LLM Lab(纳贝geist 语言模型实验室)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 Nanbeige4.1-3B是一款小型通用模型,通过结合奖励建模和复杂性感知奖励,实现了强大的推理、代码生成和代理行为,展示了3B参数模型的广泛能力与专业性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15756 2026-02-17 cs.SE cs.AI 62%

Automated Proof Generation for Rust Code via Self-Evolution

通过自我进化实现Rust代码的自动证明生成

Tianyu Chen, Shuai Lu, Shan Lu, Yeyun Gong, Chenyuan Yang, Xuheng Li, Md Rakib Hossain Misu, Hao Yu, Nan Duan, Peng Cheng, Fan Yang, Shuvendu K Lahiri, Tao Xie, Lidong Zhou

机构 * Peking University(北京大学) Microsoft Research(微软研究院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Columbia University(哥伦比亚大学) University of California Irvine(加州大学 Irvine 分校)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 SAFE框架通过自我进化循环和自我调试机制,提升开源模型自动编写Rust代码证明的能力,准确率达52.52%

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07348 2026-02-13 cs.CL cs.AI cs.NE 62%

Controlled Self-Evolution for Algorithmic Code Optimization

算法代码优化的受控自演进

Tu Hu, Ronghao Chen, Shuo Zhang, Jianghao Yin, Mou Xiao Feng, Jingping Liu, Shaolei Zhang, Wenqi Jiang, Yuqi Fang, Sen Hu, Huacan Wang, Yi Xu

机构 * NJU(南京大学) PKU(北京大学) Midea-AIRC(美的人工智能研究院) ECNU(华东师范大学) SYSU(南方科技大学) RUC(中国人民大学) QuantaAlpha(量子Alpha) QuantML(量子机器学习)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 受控自演进通过改进初始化、反馈引导和经验记忆,提升算法代码优化的效率和效果。

Comments 27 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12326 2026-02-12 cs.SE cs.AI 62%

Towards Better Code Understanding in Decoder-Only Models with Contrastive Learning

在解码器-only模型中通过对比学习实现更好的代码理解

Jiayi Lin, Yanlin Wang, Yibiao Yang, Lei Zhang, Yutao Xie

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文提出CL4D框架,通过对比学习提升解码器-only模型的代码表示能力,在代码搜索和克隆检测任务中取得优异性能。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13761 2026-02-11 cs.AI cs.CL 62%

THOR: Tool-Integrated Hierarchical Optimization via RL for Mathematical Reasoning

THOR:通过强化学习进行工具集成的分层优化以实现数学推理

Qikai Chang, Zhenrong Zhang, Pengfei Hu, Jun Du, Jiefeng Ma, Yicheng Pan, Jianshu Zhang, Quan Liu, Jianqing Gao

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Research(iFLYTEK研究院)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 THOR通过强化学习实现工具集成的分层优化,提升数学推理和代码生成能力。

Comments 22 pages, 13 figures, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14313 2026-02-10 cs.LG cs.AI 62%

Your Reward Function for RL is Your Best PRM for Search: Unifying RL and Search-Based TTS

你的强化学习奖励函数是你的最佳搜索PRM:统一强化学习与基于搜索的文本生成

Can Jin, Yang Zhou, Qixin Zhang, Hongwu Peng, Di Zhang, Zihan Dong, Marco Pavone, Ligong Han, Zhang-Wei Hong, Tong Che, Dimitris N. Metaxas

机构 * Rutgers University(新泽西州立大学) Nanyang Technological University(南洋理工大学) University of Connecticut(康涅狄格大学) Fudan University(复旦大学) NVIDIA Research(NVIDIA研究) Red Hat AI Innovation(红帽AI创新) MIT-IBM Watson AI Lab(MIT-IBM沃森AI实验室) Massachusetts Institute of Technology(麻省理工学院)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AIRL-S,通过强化学习与搜索技术的统一,利用奖励函数直接学习动态PRM,提升推理链扩展和跨任务泛化能力,实验显示性能提升9%并优于基线PRM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07080 2026-02-10 cs.SE cs.AI 62%

CodeCircuit: Toward Inferring LLM-Generated Code Correctness via Attribution Graphs

CodeCircuit: 通过归因图推断LLM生成代码的正确性

Yicheng He, Zheng Zhao, Zhou Kaiyu, Bryan Dai, Jie Fu, Yonghui Yang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Edinburgh(爱丁堡大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) IQuest Research(IQuest研究)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 CodeCircuit通过归因图分析LLM内部结构,推断生成代码的正确性,验证内部动态信号的预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21446 2026-02-09 cs.LG cs.AI 62%

dUltra: Ultra-Fast Diffusion Language Models via Reinforcement Learning

dUltra: 通过强化学习实现超快扩散语言模型

Shirui Chen, Jiantao Jiao, Lillian J. Ratliff, Banghua Zhu

机构 * University of Washington(华盛顿大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 dUltra通过端对端强化学习框架实现超快扩散语言模型,提升并行生成效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20406 2026-02-09 cs.AI cs.SE 62%

Skill Discovery for Software Scripting Automation via Offline Simulations with LLMs

通过离线模拟与LLM实现软件脚本自动化中的技能发现

Paiheng Xu, Gang Wu, Xiang Chen, Tong Yu, Chang Xiao, Franck Dernoncourt, Tianyi Zhou, Wei Ai, Viswanathan Swaminathan

机构 * University of Maryland, College Park(马里兰大学College Park分校) Adobe Research(Adobe研究院)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文提出了一种利用离线模拟与LLM构建软件特定技能集的方法,通过生成和验证脚本提升自动化效率,减少运行时成本。

Comments Findings of the Association for Computational Linguistics: EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05780 2026-02-06 cs.SE cs.AI 62%

Automated Customization of LLMs for Enterprise Code Repositories Using Semantic Scopes

基于语义范围的LLM企业代码仓库自动化定制

Ulrich Finkler, Irene Manotas, Wei Zhang, Geert Janssen, Octavian Popescu, Shyam Ramji

机构 * IBM Research Yorktown Heights New York, USA(IBM研究院扬斯敦高地新 York 美国)

专题命中 代码生成 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文提出基于语义范围的LLM企业代码仓库自动化定制方法,通过RAG和FT策略提升代码生成精度,提高开发者生产力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05712 2026-02-06 cs.SE cs.AI 62%

Towards Green AI: Decoding the Energy of LLM Inference in Software Development

迈向绿色AI:解码LLM推理中的能耗在软件开发中

Lola Solovyeva, Fernando Castor

机构 * University of Twente(特文特大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本研究分析了LLM推理能耗,发现prefill阶段影响解码能耗,通过抑制babbling行为可实现高达89%的能耗节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00166 2026-02-06 cs.LG cs.AI 62%

Joint Continual Learning of Local Language Models and Cloud Offloading Decisions with Budget Constraints

带有预算约束的本地语言模型与云卸载决策的联合持续学习

Evan Chen, Wenzhi Fang, Shiqiang Wang, Christopher Brinton

机构 * Elmore Family School of Electrical and Computer Engineering, Purdue University, West Lafayette, IN(电子与计算机工程学院,普渡大学) Department of Computer Science, University of Exeter, UK(计算机科学系,埃克塞特大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DA-GRPO方法,通过联合学习本地语言模型和云卸载决策,有效解决持续学习中的预算约束问题,提升任务准确性并减少遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04380 2026-02-05 cs.LG cs.AI 62%

Beyond KL Divergence: Policy Optimization with Flexible Bregman Divergences for LLM Reasoning

超越KL散度:基于灵活Bregman散度的群体策略优化用于大语言模型推理

Rui Yuan, Mykola Khandoga, Vinay Kumar Sankarapu

机构 * Lexsi Labs(Lexsi实验室)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GBMPO框架,通过灵活Bregman散度提升大语言模型在数学推理和代码生成任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏