Prompt Optimization for LLM Code Generation via Reinforcement Learning
通过强化学习优化LLM代码生成的提示
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 本文提出了一种基于强化学习的框架,通过将提示优化视为序列决策问题,利用PPO代理结合直接生成、遗传词法突变和语义重写动作空间,指导由单元测试反馈获得的形状奖励,从而提升LLM代码生成的准确性。
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
通过强化学习优化LLM代码生成的提示
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 本文提出了一种基于强化学习的框架,通过将提示优化视为序列决策问题,利用PPO代理结合直接生成、遗传词法突变和语义重写动作空间,指导由单元测试反馈获得的形状奖励,从而提升LLM代码生成的准确性。
HELLoRA: Hot Experts Layer-Level Low-Rank Adaptation for Mixture-of-Experts Models
机构 * Department of Computer Science and Technlogy(计算机科学与技术系) ; Tsinghua University(清华大学) ; School of Computer Science and Technlogy(计算机科学与技术系) ; Xi’an Jiaotong University(西安交通大学) ; The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) ; Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高科技区(滨江)区块链与数据安全研究院)
专题命中 代码生成 :code generation(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本文提出HELLoRA,一种针对混合专家模型的层级低秩适应方法,通过仅对最活跃的专家添加LoRA模块,减少可训练参数和计算量,同时提升下游任务性能。
基于协议的开发:通过不变式和连续证据治理生成的软件
专题命中 代码生成 :program synthesis(abstract);分类 cs.SE、cs.AI、cs.LG
AI总结 本文提出了一种基于协议的开发方法,通过定义协议的不变式和连续证据来治理生成的软件,其核心贡献是将协议作为主要软件 artifact,而非代码,从而实现对生成软件的持续验证和治理。
Comments 20 pages, 2 tables
学习率至关重要:Vanilla LoRA可能足以用于LLM微调
机构 * National Taiwan University(国立台湾大学) ; IBM Research(IBM研究院) ; Academia Sinica(台湾“学术院”)
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过广泛的超参数搜索重新评估了九种代表性的LoRA变体和Vanilla LoRA,在数学推理、常识推理、代码生成和指令遵循等任务上,发现不同的LoRA方法偏好不同的学习率范围。当学习率正确调整时,所有方法都能达到相似的峰值性能,这表明Vanilla LoRA仍然是一个有竞争力的基线,而单一训练配置下的改进可能并不反映一致的方法优势。
Comments Project page: https://github.com/yuang-lee/lr-matters-lora
CADDesigner: 一种通用智能体的概念CAD模型生成
机构 * Zhejiang University(浙江大学)
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI
AI总结 本文提出CADDesigner,一种基于LLM的智能体,通过文本描述和草图输入,结合交互对话进行需求分析,生成高质量CAD模型代码,并通过迭代视觉反馈提升模型质量,实验表明其在概念CAD模型生成任务中表现优异。
LLM生成代码中的库幻觉:基于开发者查询的风险分析
机构 * King’s College London(伦敦国王学院) ; University College London(伦敦大学学院)
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL
AI总结 本文研究了LLM生成代码中库幻觉的风险,通过分析用户提示变化对库幻觉的影响,揭示了系统性漏洞,并提出了LibHalluBench基准测试以评估这些幻觉。
Comments 27 pages, 1 figure, 13 tables
LLMs能否产生比人类参与开发更好的面向对象设计?
专题命中 代码生成 :code generation(abstract);分类 cs.SE
AI总结 本文研究了LLMs在生成面向对象设计(OOD)项目时的表现,通过比较预AI、后AI和纯AI三种作者条件下的项目质量,发现纯AI项目在代码异味密度和整体复杂度上较低,但存在过度简化的问题,结论指出在使用LLMs进行面向对象设计时,适当的人类指导仍很重要。
CodePori:利用多智能体技术实现大规模自主软件开发的系统
专题命中 代码生成 :code generation(abstract);分类 cs.SE
AI总结 本文研究了基于大语言模型的多智能体系统在自主软件开发中的潜力与局限,通过开发CodePori系统和参与式评估,揭示了LLM多智能体系统的优势、挑战及改进方向。
Comments 18 pages, 8 figures, and 4 Table
学习何时适应
机构 * Universität des Saarlandes(萨尔布吕肯大学) ; CISPA Helmholtz Center for Information Security(信息安全研究中心)
专题命中 代码生成 :code generation(abstract);分类 cs.LG
AI总结 本文提出DISeL,一种动态输入敏感的低秩适应方法,通过引入轻量级输入依赖门控机制,减少遗忘并保持微调准确性,同时提供可解释的诊断视图。
Comments Preprint
通过变分策略蒸馏学习语言反馈
机构 * Salesforce AI Research(Salesforce人工智能研究)
专题命中 代码生成 :code generation(abstract);分类 cs.LG
AI总结 本文提出变分策略蒸馏(VPD),通过将学习语言反馈形式化为变分期望最大化问题,解决传统自蒸馏方法中教师策略能力停滞的问题,从而在科学推理和代码生成任务中优于标准RLVR和现有自蒸馏基线。
无损反蒸馏采样
机构 * Peking University(北京大学) ; Tsinghua University(清华大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 代码生成 :code generation(abstract);分类 cs.LG
AI总结 本文提出了一种无损反蒸馏采样方法,通过在保持良性用户体验的同时,有效对抗多账号蒸馏攻击,降低蒸馏模型的泛化能力。
从意图到AI流水线:一种受领域驱动的可控代理框架,用于非AI专家科学家
机构 * University of Montreal(蒙特利尔大学) ; McGill University(麦吉尔大学)
专题命中 代码生成 :code generation(abstract);分类 cs.AI
AI总结 本文提出DDAP框架,通过分阶段交互帮助非AI专家科学家系统构建AI流水线及其实现代码,展示了可控代理框架在生成竞争性AI流水线方面的有效性。
在可实现性假设下利用超位置的合成完备性
专题命中 代码生成 :program synthesis(abstract)
AI总结 本文研究了在可实现性假设下利用超位置进行程序合成的完备性问题,通过改进超位置演算并证明其正确性和完备性,确保能够找到满足规范的可计算程序。
Comments to be published in IJCAR 2026