Prompt Optimization for LLM Code Generation via Reinforcement Learning
通过强化学习优化LLM代码生成的提示
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 本文提出了一种基于强化学习的框架,通过将提示优化视为序列决策问题,利用PPO代理结合直接生成、遗传词法突变和语义重写动作空间,指导由单元测试反馈获得的形状奖励,从而提升LLM代码生成的准确性。
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
通过强化学习优化LLM代码生成的提示
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 本文提出了一种基于强化学习的框架,通过将提示优化视为序列决策问题,利用PPO代理结合直接生成、遗传词法突变和语义重写动作空间,指导由单元测试反馈获得的形状奖励,从而提升LLM代码生成的准确性。
HELLoRA: Hot Experts Layer-Level Low-Rank Adaptation for Mixture-of-Experts Models
机构 * Department of Computer Science and Technlogy(计算机科学与技术系) ; Tsinghua University(清华大学) ; School of Computer Science and Technlogy(计算机科学与技术系) ; Xi’an Jiaotong University(西安交通大学) ; The State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) ; Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高科技区(滨江)区块链与数据安全研究院)
专题命中 代码生成 :code generation(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本文提出HELLoRA,一种针对混合专家模型的层级低秩适应方法,通过仅对最活跃的专家添加LoRA模块,减少可训练参数和计算量,同时提升下游任务性能。
基于协议的开发:通过不变式和连续证据治理生成的软件
专题命中 代码生成 :program synthesis(abstract);分类 cs.SE、cs.AI、cs.LG
AI总结 本文提出了一种基于协议的开发方法,通过定义协议的不变式和连续证据来治理生成的软件,其核心贡献是将协议作为主要软件 artifact,而非代码,从而实现对生成软件的持续验证和治理。
Comments 20 pages, 2 tables
学习率至关重要:Vanilla LoRA可能足以用于LLM微调
机构 * National Taiwan University(国立台湾大学) ; IBM Research(IBM研究院) ; Academia Sinica(台湾“学术院”)
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过广泛的超参数搜索重新评估了九种代表性的LoRA变体和Vanilla LoRA,在数学推理、常识推理、代码生成和指令遵循等任务上,发现不同的LoRA方法偏好不同的学习率范围。当学习率正确调整时,所有方法都能达到相似的峰值性能,这表明Vanilla LoRA仍然是一个有竞争力的基线,而单一训练配置下的改进可能并不反映一致的方法优势。
Comments Project page: https://github.com/yuang-lee/lr-matters-lora
CADDesigner: 一种通用智能体的概念CAD模型生成
机构 * Zhejiang University(浙江大学)
专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI
AI总结 本文提出CADDesigner,一种基于LLM的智能体,通过文本描述和草图输入,结合交互对话进行需求分析,生成高质量CAD模型代码,并通过迭代视觉反馈提升模型质量,实验表明其在概念CAD模型生成任务中表现优异。
LLM生成代码中的库幻觉:基于开发者查询的风险分析
机构 * King’s College London(伦敦国王学院) ; University College London(伦敦大学学院)
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL
AI总结 本文研究了LLM生成代码中库幻觉的风险,通过分析用户提示变化对库幻觉的影响,揭示了系统性漏洞,并提出了LibHalluBench基准测试以评估这些幻觉。
Comments 27 pages, 1 figure, 13 tables
LLMs能否产生比人类参与开发更好的面向对象设计?
专题命中 代码生成 :code generation(abstract);分类 cs.SE
AI总结 本文研究了LLMs在生成面向对象设计(OOD)项目时的表现,通过比较预AI、后AI和纯AI三种作者条件下的项目质量,发现纯AI项目在代码异味密度和整体复杂度上较低,但存在过度简化的问题,结论指出在使用LLMs进行面向对象设计时,适当的人类指导仍很重要。
CodePori:利用多智能体技术实现大规模自主软件开发的系统
专题命中 代码生成 :code generation(abstract);分类 cs.SE
AI总结 本文研究了基于大语言模型的多智能体系统在自主软件开发中的潜力与局限,通过开发CodePori系统和参与式评估,揭示了LLM多智能体系统的优势、挑战及改进方向。
Comments 18 pages, 8 figures, and 4 Table
学习何时适应
机构 * Universität des Saarlandes(萨尔布吕肯大学) ; CISPA Helmholtz Center for Information Security(信息安全研究中心)
专题命中 代码生成 :code generation(abstract);分类 cs.LG
AI总结 本文提出DISeL,一种动态输入敏感的低秩适应方法,通过引入轻量级输入依赖门控机制,减少遗忘并保持微调准确性,同时提供可解释的诊断视图。
Comments Preprint
通过变分策略蒸馏学习语言反馈
机构 * Salesforce AI Research(Salesforce人工智能研究)
专题命中 代码生成 :code generation(abstract);分类 cs.LG
AI总结 本文提出变分策略蒸馏(VPD),通过将学习语言反馈形式化为变分期望最大化问题,解决传统自蒸馏方法中教师策略能力停滞的问题,从而在科学推理和代码生成任务中优于标准RLVR和现有自蒸馏基线。
无损反蒸馏采样
机构 * Peking University(北京大学) ; Tsinghua University(清华大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 代码生成 :code generation(abstract);分类 cs.LG
AI总结 本文提出了一种无损反蒸馏采样方法,通过在保持良性用户体验的同时,有效对抗多账号蒸馏攻击,降低蒸馏模型的泛化能力。
从意图到AI流水线:一种受领域驱动的可控代理框架,用于非AI专家科学家
机构 * University of Montreal(蒙特利尔大学) ; McGill University(麦吉尔大学)
专题命中 代码生成 :code generation(abstract);分类 cs.AI
AI总结 本文提出DDAP框架,通过分阶段交互帮助非AI专家科学家系统构建AI流水线及其实现代码,展示了可控代理框架在生成竞争性AI流水线方面的有效性。
在可实现性假设下利用超位置的合成完备性
专题命中 代码生成 :program synthesis(abstract)
AI总结 本文研究了在可实现性假设下利用超位置进行程序合成的完备性问题,通过改进超位置演算并证明其正确性和完备性,确保能够找到满足规范的可计算程序。
Comments to be published in IJCAR 2026
代码整洁性影响编码代理吗?一项受控的最小对研究
机构 * SonarSource
专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI
AI总结 本研究探讨了代码整洁性对编码代理性能的影响,通过构建结构和风格相似但整洁度不同的代码库对,发现整洁性不影响通过率,但显著降低计算成本和文件重复访问。
进化编码代理进化什么?
机构 * Zuse Institute Berlin(柏林Zuse研究所) ; Technical University of Berlin(柏林技术大学) ; Hong Kong Baptist University(香港 Baptist大学) ; RIKEN Center for Advanced Intelligence Project(RIKEN高级智能项目中心)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI、cs.LG
AI总结 本文研究了进化编码代理在数学发现和算法设计中通过任务特定反馈生成、修改和选择代码的过程,通过EvoTrace数据集和EvoReplay方法分析了进化过程中的机制,发现大部分得分提升来自少数几种编辑类型,并发现存在确定性的循环模式。
Comments 28 pages, 12 figures, 12 tables
评估用于数据驱动科学发现的编码代理的记忆压缩策略
机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室) ; National Laboratory of the Rockies(落基山国家实验室)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.LG
AI总结 本文评估了八种记忆压缩策略在数据驱动科学发现任务中的表现,发现没有压缩器显著提升假设质量,但基于LLM的压缩器会增加24-94%的token成本,而屏蔽工具调用输出可实现8.6%的净节省,且最佳压缩器因科学领域和任务长度而异。
PEEK:上下文地图作为长上下文LLM代理的导向缓存
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; Stanford University(斯坦福大学)
专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出PEEK系统,通过上下文地图缓存和维护导向知识,提升长上下文LLM代理在重复外部上下文中的交互准确性和效率,相比基线方法在推理和上下文学习任务中均取得显著提升。
RoadmapBench: 评估跨版本升级的长期代理软件开发
机构 * UniPat AI ; Peking University(北京大学) ; Fudan University(复旦大学) ; The University of Hong Kong(香港大学) ; Tsinghua University(清华大学) ; G Labs(0G实验室) ; Pipeline Lab(Pipeline实验室)
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI
AI总结 本文提出RoadmapBench,一个基于真实开源版本升级的115个长期编码任务的基准,旨在评估长期多目标软件开发,发现现有基准无法有效评估此类任务,表明长期软件开发仍是难题。
Comments 30 pages, 15 figures
何时回答,何时延迟:一种可靠代码预测的决策框架
专题命中 测试生成 :code model(abstract);分类 cs.SE
AI总结 本文提出了一种决策框架,用于在代码预测中可靠地判断何时回答何时延迟,通过整合不确定性估计、模型校准和工具基于的延迟处理,提高代码模型的可靠性。
Comments In Proceedings of the 48th IEEE/ACM International Conference on Software Engineering- New Idea and Emerging Results Track (ICSE-NIER 2026)
1GC-7RC:一张图形卡——七个研究挑战!AI代理在做你的工作方面有多好?
专题命中 代码评测 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出1GC-7RC基准测试,通过七个跨领域机器学习任务评估AI代理在从头设计、实现和训练模型的能力,揭示了不同代理在隐式机器学习知识、规划能力和时间预算管理方面的差异。
PRISM:一个程序化空间-时间推理的基准测试
机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)
专题命中 代码评测 :code generation(abstract);分类 cs.AI
AI总结 本文提出PRISM基准测试,通过大规模人类校准的指令-代码对(共10,372个,比之前基准大20倍),评估语言模型生成空间正确动画输出的能力,并揭示执行成功率与空间正确率之间的显著差距。
SLEIGHT-Bench: 一种针对代理监控的对抗攻击基准
机构 * Anthropic Fellows Program(Anthropic Fellow计划) ; University of Waterloo(多伦多大学) ; Redwood Research(Redwood研究) ; Anthropic
专题命中 代码评测 :coding agent(abstract);分类 cs.AI
AI总结 本文提出SLEIGHT-Bench基准,用于评估代理监控对多种攻击策略的防御能力,发现20种攻击在Opus 4.6监控下未被检测到,同时识别了多种规避策略并展示了监控性能的提升。
HSCO-Bench: 一种由智能体驱动的端到端硬件软件协同设计基准,用于片上系统
专题命中 代码评测 :repository(abstract)
AI总结 本文提出HSCO-Bench,一个用于评估大型语言模型在端到端硬件软件协同设计能力的基准,通过评估LLM在资源约束下生成高效SoC原型的能力,揭示了当前模型在硬件加速方面的不足。
RoboJailBench: 对具身体验机器人代理中对抗攻击和防御的基准测试
机构 * Purdue University(普渡大学)
专题命中 代码评测 :repository(abstract)
AI总结 本文提出RoboJailBench,通过建立安全分类学、引入意图对比数据集管道以及提供一个演进的存储库,为具身体验人工智能中的对抗攻击和防御提供了标准化评估框架,同时构建了一个新的分类平衡数据集并增强了五个现有数据集。
高精度激发能数据库QUEST
专题命中 仓库级理解 :repository(abstract,comments)
AI总结 本文介绍了QUEST数据库,该数据库提供了大量激发态和分子的垂直跃迁能的理论最佳估计,包含多种参考基组的计算结果,并评估了各种单参考和多参考波函数方法的性能。
Comments 28 pages, 7 figures (Supporting Information available). For associated git repository, see https://github.com/pfloos/QUESTDB
Journal ref J. Chem. Theory Comput. 21, 8010 (2025)
在AI基础设施中寻找漏洞变体:测量与参考驱动的检测
专题命中 仓库级理解 :repository(abstract)
AI总结 本文研究了AI基础设施中漏洞变体的测量与参考驱动检测,通过分析688个GitHub仓库和251个公开披露的漏洞,发现AI基础设施项目经常共享重叠功能和重复的漏洞模式,提出了基于参考的多智能体框架INFRASCOPE,用于自动识别和验证新的漏洞变体。
Comments 19 pages
通过反交换自同构分解SU(2^n)
专题命中 仓库级理解 :repository(abstract)
AI总结 本文提出了一种新的算法,用于分解SU(2^n)中的酉矩阵,克服了原有方法中依赖于不明确的矩阵对数和截断BCH级数收敛问题的限制,利用反交换自同构的代数结构和对称李代数分解,实现了稳定且递归的因子分解过程。
Comments 17 pages, 7 figures To appear in Pure and Applied Mathematics Quarterly (2025)
通过QGP视角审视质子中的熵
专题命中 仓库级理解 :repository(abstract)
AI总结 研究量子色液(QGP)热力学(Gibbs)熵与受限强子态量子纠缠熵在夸克-强子相变中的相互作用,揭示纠缠熵如何作为热力学熵的存储库,从而在热力学第二定律下解释宏观熵的减少。
Comments 10 pages
递归-代数解闭弦超光子真空方程
专题命中 仓库级理解 :repository(abstract)
AI总结 本文提出了一种递归代数框架来求解闭弦超光子真空方程,通过限制零动量洛伦兹标量状态的领域,利用洛伦兹对称性确保该领域在运动方程下封闭,并引入缝级展开,证明在每级展开中方程完全代数化,仅需在系统长度上进行点评估,每级展开仅需矩阵求逆,无需弗雷德霍姆方程。
Comments v3: typos fixed, numerical errors fixed