Copper: Unifying Correctness and Performance Specification in Code Generation
Copper:统一代码生成中的正确性和性能规范
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 研究如何在代码生成中兼顾正确性与性能,核心方法是结合形式验证与性能感知规范,主要贡献是生成的代码可证明正确且高效执行,缩小了AI辅助编程中可信度和性能的差距。
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
Copper:统一代码生成中的正确性和性能规范
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 研究如何在代码生成中兼顾正确性与性能,核心方法是结合形式验证与性能感知规范,主要贡献是生成的代码可证明正确且高效执行,缩小了AI辅助编程中可信度和性能的差距。
BeSpec:用于代码生成的行为级规范对齐
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 研究针对代码生成中规范不匹配问题,提出基于行为模型的BeSpec方法,通过构建行为模型、生成候选程序并对比行为来对齐规范,在多基准测试中效果优于基线。
ClarifyCodeBench: 评估大语言模型在代码生成中澄清模糊需求的能力
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 提出ClarifyCodeBench基准,通过人工标注的模糊需求、澄清问题和指标,评估LLMs主动澄清需求的能力,发现代码生成能力与需求澄清能力脱钩,且多模糊场景下性能下降。
AxDafny: Dafny中的智能验证代码生成
机构 * Axiomatic AI, Boston, MA, USA(Axiomatic AI,波士顿,马萨诸塞州,美国)
专题命中 代码生成 :code generation(title,abstract);分类 cs.AI
AI总结 提出AxDafny框架,通过验证器引导的修复迭代生成Dafny代码和证明,在LCB-Pro-Dafny和DafnyBench上显著提升验证成功率。
面向竞争性代码生成的迭代测试与修复框架
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 FixAudit通过迭代测试与修复循环改进代码生成,通过共享模型和专门角色联合训练,提升代码质量与测试覆盖率。
ZeroCoder:无需真实监督,大语言模型能否提升代码生成?
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 ZeroCoder通过协同进化代码与测试生成,无需真实监督提升代码生成。该方法利用自动生成的代码-测试交互反馈,通过动态调整选择器优先级,提升测试生成质量与代码生成性能。
令人惊讶的简单自蒸馏方法提升代码生成能力
机构 * Apple(苹果公司)
专题命中 代码生成 :code generation(title,abstract);分类 cs.CL
AI总结 提出简单自蒸馏(SSD)方法,仅利用模型自身输出进行微调,无需验证器或强化学习,显著提升代码生成性能,并揭示其通过重塑token分布解决精度-探索冲突的机制。
HardSecBench: 对大型语言模型在硬件代码生成中的安全意识的基准测试
机构 * University of Science and Technology of China(中国科学技术大学) ; Xi’an Jiaotong University(西安交通大学) ; Nanjing University(南京大学) ; ZTE Corporation(中兴通讯)
专题命中 代码生成 :code generation(title,abstract);分类 cs.AI
AI总结 提出HardSecBench基准,包含924个任务覆盖Verilog RTL和固件C代码,评估LLM在硬件代码生成中的安全性,发现模型常满足功能需求但存在安全风险。
无资源、无基准、无问题?评估和改进无资源语言的代码生成大语言模型
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 研究无资源语言(LLM未见训练数据的语言)的代码生成问题,通过构建三个基准并实验提示技术、预训练和微调方法,提出权重差异迁移方法提升性能。
Comments Accepted for publication at IEEE Transactions on Software Engineering
SPARK: 基于安全知识引导与表示激活的LLM安全代码生成
机构 * Radboud University(拉德堡德大学) ; University of Bristol(布里斯托大学) ; University of Zagreb(扎格雷布大学)
专题命中 代码生成 :code generation(title,abstract);分类 cs.AI
AI总结 提出SPARK方法,通过检索CWE条目并添加结构化提示激活模型内隐安全知识,结合预计算令牌偏置,无需重训练即可提升代码安全性。
EstRTL:功能估计引导的RTL代码生成
机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) ; Defense Innovation Institute, Academy of Military Science (AMS)(军事科学院创新院) ; School of Computer Science and Technology, Shandong University(山东大学计算机科学与技术学院) ; Key Laboratory of Advanced Microprocessor Chips and Systems, Changsha, China, and College of Computer Science and Technology, National University of Defense Technology, Changsha, China(先进微处理器芯片与系统重点实验室,长沙,中国,和国防科技大学计算机科学与技术学院,长沙,中国) ; Defense Innovation Institute, AMS, Beijing, China and Qiyuan Lab, Beijing, China(军事科学院创新院,北京,中国和启元实验室,北京,中国)
专题命中 代码生成 :code generation(title,abstract);分类 cs.AI
AI总结 提出EstRTL框架,通过静态功能评分估计,结合生成、评估和修正三阶段范式,提升LLM生成RTL代码的功能正确性,在通用LLM上正确率提升3.2%-9.0%。
SkelDPO: 一种骨架引导的直接偏好优化框架用于高效代码生成
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 提出SkelDPO框架,通过骨架引导的偏好优化,在代码生成中同时优化语义正确性和执行效率,相比现有方法在Pass@1、Beyond@1和Effi@1上提升3-7%。
剔除低效:用于高效代码生成的结构骨架监督
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 本文提出EffiSkel框架,通过提取和学习效率骨架,提升代码生成的效率与正确性,实验显示在多个编程语言和基准上均取得显著提升。
通过输入二值化弥合半导体视觉程序合成中的仿真到现实差距
机构 * National Institute of Information and Communications Technology, Japan(日本信息通信技术全国研究所)
专题命中 代码生成 :program synthesis(title,abstract);分类 cs.AI
AI总结 提出一种视觉程序合成框架,利用输入二值化策略消除扫描电子显微镜图像的纹理和噪声,使视觉语言模型专注于几何结构,从而弥合仿真到现实的差距,在MIIC数据集上将平均Dice系数从0.4393提升至0.5256。
编码智能体作为世界模拟器
机构 * Department of Mechanical & Aerospace Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校机械与航空航天工程系) ; School of Computer, Data, and Information Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机、数据与信息科学学院)
专题命中 代码生成 :coding agent(title);code generation(abstract);分类 cs.AI
AI总结 提出一个通过可执行模拟代码构建基于物理的世界模型的智能体框架,协调规划、代码生成、视觉审查和物理分析智能体,迭代修正代码以满足物理约束,在物理准确性、指令忠实度和视觉质量上超越视频模型。
基于离线强化学习的代码生成LLM高效后训练
机构 * Hessian Center for Artificial Intelligence(海德堡人工智能中心) ; National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE)
专题命中 代码生成 :code generation(title,abstract);分类 cs.AI
AI总结 本文探索使用离线强化学习利用现有代码数据集对代码生成LLM进行后训练,实验表明该方法能有效提升模型性能,尤其适用于小模型和复杂编码问题。
CoRe-Code:面向代码生成的协作式强化学习
机构 * The Ohio State University(俄亥俄州立大学) ; Royal Melbourne Institute of Technology(皇家墨尔本理工学院)
专题命中 代码生成 :code generation(title,abstract);分类 cs.AI
AI总结 提出CoRe-Code框架,通过规划器-编码器范式和基于GRPO的协作感知强化学习,增强多智能体间的协调与专业化,提升代码生成的准确性和效率。
通过分离逻辑的正确性构建G代码生成:一种神经符号方法
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 本文提出了一种神经符号框架,通过分离逻辑证明器将GLLM方法的神经生成能力与形式验证相结合,利用几何数据构建两组件架构,将物理碰撞转化为逻辑空间数据 race,从而生成自我校正的G代码生成系统,减少人工监督,提高自主制造的安全性和验证性。
Comments 15 pages, 5 figures
通过强化学习优化LLM代码生成的提示
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 本文提出了一种基于强化学习的框架,通过将提示优化视为序列决策问题,利用PPO代理结合直接生成、遗传词法突变和语义重写动作空间,指导由单元测试反馈获得的形状奖励,从而提升LLM代码生成的准确性。
MultiMat: 多模态程序合成用于基于过程的材料生成
机构 * University of Mannheim(曼海姆大学) ; Adobe Research(Adobe研究)
专题命中 代码生成 :program synthesis(title,abstract);分类 cs.CL
AI总结 MultiMat利用大规模多模态模型实现多模态程序合成,提升生成过程材料图的效率与视觉质量,优于纯文本基线方法。
Comments Accepted at ICLR 2026 (poster)
通过测试生成探测基于LLM的代码生成中的隐私泄露
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 本文提出一种模拟实际隐私相关代码生成场景的管道,采用测试驱动策略提取生成测试用例中的记忆信息,通过自动构建隐私特征库提高隐私泄露检测效果,实验表明检测到的隐私泄露增加2.56倍。
Comments Preprint
Vision2Code:一个多领域评估图像到代码生成的基准
机构 * Duke University(杜克大学)
专题命中 代码生成 :code generation(title,abstract);分类 cs.LG
AI总结 Vision2Code提出一个无需参考代码的多领域图像到代码生成评估框架,通过2169个测试示例评估模型生成代码的质量,发现性能依赖于领域,且通过筛选器的模型输出可提升生成能力。
Comments Project page: https://image2code.github.io/vision2code/
利用语义距离估计基于大语言模型的代码生成的不确定性
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 本文提出基于语义距离的不确定性估计方法,通过衡量生成程序执行行为的差异性,提升代码生成的正确性评估效果,在多个基准测试中优于现有方法。
Comments Preprint. 23 pages, 4 figures
评估、利用和缓解基于LLM的代码生成中的语法鲁棒性故障
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 研究评估LLM在代码生成中语法鲁棒性,发现其在包含数学公式的提示下存在缺陷,提出预处理步骤提升鲁棒性,使鲁棒性从54.05%提升至74.42%。
Comments 12 pages, 12 figures. Attack strategies and more experimental evaluation is added. Result and big picture remains the same
Journal ref In Proceedings of the 2026 IEEE/ACM Third International Conference on AI Foundation Models and Software Engineering (FORGE'26), April 12-13, 2026, Rio de Janeiro, Brazil. ACM, New York, NY, USA, 12 pages
基于可证明预算保守的检索条件拓扑选择多智能体代码生成
机构 * Independent Researcher(独立研究者)
专题命中 代码生成 :code generation(title,abstract);分类 cs.AI
AI总结 本文提出RGAO架构,通过提取代码结构复杂度向量实现多智能体代码生成系统的拓扑选择,结合复杂度条件LLM路由与形式资源代数,实现可证明的预算保守性,降低误路由率并提升代码检索效率。
Comments 30 pages, 9 figures. NeurIPS 2026 Evaluations and Datasets Track Submission Under review
GA-VisAgent:一种用于交互式学习中代码生成和可视化的多智能体应用
机构 * School of Geography, Nanjing Normal University, Nanjing 210023, Jiangsu, China(地理学院,南京师范大学) ; School of Environment, Nanjing Normal University, Nanjing 210023, Jiangsu, China(环境学院,南京师范大学) ; Key Laboratory of Virtual Geographic Environment, Ministry of Education, Nanjing Normal University, Nanjing 210023, Jiangsu, China(虚拟地理环境重点实验室,南京师范大学) ; Jiangsu Center for Collaborative Innovation in Geographical Information Resource Development(江苏省地理信息资源开发与应用协同创新中心)
专题命中 代码生成 :code generation(title,abstract);分类 cs.LG
AI总结 GA-VisAgent基于GAGPT提出多智能体应用,通过任务规划和ReAct策略生成代码并提供可视化,实验显示在40个典型Conformal GA任务中代码生成成功率达90%,比GPT-4o提升70%。
当提示不足提升代码正确性:对提示语言和结构影响LLM代码生成的探索性研究
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 研究探讨提示结构、任务复杂度和说明丰富度如何影响LLM的鲁棒性,发现提示不足在某些情况下能提升代码正确性,且结构丰富任务描述可缓解提示不足的负面影响。
HiRAS:一种用于论文到代码生成与执行的分层多智能体框架
机构 * The University of Manchester(曼彻斯特大学) ; Institute for Infocomm Research (I²R), A*STAR(信息与通信研究所(I²R),A*STAR) ; ELLIS Manchester(曼彻斯特ELLIS) ; Singapore University of Technology and Design(新加坡科技设计大学)
专题命中 代码生成 :code generation(title);repository(abstract);分类 cs.CL
AI总结 本文提出HiRAS,一种分层多智能体框架,通过监督管理智能体协调专业智能体完成端到端实验复现,改进了Paper2Code基准的评估方法,并验证了方法的有效性和鲁棒性。
Comments 29 pages
TreeCoder: 对LLM代码生成解码与约束的系统探索与优化
机构 * University of Bristol(布里斯托大学)
专题命中 代码生成 :code generation(title,abstract);分类 cs.LG
AI总结 TreeCoder通过系统探索和优化解码策略与约束,提升LLM代码生成的准确性和结构,实验表明其在多个开源模型上显著优于无约束基线。
Comments 30 pages, 9 figures, 13 tables
AdaDec: 一种基于不确定性的前瞻性解码框架用于基于大语言模型的代码生成
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 本文提出AdaDec框架,通过结合token级暂停再排序机制,提升LLM代码生成的可靠性和效率,实验表明其在HumanEval+等基准上显著优于传统解码方法。
Comments 23 pages, 7 figures, FSE 2026