A Case for Dynamic Reverse-code Generation to Debug Non-deterministic Programs
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.PL
Comments In Proceedings Festschrift for Dave Schmidt, arXiv:1309.4557
Journal ref EPTCS 129, 2013, pp. 419-428
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.PL
Comments In Proceedings Festschrift for Dave Schmidt, arXiv:1309.4557
Journal ref EPTCS 129, 2013, pp. 419-428
专题命中 代码生成 :program synthesis(title,abstract);分类 cs.LG、cs.PL
AuditCoder:用于可审计代码生成与有界修复的责任保留任务图
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE;repository(comments)
AI总结 AuditCoder通过带契约注释的任务图为代码生成保留责任标识,结合保守定位器与有界修复,在APPS、ClassEval数据集上取得优于CoT+重试的可审计代码生成效果。
Comments Preprint. 37 pages, 5 figures. Code and data are available at the project repository
专题命中 代码生成 :program synthesis(title,abstract);分类 cs.LG;repository(comments)
Comments There was a typo in Figure 1 (a step in the Lemma solution was accidentally included twice). Additionally, our final experiment runs have MathDSL using one less step for this question, and ConPoLe using one more step to differentiate a division and a fraction in its final solution. Figure 1 has been updated to provide an exact copy of the experiment runs in the GitHub repository
SimuScene: 通过训练和基准测试代码生成来模拟物理场景
专题命中 代码生成 :code generation(title,abstract);分类 cs.LG
AI总结 SimuScene通过训练和基准测试代码生成模型,旨在提高模拟物理场景的能力,实验显示即使最强模型也仅达21.5%的通过率,表明该任务具有挑战性。
GraphAlignCoder:对齐程序与证明图的代码生成框架
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 GraphAlignCoder是将显式正确性结构迁移至代码生成的训练框架,通过对齐程序与证明图提升性能,在多个基准测试中优于现有方法,验证图注入与验证到代码的整合是关键。
Comments 9 pages, 3 figures
安全测试作为LLM代码生成的可执行规范:益处、权衡与覆盖范围限制
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 该研究提出将安全测试作为LLM代码生成的可执行规范,开发SecTDD框架,通过多维度评估发现预先展示可见测试可提升联合成功率,结构化反馈修复效果更优但益处受多因素影响。
BashCoder-R1: 面向鲁棒且可解释的Bash代码生成——鲁棒感知组相对策略优化
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 提出BashCoder-R1框架,结合持续预训练、长思维链监督微调和鲁棒感知组相对策略优化,在BashBench基准上实现高语法通过率、低鲁棒警告率和功能完整率,显著超越DeepSeek-V3.2。
Comments Accepted to ISSTA 2026
Pseudo2CodeQA:面向基于大语言模型的代码生成中结构化算法推理的基准测试
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 本文提出Pseudo2Code基准测试及Pseudo2Code Agentic Framework,实验表明该框架性能优于现有基线,验证了结构化伪代码对代码生成的提升作用。
Comments 8 pages, 3 figures
理解与改进用于安全代码生成的模型编辑
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 本研究系统探究模型编辑用于安全代码生成,提出SafeEdit方法缓解模型编辑的安全与功能权衡,其与CoSec结合可提升安全代码生成性能。
Comments ISSTA 2026
CodeChemist:通过测试时扩展实现低资源代码生成的功能知识迁移
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 提出CodeChemist框架,通过合成测试用例将模型功能知识从高资源语言迁移到低资源语言,无需训练,显著提升低资源语言代码生成性能。
Comments This paper is accepted by ICML 2026
CodeAssay:带有审计基准真值的多指标大语言模型代码生成基准
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 本文提出CodeAssay基准,涵盖185个Python任务,结合多类测试与度量,经审计后发现模型正确性标签有9.0%变化,且验证了多类LLM代码生成的评估特性。
TaPR:面向反馈条件代码生成的感知测试策略优化
专题命中 代码生成 :code generation(title,abstract);分类 cs.AI
AI总结 该研究针对代码智能体强化学习中反馈利用不足的问题,提出TaPR框架,通过将执行反馈转换为密集每轮测试通过率奖励,在219个代码问题上提升了多轮代码生成成功率。
Comments 9 pages, 3 figures, 3 tables. Aofan Liu and Jingxiang Meng contributed equally; Fangxin Liu and Yongbiao Chen are corresponding authors
合成轨迹反映真实的奖励黑客行为吗?对监控真实世界代码生成中黑客行为的系统研究
机构 * Peking University(北京大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Arena ; University of Maryland(马里兰大学) ; Mohamed bin Zayed University of Artificial Intelligence(莫莫迪 bin Zayed 人工智能大学)
专题命中 代码生成 :code generation(title,abstract);分类 cs.LG
AI总结 本文研究合成轨迹与真实世界中代码生成奖励黑客行为的差异,通过对比监控器在合成与真实数据上的表现,发现合成数据训练的监控器无法泛化到真实黑客行为,而真实数据训练的监控器对未见过的黑客类型更具泛化能力。
Comments Corrected a typo in the title; no other changes
结构化安全审计:在LLM生成代码的正确性与内容安全之间平衡
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 本文提出NLSafety-Utility Duality Score和Dual Reasoning,通过结构化安全审计和任务导向的代码审查,提升LLM生成代码的安全性和正确性,实验显示其在多个模型上显著提升SUDS评分。
Comments 13 pages. Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026). Artifact: https://doi.org/10.5281/zenodo.19245736
Artisan: 自动化代理评估
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 Artisan通过自动化LLM代理生成重现脚本,提升软件工程研究结果的可重复性,生成44/60个有效脚本并发现20个新错误。
Comments Accepted at ASE 2026
CoGate:用于安全代码生成的置信门控协同解码
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 针对现有协同解码未考虑专家模型置信度的问题,提出CoGate方法,在多LLM后端和代码生成基准上优于CoSec+,在CWEval的Func-Sec@10指标最高提升12.6%。
更好地调用Grep:评估和改进用于仓库级代码补全的类Grep词汇检索方法
专题命中 代码生成 :repository(title,abstract);分类 cs.SE
AI总结 本文评估改进类Grep词汇检索,提出Naive GrepRAG基线,又结合后处理流水线的GrepRAG在代码补全任务上优于SOTA,为轻量检索支撑仓库级代码补全提供方案。
Comments ISSTA2026
海报:通过现实世界风险场景重新思考大语言模型代码生成中的安全性
专题命中 代码生成 :code generation(title,abstract);分类 cs.AI
AI总结 研究LLM代码生成的安全行为,识别出三种风险场景,构建含2700个测试用例的基准评估安全性,发现先进LLMs平均漏洞率超56%,证明安全感知提示可大幅降低风险。
MKEvolve:用于内核代码生成的模块化多智能体框架
专题命中 代码生成 :code generation(title,abstract);分类 cs.AI
AI总结 针对硬件加速器内核代码生成瓶颈,MKEvolve框架通过迭代共同进化PyTorch模块分解与子模块内核,经拆分融合优化分解并以束搜索改进子内核,实验证明其在正确性、加速及减少LLM令牌使用上有优势。
架起行为与实现的桥梁:用于行为驱动开发的自动化Java胶水代码生成
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 研究针对行为驱动开发中胶水代码开发维护难题,提出分层多智能体框架AutoGlue,遵循行为优先工作流程。经实验评估,相比少样本提示,其在代码生成指标上有显著提升,能有效连接行为规范与项目代码,支持软件开发。
基于仿真推理的程序合成:联合模型选择与参数估计
机构 * Anthropic
专题命中 代码生成 :program synthesis(title,abstract);分类 cs.LG
AI总结 研究提出结合大语言模型与神经仿真推理的框架,用于联合模型选择与参数估计。给定自然语言描述,大语言模型提出候选程序,经反馈驱动变异和神经密度估计评估,能在一组模型上推理,在多基准测试中可从提示识别合理模型族。
Comments 15+7 pages, 4+2 figures
安全语言:提示语法如何塑造开放语言模型中的安全代码生成
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 研究开放语言模型中提示语法对安全代码生成的影响,采用解析器驱动方法生成句法变体并评估,发现特定句法元素及其位置影响代码安全性,为降低LLM辅助开发漏洞风险提供指导。
Comments Accepted at ICSME 2026
MoT:用于有效代码生成的思维模块化提示
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 研究针对大语言模型代码生成中现有提示技术不足,提出MoT技术,利用模块化原则分解问题,用MLR图构建推理过程,经实验对比六种基线技术,在八个基准上显著提升代码生成性能,Pass@1分数达58.1%至95.1%。
PROBE:大语言模型中代码生成的基准测试
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 针对大语言模型代码生成评估不足,介绍PROBE基准框架,基于多维度评估代码,用于评估多种模型和语言,发现LLMs虽有成果,但处理难题及小模型在特定语言上有困难,且常因易避免错误失败。
Comments Accepted for publication in Empirical Software Engineering (Springer)
ACES: 谁测试测试?留一法AUC一致性用于代码生成
机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ; School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)
专题命中 代码生成 :code generation(title,abstract);分类 cs.LG
AI总结 本文提出ACES方法,通过留一法AUC评估测试区分正确与错误代码的能力,解决测试正确性判断的循环依赖问题,实现代码生成的高精度筛选。
Comments 32 pages, 14 figures, 9 tables
利用多模态大语言模型探索程序流程图在代码生成中的潜力
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 研究利用多模态大语言模型探索程序流程图对代码生成的潜力,通过从示例代码生成流程图并与问题陈述一起提供给模型进行代码生成实验,发现结合流程图可提升性能,不同细节程度的流程图效果有差异,还比较了与少样本学习的效果。
选择性左移:将测试时计算和基于难度的筛选转化为低资源代码生成的训练数据
机构 * WSO2
专题命中 代码生成 :code generation(title,abstract);分类 cs.LG
AI总结 针对低资源代码生成难题,提出三阶段管道,先将推理计算左移合成训练数据,再微调嵌入句法先验,最后用可验证奖励强化学习,相比现有方法提升性能,减少数据使用和成本,且能推广到新语言。
Comments 11 Pages, 5 Figures
SCOPE:利用子目标批判进行代码生成
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE
AI总结 研究针对大语言模型代码生成不可靠问题,提出SCOPE方法,利用证明器初始化子目标批判,结合监督微调、强化学习等,通过两个互补奖励改进代码生成,实验显示在多个数据集上优于基线,优势集中在有语义约束任务,代码修正更局部。
基于程序合成的张量网络结构搜索
专题命中 代码生成 :program synthesis(title,abstract);分类 cs.PL
AI总结 本文提出将张量网络结构搜索视为程序合成问题,通过约束基于评估方法和输出导向分割操作,提升搜索效率并实现更好的压缩比。