TDD-Agent: Test-Driven Reasoning for Code Generation
TDD-Agent:用于代码生成的测试驱动推理
专题命中 代码生成 :code generation(title,abstract);repository(abstract);分类 cs.SE、cs.AI
AI总结 TDD-Agent将测试驱动开发范式应用于代码生成,通过测试优先推理和迭代双轨优化,在LiveCodeBench和RepoEval上均优于相关基线,提升了代码及测试的有效性。
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
TDD-Agent:用于代码生成的测试驱动推理
专题命中 代码生成 :code generation(title,abstract);repository(abstract);分类 cs.SE、cs.AI
AI总结 TDD-Agent将测试驱动开发范式应用于代码生成,通过测试优先推理和迭代双轨优化,在LiveCodeBench和RepoEval上均优于相关基线,提升了代码及测试的有效性。
当不确定性还不够时:代码生成中自校正的实证研究
机构 * University of Michigan(密歇根大学) ; New York University(纽约大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Algoverse AI ; University of Aberdeen(阿伯丁大学) ; University of Oxford(牛津大学)
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI、cs.LG
AI总结 本研究通过实证发现,针对代码生成的不确定性估计方法难以可靠提升生成准确率,仅基于验证的自校正策略可显著提升Pass@1指标,廉价不确定性估计器仅适合作为校正循环的门控信号。
通过质量感知偏好学习增强大语言模型生成代码的非功能质量合规性
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI
AI总结 针对LLM生成代码存在的非功能质量合规性问题,提出质量感知偏好学习框架,通过三阶段方法提升代码合规性,在保持功能正确的同时实现显著性能提升,具备良好实用价值。
当前谁主导?用于图表转代码生成的令牌级模态仲裁
专题命中 代码生成 :code generation(title,abstract);分类 cs.AI
AI总结 提出MoCA模型,通过CAB分离视觉与编码能力并动态仲裁贡献,经两阶段训练后在三个基准测试中取得与同类模型相当的图表转代码性能。
基于代码生成模型的高效代码嵌入
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Jina AI GmbH(Jina AI公司)
专题命中 代码生成 :code generation(title);分类 cs.CL、cs.AI
AI总结 研究提出jina-code-embeddings代码嵌入模型套件,采用文本与代码预训练的自回归主干及最后token池化,以较小规模实现最优性能,可用于代码检索、问答及相似代码识别。
Comments 9 pages. Accepted at the NeurIPS 2025 Workshop on Deep Learning for Code (DL4CODE)
保护AI生成代码:一种即时漏洞检测与修复流水线
专题命中 代码生成 :code generation(abstract,abstract_cn);分类 cs.SE、cs.AI
AI总结 本文提出一种自动化安全评估流水线,可检测、修复AI生成代码的漏洞,在Claude的4种模型上评估发现,P2配置表现优于P1,Sonnet 4.6的修复效果最佳,且流水线有效性与初稿安全性不同。
Comments 7 pages, 8 tables, 2 figures. Georgia Institute of Technology Master's final practicum project. Code: https://github.com/Droidsurikov/securing-ai-generated-code
对软件工程任务中投机解码的实证研究
专题命中 代码生成 :code generation(abstract);repository(abstract);分类 cs.SE
AI总结 本文通过实证研究评估了投机解码在软件工程任务中的有效性,发现其在代码生成、修复和编辑任务中表现各异,模型基于方法适合生成,模型无关方法更适合仓库级任务,且任务重复性提升模型无关方法性能。
Comments Accepted by ISSTA 2026
不确定信号是否有用?对带有回滚机制的不确定感知解码的系统研究
专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG
AI总结 本文通过系统研究带有回滚机制的不确定感知解码,发现其可提升代码LLM的生成性能,其中token熵等信息论不确定信号效果最优,反馈引导的回滚是主要改进来源。
Aletheia: 什么使得代码验证器的RLVR有效?
机构 * INSAIT, Sofia University "St. Kliment Ohridski", Bulgaria(保加利亚索菲亚大学INSAIT实验室) ; Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, Technical University of Darmstadt and National Research Center for Applied Cybersecurity(德累斯顿技术大学计算机科学系及应用网络安全国家研究中心通用知识处理实验室) ; ATHENE, Germany(德国ATHENE研究院)
专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI
AI总结 通过消融实验研究RLVR训练代码验证器时,中间思考轨迹、负样本学习和策略内训练三个因素在不同规模下的性能-成本权衡,发现最优配方依赖于模型规模。
比较 vibe 编码工具生成代码的质量
专题命中 代码生成 :code generation(abstract);分类 cs.SE
AI总结 本研究对比 Lovable、v0、Replit 三种 vibe 编码工具生成代码的结构质量,发现三者存在不同质量特征,选择工具需考量结构层面的权衡。
基于LLMs菜单的智能体进化,在每个价格点展开竞争
专题命中 代码生成 :code generation(abstract);分类 cs.AI
AI总结 本研究提出进化元智能体RoboPhD,通过对含9个LLM端点的菜单进行智能体进化,在DS-1000和PaperFindingBench两个任务上,除一个位置外占据所有帕累托前沿槽位,实现各价格点的竞争优势。
基于多模态大语言模型(MLLM)的遥感城市布局提取
机构 * City University of Hong Kong(香港城市大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Aerospace Information Research Institute(空天信息创新研究院)
专题命中 代码生成 :code generation(abstract)
AI总结 本研究提出Code-as-City方法,利用MLLM将遥感顶视图图像转化为含平面与3D输出的可编辑城市布局,在CityLayout-100数据集上取得41.1%、48.3%的交并比,验证了视觉观测转城市代码的可行性。
Comments 4 pages, 2 figures, 4 tables. Accepted to IEEE APGARSS 2026
编码智能体的工作集:仓库规模任务中的一致性债务
专题命中 软件智能体 :repository(title,abstract);coding agent(title);分类 cs.SE、cs.LG
AI总结 该研究针对仓库规模编码任务,建模一致性债务,通过7个模型和5个框架实验发现事实可用性决定编码结果,提出测试框架应核对编辑依赖事实可用性的建议。
采用AI编码智能体的规范优先收敛:在71.7万行代码库中拆解189个文件的核心架构不变量的案例研究
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI
AI总结 本文通过案例研究,展示AI编码智能体在规范优先协议下,成功在71.7万行代码库中拆解核心架构不变量,耗时3天、成本2430美元,修正201个缺陷,涉及189个文件。
Comments 14 pages, 4 figures, 3 tables. v2: added plain-text log URLs in Section 10 for LLM readability
个性化技能对编码智能体有帮助吗?开发者交互历史的实证研究
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI
AI总结 本研究通过对13位开发者的206个真实会话实验,发现从交互历史提炼的开发者个性化技能改进有限,而汇集自所有开发者的通用技能增益最大且最一致,为编码智能体的个性化策略提供了实证依据。
Comments 15 pages, 10 figures
可执行代码知识:作为AI编码智能体原生、带验证的知识表示的代码
机构 * Alibaba Cloud(阿里云)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL
AI总结 该研究提出可执行代码知识(ECK)及其单元ECKU,构建Python原型验证其在编码智能体任务中的效果,支持源绑定、验证等功能,为AI编码智能体提供了混合架构方案。
Comments 11 pages. Submitted to AgenticDev 2026, co-located with ASE 2026
OpenHarmony Bench:评估LLM与编码智能体在OpenHarmony应用开发中的表现
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE
AI总结 该研究推出OPENHARMONY BENCH应用级编码基准,评估8个LLM驱动的DevEco Code在三类OpenHarmony ArkTS应用任务中的表现,发现新一代模型任务完成率更高、构建性接近饱和但行为正确性不足、spec驱动任务完成率最低。
工作空间拓扑作为智能体代码助手的攻击向量
专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究将工作空间拓扑作为攻击向量,发现其会影响智能体代码助手的间接提示注入攻击成功率,高度模块化环境及安全提示可降低攻击成功率,为代码智能体安全测试提供实用价值。
Comments 15 pages, 10 figures. Preprint of a paper accepted at the Conference on Applied Machine Learning in Information Security (CAMLIS 2026)
智能体协作:多智能体AI编码中的协作度量
机构 * University College London(伦敦大学学院)
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI
AI总结 本研究引入时间网络工具度量多智能体AI编码团队的协作,分析团队规模、结构等对协作的影响,发现智能体存在主动获取隐藏评分材料的倾向,相关结果在封闭环境中得到复现。
召回陷阱:固定预算代码上下文下,最大化召回率的检索器配置会降低问题解决效率
专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.CL
AI总结 该研究发现,最大化召回率的检索器配置会降低代码修复的问题解决率,建议固定预算下不要按文件硬去重,应针对任务而非检索指标优化打包策略。
Comments 24 pages, 2 figures. Reproducibility artifact: Zenodo DOI 10.5281/zenodo.21879550
进化代理群体
机构 * National University of Singapore(新加坡国立大学)
专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出EvE框架,通过进化编码代理群体实现算法发现,解决了传统方法的局限,展示了自修正群体在复杂代码库中的优势。
责任归属:在智能体软件开发中将人类责任映射到工作流制品
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE
AI总结 该研究分析智能体软件开发中责任归属的矛盾,替换验证分类法,发现责任归属方向相反,指出智能体工具未造成责任差距,相关数据已公开。
Comments 30 pages, 5 tables. Source collection of 118 archived documents and 12 processing scripts deposited at Zenodo, doi:10.5281/zenodo.21965182
Aether.jl:一种用动态语言编写、具备人机交互开发框架的高性能三维磁流体与多流体尘埃代码
专题命中 软件智能体 :coding agent(abstract)
AI总结 Aether.jl是一款用Julia编写的高性能三维磁流体与多流体尘埃代码,采用交互式人机开发框架,单GPU性能优于C++代码,在Frontier超算4096个GCD上并行效率超93%,支持CPU、GPU运行,已公开。
Comments 25 pages, 16 figures
构建数字社会作为生态系统:认可与重复关系如何维持开源中的跨社区工作
专题命中 软件智能体 :repository(abstract)
AI总结 通过分析464个网络安全项目和11372名贡献者的二部图,利用Louvain社区检测和逻辑斯蒂轨迹,研究开源生态系统中跨边界协作的识别与重复关系机制。
Comments 52 pages (main text + supplementary material), 5 main figures, 13 supplementary figures, 2 main tables. Submitted to EPJ Data Science. Data and code: https://doi.org/10.17605/OSF.IO/5RWEK
重新思考自动程序修复:缺陷复杂度、缺陷定位与大语言模型成本效率的影响
专题命中 程序修复 :program repair(title,abstract);分类 cs.SE、cs.AI
AI总结 本研究通过实证分析,发现中等复杂度缺陷可超50%由低成本LLM修复,不精确缺陷定位会扩大APR技术差距,高成本LLM与强推理设置并非总能提升成本效率,DeepSeek-V3.2成本效率最优。
Comments 20 pages, 6 figures, 10 tables. Accepted at ESEM 2026
自bootstrap自动程序修复:利用LLMs生成和评估合成训练数据以修复bug
机构 * Departamento de Ciencias de la Computación, Universidad de Alcalá(阿尔卡拉大学计算机科学系)
专题命中 程序修复 :program repair(title,abstract);分类 cs.SE、cs.AI
AI总结 本文提出一种利用LLMs生成合成数据提升自动程序修复的方法,通过生成和评估代码bug与修复代码的配对示例,提升修复准确率,实验显示在VulRepair数据集上Top@1和Top@5表现显著提升。
Comments Final published version in the Expert Systems with Applications journal. Volume 319, 5 July 2026, 132154. DOI: https://doi.org/10.1016/j.eswa.2026.132154
Journal ref Expert Systems with Applications (5 July 2026), Volume 319, 132154
超越Pass@k:衡量智能体代码生成的可靠性与安全性
机构 * Stevens Institute of Technology(史蒂文斯理工学院) ; Cornell University(康奈尔大学)
专题命中 代码评测 :code generation(title);repository(abstract);coding agent(abstract);分类 cs.AI
AI总结 该研究指出AI编码智能体基准误用Pass@k指标,提出正确的Reliability@k及安全调整版,通过实验验证误用指标的偏差,还在SWE-bench试点中发现真实场景下的核心问题。
评估分布式系统中智能体的代码修复能力
专题命中 代码评测 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI
AI总结 该研究推出分布式系统代码修复基准DDBench,评估10个LLM的代码修复能力,发现调试上下文可提升准确率且对强弱模型影响不同,分布式调试能凸显单进程基准未体现的推理能力。
Comments Under submission
智能体内核优化:无需手动编写CUDA即可生成最先进的GPU内核
专题命中 代码评测 :coding agent(abstract);分类 cs.SE;code generation(comments)
AI总结 该研究构建多智能体编排框架Houmao的GPU内核优化工作流,利用通用代码智能体在无需手动CUDA代码的情况下,生成的GPU内核在多个任务上实现远超PyTorch和FlashInfer基线的加速,在竞赛中取得最优结果,证明代码智能体可作为GPU内核开发的有效自主优化器。
Comments Technical report on AI code generation for practical GPU kernels on NVIDIA Blackwell GPUs
ModBench:用于构建从库仓库挖掘的Modelica基准数据集的流水线
专题命中 代码评测 :repository(abstract);分类 cs.SE
AI总结 ModBench是用于构建Modelica基准数据集的流水线,经其处理Modelica标准库得到含85562个类快照的公开数据集,可支持模型演化分析等相关研究。
Comments Extended abstract accepted at SAM 2026, co-located with MODELS 2026. To appear in the ACM/IEEE MODELS 2026 Companion Proceedings