TDD-Agent: Test-Driven Reasoning for Code Generation
TDD-Agent:用于代码生成的测试驱动推理
专题命中 代码生成 :code generation(title,abstract);repository(abstract);分类 cs.SE、cs.AI
AI总结 TDD-Agent将测试驱动开发范式应用于代码生成,通过测试优先推理和迭代双轨优化,在LiveCodeBench和RepoEval上均优于相关基线,提升了代码及测试的有效性。
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
TDD-Agent:用于代码生成的测试驱动推理
专题命中 代码生成 :code generation(title,abstract);repository(abstract);分类 cs.SE、cs.AI
AI总结 TDD-Agent将测试驱动开发范式应用于代码生成,通过测试优先推理和迭代双轨优化,在LiveCodeBench和RepoEval上均优于相关基线,提升了代码及测试的有效性。
当不确定性还不够时:代码生成中自校正的实证研究
机构 * University of Michigan(密歇根大学) ; New York University(纽约大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Algoverse AI ; University of Aberdeen(阿伯丁大学) ; University of Oxford(牛津大学)
专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI、cs.LG
AI总结 本研究通过实证发现,针对代码生成的不确定性估计方法难以可靠提升生成准确率,仅基于验证的自校正策略可显著提升Pass@1指标,廉价不确定性估计器仅适合作为校正循环的门控信号。
当前谁主导?用于图表转代码生成的令牌级模态仲裁
专题命中 代码生成 :code generation(title,abstract);分类 cs.AI
AI总结 提出MoCA模型,通过CAB分离视觉与编码能力并动态仲裁贡献,经两阶段训练后在三个基准测试中取得与同类模型相当的图表转代码性能。
保护AI生成代码:一种即时漏洞检测与修复流水线
专题命中 代码生成 :code generation(abstract,abstract_cn);分类 cs.SE、cs.AI
AI总结 本文提出一种自动化安全评估流水线,可检测、修复AI生成代码的漏洞,在Claude的4种模型上评估发现,P2配置表现优于P1,Sonnet 4.6的修复效果最佳,且流水线有效性与初稿安全性不同。
Comments 7 pages, 8 tables, 2 figures. Georgia Institute of Technology Master's final practicum project. Code: this https URL (https://github.com/Droidsurikov/securing-ai-generated-code)
不确定信号是否有用?对带有回滚机制的不确定感知解码的系统研究
专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG
AI总结 本文通过系统研究带有回滚机制的不确定感知解码,发现其可提升代码LLM的生成性能,其中token熵等信息论不确定信号效果最优,反馈引导的回滚是主要改进来源。
比较 vibe 编码工具生成代码的质量
专题命中 代码生成 :code generation(abstract);分类 cs.SE
AI总结 本研究对比 Lovable、v0、Replit 三种 vibe 编码工具生成代码的结构质量,发现三者存在不同质量特征,选择工具需考量结构层面的权衡。
基于LLMs菜单的智能体进化,在每个价格点展开竞争
专题命中 代码生成 :code generation(abstract);分类 cs.AI
AI总结 本研究提出进化元智能体RoboPhD,通过对含9个LLM端点的菜单进行智能体进化,在DS-1000和PaperFindingBench两个任务上,除一个位置外占据所有帕累托前沿槽位,实现各价格点的竞争优势。
基于多模态大语言模型(MLLM)的遥感城市布局提取
机构 * City University of Hong Kong(香港城市大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Aerospace Information Research Institute(空天信息创新研究院)
专题命中 代码生成 :code generation(abstract)
AI总结 本研究提出Code-as-City方法,利用MLLM将遥感顶视图图像转化为含平面与3D输出的可编辑城市布局,在CityLayout-100数据集上取得41.1%、48.3%的交并比,验证了视觉观测转城市代码的可行性。
Comments 4 pages, 2 figures, 4 tables. Accepted to IEEE APGARSS 2026
编码智能体的工作集:仓库规模任务中的一致性债务
专题命中 软件智能体 :repository(title,abstract);coding agent(title);分类 cs.SE、cs.LG
AI总结 该研究针对仓库规模编码任务,建模一致性债务,通过7个模型和5个框架实验发现事实可用性决定编码结果,提出测试框架应核对编辑依赖事实可用性的建议。
可执行代码知识:作为AI编码智能体原生、带验证的知识表示的代码
机构 * Alibaba Cloud(阿里云)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL
AI总结 该研究提出可执行代码知识(ECK)及其单元ECKU,构建Python原型验证其在编码智能体任务中的效果,支持源绑定、验证等功能,为AI编码智能体提供了混合架构方案。
Comments 11 pages. Submitted to AgenticDev 2026, co-located with ASE 2026
OpenHarmony Bench:评估LLM与编码智能体在OpenHarmony应用开发中的表现
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE
AI总结 该研究推出OPENHARMONY BENCH应用级编码基准,评估8个LLM驱动的DevEco Code在三类OpenHarmony ArkTS应用任务中的表现,发现新一代模型任务完成率更高、构建性接近饱和但行为正确性不足、spec驱动任务完成率最低。
工作空间拓扑作为智能体代码助手的攻击向量
专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究将工作空间拓扑作为攻击向量,发现其会影响智能体代码助手的间接提示注入攻击成功率,高度模块化环境及安全提示可降低攻击成功率,为代码智能体安全测试提供实用价值。
Comments 15 pages, 10 figures. Preprint of a paper accepted at the Conference on Applied Machine Learning in Information Security (CAMLIS 2026)
智能体协作:多智能体AI编码中的协作度量
机构 * University College London(伦敦大学学院)
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI
AI总结 本研究引入时间网络工具度量多智能体AI编码团队的协作,分析团队规模、结构等对协作的影响,发现智能体存在主动获取隐藏评分材料的倾向,相关结果在封闭环境中得到复现。
召回陷阱:固定预算代码上下文下,最大化召回率的检索器配置会降低问题解决效率
专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.CL
AI总结 该研究发现,最大化召回率的检索器配置会降低代码修复的问题解决率,建议固定预算下不要按文件硬去重,应针对任务而非检索指标优化打包策略。
Comments 24 pages, 2 figures. Reproducibility artifact: Zenodo DOI https://doi.org/10.5281/zenodo.21879550
责任归属:在智能体软件开发中将人类责任映射到工作流制品
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE
AI总结 该研究分析智能体软件开发中责任归属的矛盾,替换验证分类法,发现责任归属方向相反,指出智能体工具未造成责任差距,相关数据已公开。
Comments 30 pages, 5 tables. Source collection of 118 archived documents and 12 processing scripts deposited at Zenodo, doi: https://doi.org/10.5281/zenodo.21965182
超越Pass@k:衡量智能体代码生成的可靠性与安全性
机构 * Stevens Institute of Technology(史蒂文斯理工学院) ; Cornell University(康奈尔大学)
专题命中 代码评测 :code generation(title);repository(abstract);coding agent(abstract);分类 cs.AI
AI总结 该研究指出AI编码智能体基准误用Pass@k指标,提出正确的Reliability@k及安全调整版,通过实验验证误用指标的偏差,还在SWE-bench试点中发现真实场景下的核心问题。
评估分布式系统中智能体的代码修复能力
专题命中 代码评测 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI
AI总结 该研究推出分布式系统代码修复基准DDBench,评估10个LLM的代码修复能力,发现调试上下文可提升准确率且对强弱模型影响不同,分布式调试能凸显单进程基准未体现的推理能力。
Comments Under submission
智能体内核优化:无需手动编写CUDA即可生成最先进的GPU内核
专题命中 代码评测 :coding agent(abstract);分类 cs.SE;code generation(comments)
AI总结 该研究构建多智能体编排框架Houmao的GPU内核优化工作流,利用通用代码智能体在无需手动CUDA代码的情况下,生成的GPU内核在多个任务上实现远超PyTorch和FlashInfer基线的加速,在竞赛中取得最优结果,证明代码智能体可作为GPU内核开发的有效自主优化器。
Comments Technical report on AI code generation for practical GPU kernels on NVIDIA Blackwell GPUs
ModBench:用于构建从库仓库挖掘的Modelica基准数据集的流水线
专题命中 代码评测 :repository(abstract);分类 cs.SE
AI总结 ModBench是用于构建Modelica基准数据集的流水线,经其处理Modelica标准库得到含85562个类快照的公开数据集,可支持模型演化分析等相关研究。
Comments Extended abstract accepted at SAM 2026, co-located with MODELS 2026. To appear in the ACM/IEEE MODELS 2026 Companion Proceedings
PLSQLBench:面向可执行过程式数据库编程的大语言模型系统基准测试
机构 * Oracle AI, Turing Enterprise Inc(Oracle AI 图灵企业公司)
专题命中 代码评测 :code generation(abstract);分类 cs.CL
AI总结 本研究提出首个过程式数据库编程基准PLSQLBench,含2865个任务实例,经8个LLM实验发现其在多方面存在困难,工具增强智能体性能有提升但仍有差距,凸显了传统基准未覆盖的能力。
对比领域模型相似度指标与人类专家评分
专题命中 代码评测 :repository(abstract);分类 cs.SE
AI总结 本文实现5种领域模型相似度指标,对比其与39组领域模型的人类专家评分,发现无单一指标在所有标准占优,集成多指标或可替代人类专家评分。
几何湍流:用于股权协方差动态的测地回归危机指标——来自非洲市场的证据
专题命中 代码评测 :repository(abstract)
AI总结 该研究提出一种基于对称正定锥测地回归的几何湍流指标,可准确识别市场压力事件,其预测性能优于传统欧氏回归,对应的去风险策略能降低最大回撤。
Comments 22 pages, 8 figures
信任并不足够:智能体强化学习中策略内自蒸馏的影响校准
专题命中 仓库级理解 :repository(abstract);分类 cs.CL、cs.AI
AI总结 针对策略内自蒸馏的信任-效用不匹配问题,提出ICSD方法,在多基准任务上提升语言智能体性能,降低反向令牌的教师支持占比并提高梯度兼容性。
隐式却影响重大:理解Java项目中的隐藏依赖关系
专题命中 仓库级理解 :repository(abstract);分类 cs.SE
AI总结 本研究针对Java项目的隐式依赖问题,构建含1157个库、19812个版本及972个模块的数据集,量化其影响并分析应对措施,为开源生态系统提供解决方案。
Comments 13 pages, ASE 2026
策略性技术债务:早期软件实验的实物期权方法
专题命中 仓库级理解 :repository(abstract);分类 cs.SE
AI总结 本文将早期软件实验中刻意产生的技术债务视为看涨期权,明确策略性与有毒债务的边界,构建序贯模型得出关键结论,并开展两项预注册实证检验。
Comments 25 pages, 4 figures. Pre-registered empirical program: OSF bs3cr (EP3'), rvx5t (EP-Pi)
在多物理场AI助手MOOSEnger中部署前沿智能体技术
机构 * Texas A&M University (TAMU)(德克萨斯农工大学) ; Idaho National Laboratory (INL)(爱达荷国家实验室)
专题命中 仓库级理解 :repository(abstract);分类 cs.LG
AI总结 本研究为面向MOOSE框架的AI智能体MOOSEnger扩展本地托管模型管控层,经多类工程任务测试,MOOSEnger-GPT-5.2成功率达90%,凸显智能体管控层对多物理场仿真的支撑价值。
双语混合专家语言模型中专家路由的声明式-过程式视角
机构 * Sri Sivasubramaniya Nadar College of Engineering(斯里·西瓦苏布拉马尼亚·纳达尔工程学院) ; Shiv Nadar University Chennai(钦奈希夫·纳达尔大学)
专题命中 仓库级理解 :repository(abstract);分类 cs.CL
AI总结 该研究探究双语MoE语言模型的专家路由是否形成语言结构,对比课程学习与无课程训练的模型,发现无课程模型专业化更强但依赖随机种子,课程模型路由更均衡,揭示MoE路由可出现可解释语言组织。
Comments 15 pages, 6 figures, 12 tables (including appendix)
竞争风险治愈模型:方法学文献的五轴系统综述
专题命中 仓库级理解 :repository(abstract)
AI总结 本文对26篇竞争风险治愈模型的方法学文献从五个维度进行系统综述,明确模型分类与差异,指出可重复性不足问题,为模型选择与相关研究提供支持。
Comments 34 pages, 2 figures
ChemReporter:用于整理和导出用于MLIP训练的大规模化学数据集的框架
专题命中 仓库级理解 :repository(abstract)
AI总结 ChemReporter是一款模块化框架,可将异构大规模化学数据集转为统一可查询格式,经处理、查询、导出三个阶段生成MLIP可用训练数据,支持处理超内存规模数据集,已在GitHub和PyPI发布。
Comments 19 pages, 10 figures