Can Language Models Replace Programmers for Coding? REPOCOD Says 'Not Yet'
机构 * Purdue University(普渡大学)
专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.SE、cs.CL
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
机构 * Purdue University(普渡大学)
专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.SE、cs.CL
机构 * School of Computing and Information Systems, The University of Melbourne(计算与信息系统学院,墨尔本大学)
专题命中 代码评测 :code generation(abstract);program synthesis(abstract);分类 cs.CL、cs.AI
专题命中 代码评测 :code generation(abstract);code model(abstract);分类 cs.CL、cs.AI
专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI
Comments Preprint
专题命中 代码评测 :program repair(abstract);repository(abstract);分类 cs.SE、cs.LG
专题命中 代码评测 :program repair(abstract);program synthesis(abstract);分类 cs.SE、cs.AI
Comments Accepted for publication in the Genetic and Evolutionary Computation Conference (GECCO 2023)
机构 * Nanjing University of Posts and Telecommunications(南京邮电大学) ; Chongqing University(重庆大学)
专题命中 代码评测 :repository(abstract,comments);code generation(abstract);分类 cs.AI
Comments The code repository is available at https://github.com/23japhone/HALO
机构 * School of Electrical Engineering and Computer Science, Ohio University(电气工程与计算机科学学院,俄亥俄大学)
专题命中 代码评测 :repository(title)
Comments 5 pages, meant as citation for dataset
MergeSE:无需重新训练的软件工程任务事后模型合并
专题命中 代码评测 :code model(abstract);repository(abstract);分类 cs.SE
AI总结 MergeSE是一款开源工具,可对HuggingFace编码器检查点进行无训练合并,支持软件工程多类分类任务,能解决代码模型分布偏移导致的性能下降问题,合并效率高且性能优异。
Comments Accepted at ASE 2026
ML2B:评估大语言模型跨语言ML流水线生成能力的基准
机构 * HSE University(俄罗斯伏尔加格勒国立大学) ; Constructor University(Constructor大学) ; National University of Singapore(新加坡国立大学)
专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.CL
AI总结 ML2B是首个评估大语言模型跨语言ML流水线生成能力的基准,含多领域多语言任务,实验发现跨语言性能退化高度依赖任务,挑战了传统多语言模型能力假设。
寥寥数语,成效显著:语言引导的机器人策略合成
机构 * University of Washington(华盛顿大学) ; Microsoft Research(微软研究院) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 代码评测 :coding agent(abstract);program synthesis(abstract);分类 cs.AI
AI总结 研究针对视觉-语言-动作模型难以解释等问题,提出ARCHITECT框架,利用大语言模型编码代理合成模块化机器人程序,通过人类自然语言修正引导策略并积累技能库,在机器人基准评估中表现出色,提供了新的机器人学习方案。
CRAFT:学习模式,执行计划
机构 * Amazon Advertising Foundations(亚马逊广告基金会) ; Amazon Web Services Agentic AI(亚马逊网络服务代理人工智能)
专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 研究企业编码代理将自然语言分析请求转换为可执行代码时的问题,提出两阶段训练后方法 CRAFT,先进行模式剥离的 PLAN 监督微调,再用执行形状的强化学习,评估显示其在多方面有提升并减少负担。
VERITAS:迈向科学研究的通用复制工具
机构 * University of Chicago(芝加哥大学) ; University of Indonesia(印度尼西亚大学)
专题命中 代码评测 :repository(abstract);coding agent(abstract);分类 cs.AI
AI总结 针对科研成果独立验证难且手工复制慢贵的问题,提出VERITAS框架,围绕CLI编码代理构建,可提取论文主张、运行方法并判断主张,在多领域评估中性能达最优。
Comments 21 pages, 2 figures, 8 tables
TeleSWEBench:一个面向电信领域评估基于LLM的软件工程的提交驱动基准
专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.SE
AI总结 提出TeleSWEBench,首个面向电信领域的提交驱动基准,通过从srsRAN 5G仓库挖掘真实提交并构建734个可执行测试用例,结合分层LLM评判框架TeleJudge,评估ASE工具在电信软件工程中的性能。
Verus-SpecGym: 用于评估规范自动形式化的智能体环境
机构 * CMU(卡内基梅隆大学) ; Amazon(亚马逊)
专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 提出 Verus-SpecGym 环境与 Verus-SpecBench 基准,通过执行规范机制和对抗性测试评估 LLM 智能体将非正式编程问题转化为形式规范的能力,发现前沿模型可解决 77.8% 的任务但存在遗漏假设等脆弱性。
Comments Preprint
软件开发生命周期中的代理AI:架构、实证证据与软件工程的重塑
专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.SE
AI总结 本文探讨代理AI在软件开发生命周期中的应用,提出六层参考架构,分析代理SDLC与传统SDLC的差异,并通过实证数据展示其在性能、生产力和劳动力市场的影响。
Comments 9 pages, 5 figures, 2 tables, survey paper
Code Broker:一个用于自动化代码质量评估的多智能体系统
机构 * Independent researcher(独立研究者) ; California, USA(美国加州)
专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 Code Broker通过多智能体架构对Python代码进行分析并生成质量评估报告,结合LLM推理与静态分析工具,提升代码审查的效率与准确性。
Comments 8 pages, 1 figure, 2 tables, 28 references
PlayCoder: 使LLM生成的GUI代码可播放
专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.SE
AI总结 本文提出PlayCoder框架,通过生成、评估和迭代修复GUI代码,提升代码的逻辑正确性和语义对齐,实现功能正确性和交互逻辑的改进。
Comments September 11, 2025 Submitted to FSE2026
面向AI生成科学代码的PETSc代理评估框架
机构 * Argonne National Laboratory(阿贡国家实验室)
专题命中 代码评测 :code generation(abstract);coding agent(abstract);分类 cs.AI
AI总结 本文提出petscagent-bench框架,通过代理评估代理的方式,评估AI生成的科学代码在正确性、性能、代码质量等方面的表现,揭示传统指标的不足。
面向依赖决策制定的基准测试
专题命中 代码评测 :repository(abstract);coding agent(abstract);分类 cs.SE
AI总结 本文提出DepDec-Bench基准测试,用于评估人工智能编码代理在依赖决策中的安全性和效率,通过分析实际依赖变更数据,揭示代理在版本选择、依赖重用及安全影响方面的表现。
Comments Under review at JAWS 2026. 5 pages, 1 figures, 2 tables
ReCode: 通过强化学习更新代码API知识
专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 ReCode通过强化学习方法提升LLMs在动态API环境下的代码生成能力,尤其在CodeUpdateArena任务中表现优异。
Comments AAAI 2026
专题命中 代码评测 :code generation(abstract);program synthesis(abstract);分类 cs.CL
Comments Project page: https://csu-jpg.github.io/VCode Github: https://github.com/CSU-JPG/VCode
专题命中 代码评测 :program synthesis(abstract);分类 cs.SE、cs.CL、cs.AI
Comments 11 pages, many figures and images
专题命中 代码评测 :code generation(abstract);program repair(abstract);分类 cs.SE
专题命中 代码评测 :code generation(abstract);code model(abstract);分类 cs.SE
机构 * MacPaw
专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.CL、cs.LG
Comments Accepted to FORGE'25 Benchmarking on 15.01.2025, to be published by IEEE under the CC BY-NC-ND 4.0 license. This is the accepted version of the article (5 pages, 2 figures, 1 table). DOI will be added upon publication
专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.CL、cs.AI
Comments Accepted as Spotlight at the 42nd International Conference on Machine Learning (ICML 2025)
机构 * ByteDance(字节跳动)
专题命中 代码评测 :code generation(abstract);coding agent(abstract);分类 cs.AI
Comments 28 pages, 15 figures
专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI
专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.CL、cs.AI
Comments ICLR 2025 Camera Ready