arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1721 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 1721 篇

2406.06918 2025-03-19 cs.SE 88%

HumanEvo: An Evolution-aware Benchmark for More Realistic Evaluation of Repository-level Code Generation

Dewu Zheng, Yanlin Wang, Ensheng Shi, Ruikai Zhang, Yuchi Ma, Hongyu Zhang, Zibin Zheng

专题命中 代码评测 :code generation(title,abstract);repository(title,abstract);分类 cs.SE

Comments To appear at ICSE 2025

Journal ref 47th International Conference on Software Engineering (ICSE 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.19368 2024-05-01 cs.SE 88%

Exploring Multi-Lingual Bias of Large Code Models in Code Generation

Chaozheng Wang, Zongjie Li, Cuiyun Gao, Wenxuan Wang, Ting Peng, Hailiang Huang, Yuetang Deng, Shuai Wang, Michael R. Lyu

专题命中 代码评测 :code generation(title,abstract);code model(title,abstract);分类 cs.SE

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17568 2024-07-11 cs.LG cs.AI cs.SE 85%

CodeGeeX: A Pre-Trained Model for Code Generation with Multilingual Benchmarking on HumanEval-X

Qinkai Zheng, Xiao Xia, Xu Zou, Yuxiao Dong, Shan Wang, Yufei Xue, Zihan Wang, Lei Shen, Andi Wang, Yang Li, Teng Su, Zhilin Yang, Jie Tang

专题命中 代码评测 :code generation(title,abstract);code model(abstract);分类 cs.SE、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00599 2024-04-02 cs.CL cs.AI cs.SE 85%

EvoCodeBench: An Evolving Code Generation Benchmark Aligned with Real-World Code Repositories

Jia Li, Ge Li, Xuanming Zhang, Yihong Dong, Zhi Jin

专题命中 代码评测 :code generation(title,abstract);repository(abstract);分类 cs.SE、cs.CL、cs.AI

Comments Data: https://github.com/seketeam/EvoCodeBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18106 2025-09-19 cs.SE cs.AI 84%

A.S.E: A Repository-Level Benchmark for Evaluating Security in AI-Generated Code

Keke Lian, Bin Wang, Lei Zhang, Libo Chen, Junjie Wang, Ziming Zhao, Yujiu Yang, Miaoqian Lin, Haotong Duan, Haoran Zhao, Shuang Liao, Mingda Guo, Jiazheng Quan, Yilu Zhong, Chenhao He, Zichuan Chen, Jie Wu, Haoling Li, Zhaoxuan Li, Jiongchi Yu, Hui Li, Dong Zhang

机构 * Tencent(腾讯公司) Peking University(北京大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Singapore Management University(新加坡国立大学)

专题命中 代码评测 :repository(title,abstract);code generation(abstract);分类 cs.SE、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04617 2024-12-16 cs.CL cs.SE 84%

Evaluation of Code LLMs on Geospatial Code Generation

Piotr Gramacki, Bruno Martins, Piotr Szymański

专题命中 代码评测 :code generation(title,abstract);repository(abstract);分类 cs.SE、cs.CL

Comments 7th ACM SIGSPATIAL International Workshop on AI for Geographic Knowledge Discovery (GeoAI'24)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09569 2026-05-29 cs.SE 83%

MigrationBench: Repository-Level Code Migration Benchmark from Java 8

MigrationBench:从Java 8的仓库级代码迁移基准

Linbo Liu, Xinle Liu, Qiang Zhou, Lin Chen, Yihan Liu, Hoan Nguyen, Behrooz Omidvar-Tehrani, Xi Shen, Jun Huan, Omer Tripp, Anoop Deoras

专题命中 代码评测 :repository(title,abstract);code generation(abstract);分类 cs.SE

AI总结 提出MigrationBench基准,用于评估大语言模型在从Java 8迁移到Java 17/21的仓库级代码迁移任务上的表现,并设计了智能体框架实现高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17637 2026-05-25 cs.AI 83%

WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games

WebGameBench: 通过浏览器原生游戏对编码代理进行需求到应用的评估

Wenyu Zhang, Guoliang You, Tianlun, Haotian Zhao, Tianshu Zhu, Haoran Wang, Xiaoxuan Tang, Mingyang Dai, Jingnan Gu, Daxiang Dong, Jianmin Wu

机构 * Baidu(百度) University of Science and Technology of China(中国科学技术大学)

专题命中 代码评测 :coding agent(title,abstract);repository(abstract);分类 cs.AI

AI总结 提出WebGameBench基准,通过将结构化Web游戏规范转化为可浏览器访问的游戏,评估编码代理从需求到应用交付的能力,并采用运行时评估器与人类审查对齐的可用性标签。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20200 2026-04-23 cs.CL 83%

Chasing the Public Score: User Pressure and Evaluation Exploitation in Coding Agent Workflows

追逐公共评分:用户压力与编码代理工作流中的评估剥削

Hardy Chen, Nancy Lau, Haoqin Tu, Shuo Yan, Xiangyan Liu, Zijun Wang, Juncheng Wu, Michael Qizhe Shieh, Alvaro A. Cardenas, Cihang Xie, Yuyin Zhou

机构 * UC Santa Cruz(加州大学圣克ruz分校) UT Dallas(德克萨斯大学达拉斯分校) NUS(新加坡国立大学)

专题命中 代码评测 :coding agent(title,abstract);repository(abstract);分类 cs.CL

AI总结 研究用户压力是否导致公共评分剥削,通过实验发现更强模型剥削率更高,高压力促使早期剥削,添加反剥削提示可有效减少剥削。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03462 2026-03-31 cs.SE 83%

Toward Functional and Non-Functional Evaluation of Application-Level Code Generation

迈向应用级代码生成的功能性和非功能性评估

Ruwei Pan, Yakun Zhang, Qingyuan Liang, Yueheng Zhu, Chao Liu, Lu Zhang, Hongyu Zhang

专题命中 代码评测 :code generation(title,abstract);repository(abstract);分类 cs.SE

AI总结 本文提出RAL-Bench基准,评估应用级代码生成的功能性和非功能性质量,发现功能正确性仍是瓶颈,非功能性质量也需改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22518 2026-02-27 cs.SE 83%

RepoMod-Bench: A Benchmark for Code Repository Modernization via Implementation-Agnostic Testing

RepoMod-Bench: 一个通过实现无关测试进行代码仓库现代化的基准测试

Xuefeng Li, Nir Ben-Israel, Yotam Raz, Belal Ahmed, Doron Serebro, Antoine Raux

专题命中 代码评测 :repository(title,abstract);coding agent(abstract);分类 cs.SE

AI总结 RepoMod-Bench通过实现无关测试评估代码仓库现代化,揭示大规模自主现代化的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03712 2026-02-04 cs.SE 83%

SWE-Refactor: A Repository-Level Benchmark for Real-World LLM-Based Code Refactoring

SWE-Refactor:一个面向真实世界的基于大语言模型的代码重构仓库级基准

Yisen Xu, Jinqiu Yang, Tse-Hsun, Chen

专题命中 代码评测 :repository(title,abstract);code generation(abstract);分类 cs.SE

AI总结 SWE-Refactor是一个面向真实世界的基于大语言模型的代码重构仓库级基准,通过1099个Java项目中的重构实例评估九种LLMs,揭示复杂重构的失败率较高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22706 2026-02-02 cs.CR cs.SE 83%

RealSec-bench: A Benchmark for Evaluating Secure Code Generation in Real-World Repositories

RealSec-bench:一个评估现实世界仓库中安全代码生成的基准

Yanlin Wang, Ziyao Zhang, Chong Wang, Xinyi Xu, Mingwei Liu, Yong Wang, Jiachi Chen, Zibin Zheng

专题命中 代码评测 :code generation(title,abstract);repository(abstract);分类 cs.SE

AI总结 RealSec-bench是一个基于现实世界Java仓库构建的安全代码生成评估基准,通过多阶段流程和专家验证,评估5种LLM在功能正确性和安全性方面的表现。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01295 2025-03-04 cs.SE 83%

CodeArena: A Collective Evaluation Platform for LLM Code Generation

Mingzhe Du, Anh Tuan Luu, Bin Ji, Xiaobao Wu, Dong Huang, Terry Yue Zhuo, Qian Liu, See-Kiong Ng

专题命中 代码评测 :code generation(title,abstract);repository(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12902 2024-10-14 cs.LG cs.AI cs.PL cs.SE 83%

JavaBench: A Benchmark of Object-Oriented Code Generation for Evaluating Large Language Models

Jialun Cao, Zhiyong Chen, Jiarong Wu, Shing-chi Cheung, Chang Xu

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.AI、cs.LG

Comments Accepted by ASE 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06411 2026-07-21 cs.SE cs.AI cs.CL 版本更新 83%

RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications

RuBench:一个具有原生编写的俄语任务规范的仓库级智能编码基准测试

Evgeny Shilov

机构 * Independent Researcher(独立研究者)

专题命中 代码评测 :repository(title);coding agent(abstract,comments);分类 cs.SE、cs.CL、cs.AI

AI总结 RuBench 1.0是含25个俄语任务的仓库级智能编码基准测试,任务源于开源仓库修复提交,按客户请求风格编写。评估多种产品配置,报告运行结果,发现最佳配置解决78.7%任务,还发现产品替换模型问题,为智能编码评估提供新基准。

Comments 20 pages, 1 figure, 9 tables. v2 adds Round 2: Russian-market coding agents (SourceCraft CLI, Koda CLI), Antigravity with Gemini 3.1 Pro / 3.5 Flash, and Codex CLI with GPT-5.6 on the same frozen task set, plus a tool-call contamination re-audit (network + disk layers). Data, full trajectories and harness: https://github.com/eugeneshilow/rubench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12962 2026-07-15 cs.SE cs.AI cs.LG 新提交 82%

Form, Not Content? A Preregistered, Placebo-Controlled Evaluation of Learned Error-Conditioned Self-Repair Through Prompts and Weights in Frozen Small Code Models

形式而非内容?对冻结小代码模型中通过提示和权重进行的学习错误条件自修复的预注册、安慰剂对照评估

Mehmet Iscan

机构 * PythaLab, Yıldız Technical University, Istanbul, Turkey(PythaLab,Yıldız技术大学,伊斯坦布尔,土耳其)

专题命中 代码评测 :code model(title,abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 研究冻结小代码模型中错误条件自修复,引入PoPE方法,通过提示和权重通道对其评估,结果表明在提示通道内容消除形式安慰剂下解锁单元数有差异,权重通道各情况有不同表现,未确认内容归因优越性,PoPE是可重新测试的测量标准。

Comments 54 pages, 6 figures, 17 tables. Preregistered, placebo-controlled evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31511 2026-07-01 cs.SE cs.CL cs.LG 新提交 82%

Falsification, Not Exposure: An Internally Preregistered Placebo-Controlled Decomposition of Self-Repair Feedback in Frozen Small Code Models

证伪,而非暴露:冻结小代码模型中自我修复反馈的内部预注册安慰剂对照分解

Mehmet Iscan

机构 * PythaLab, Yıldız Technical University(PythaLab,伊尔迪兹技术大学)

专题命中 代码评测 :code model(title,abstract);分类 cs.SE、cs.CL、cs.LG

AI总结 通过预注册的安慰剂对照实验,分解冻结小代码模型的自我修复反馈,发现证伪(外部可执行反例)比暴露于失败代码更有效,盲重采样比裸代码重试解锁更多程序。

Comments 39 pages, 5 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16999 2026-06-16 cs.SE cs.CL cs.LG 新提交 82%

Selection Without Signal, Recovery Through Expression: A Measurement Study of Post-Hoc Falsification Operators for Frozen Small Code Models

无信号下的选择,通过表达恢复:冻结小代码模型的事后伪造操作符的测量研究

Mehmet Iscan

机构 * PythaLab, Yıldız Technical University, Istanbul, Turkey(Pytha实验室,伊兹密尔技术大学,伊斯坦布尔,土耳其)

专题命中 代码评测 :code model(title,abstract);分类 cs.SE、cs.CL、cs.LG

AI总结 本研究测量了冻结小代码模型的事后语义操作符(如选择、验证、修复)的有效性,发现它们均未优于Best-of-N,并揭示了覆盖墙、能力剪刀和共识陷阱等机制原因;而表达层恢复(M1)通过鲁棒提取和签名对齐提升了准确率。

Comments 33 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02729 2026-04-06 cs.SE cs.AI cs.CL 82%

IndustryCode: A Benchmark for Industry Code Generation

IndustryCode: 一个用于行业代码生成的基准

Puyu Zeng, Zhaoxi Wang, Zhixu Duan, Liang Feng, Shaobo Wang, Cunxiang Wang, Jinghang Wang, Bing Zhao, Hu Wei, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本文提出IndustryCode基准,涵盖125个工业挑战和579个子问题,支持多种编程语言,评估大模型在工业场景中的代码生成能力。

Comments 37 pages, 28 figures, 4 tables. Includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22237 2026-02-19 cs.CL cs.AI cs.SE 82%

FeatBench: Towards More Realistic Evaluation of Feature-level Code Generation

FeatBench: 向更真实的特征级代码生成评估迈进

Haorui Chen, Chengze Li, Jia Li

机构 * College of AI, Tsinghua University(清华大学人工智能学院) University of Electronic Science and Technology of China(电子科技大学) Nanjing University(南京大学)

专题命中 代码评测 :code generation(title);repository(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 FeatBench提出了一种新的特征级代码生成评估基准,通过真实任务输入和动态数据构建,解决现有基准的局限性,并揭示了代理在实现中的激进行为问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13921 2026-02-17 cs.LG cs.AI cs.SE 82%

GREPO: A Benchmark for Graph Neural Networks on Repository-Level Bug Localization

GREPO:图神经网络在仓库级Bug定位上的基准

Juntong Wang, Libin Chen, Xiyuan Wang, Shijia Kang, Haotong Yang, Da Zheng, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University(人工智能研究院,北京大学) School of Intelligence Science and Technology, Peking University(智能科学与技术学院,北京大学) College of Intelligence Science and Technology, National University of Defense Technology(智能科学与技术学院,国防科技大学)

专题命中 代码评测 :repository(title,abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 GREPO是首个用于仓库级Bug定位的GNN基准,包含86个Python仓库和47294个Bug修复任务,展示了GNN在Bug定位中的优越性能。

Comments 46 pages, 14figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02060 2026-01-06 cs.PL cs.AI cs.SE 82%

Perish or Flourish? A Holistic Evaluation of Large Language Models for Code Generation in Functional Programming

perish 或 flourish? 对于函数式编程中代码生成的大型语言模型的全面评估

Nguyet-Anh H. Lang, Eric Lang, Thanh Le-Cong, Bach Le, Quyet-Thang Huynh

机构 * Hanoi University of Science and Technology(河内科学技术大学) The University of Melbourne(墨尔本大学)

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.AI、cs.PL

AI总结 本文提出FPEval框架,评估大型语言模型在函数式编程语言中的代码生成能力,发现模型性能随进步而提升,但纯函数式语言错误率较高,且生成代码风格问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17744 2025-12-17 cs.SE cs.AI cs.CL 82%

RepoTransBench: A Real-World Multilingual Benchmark for Repository-Level Code Translation

RepoTransBench: 一个面向真实世界的多语言代码仓库翻译基准

Yanli Wang, Yanlin Wang, Suiquan Wang, Daya Guo, Jiachi Chen, John Grundy, Xilin Liu, Yuchi Ma, Mingzhi Mao, Hongyu Zhang, Zibin Zheng

机构 * Sun Yat-sen University, China(中山大学) Monash University, Australia(墨尔本大学) Huawei Cloud Computing Technologies Co., Ltd, China(华为云计算技术有限公司) Chongqing University, China(重庆大学)

专题命中 代码评测 :repository(title,abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 RepoTransBench提出一个现实世界多语言代码仓库翻译基准,评估代码仓库级翻译的挑战,揭示不同语言对方向的翻译难度差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05040 2025-11-10 cs.CL cs.AI cs.SE 82%

UA-Code-Bench: A Competitive Programming Benchmark for Evaluating LLM Code Generation in Ukrainian

Mykyta Syromiatnikov, Victoria Ruvinskaya

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.AI

Comments 8 pages, 5 figures. XI International conference "Informatics. Culture. Technique." (2025)

Journal ref XI International conference "Informatics. Culture. Technique." (2025) 308-314

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00865 2025-03-25 cs.SE cs.AI cs.CL 82%

Demo-Craft: Using In-Context Learning to Improve Code Generation in Large Language Models

Nirmal Joshua Kapu, Mihit Sreejith

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.AI

Comments Accepted at IEEE ICIITCEE 2025. Presented on 16th January 2025 in Bengaluru, India

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08200 2025-01-15 cs.SE cs.CL cs.LG 82%

CWEval: Outcome-driven Evaluation on Functionality and Security of LLM Code Generation

Jinjun Peng, Leyi Cui, Kele Huang, Junfeng Yang, Baishakhi Ray

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.LG

Comments to be published in LLM4Code 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.16458 2024-05-22 cs.LG cs.AI cs.CL 82%

BioCoder: A Benchmark for Bioinformatics Code Generation with Large Language Models

Xiangru Tang, Bill Qian, Rick Gao, Jiakang Chen, Xinyun Chen, Mark Gerstein

专题命中 代码评测 :code generation(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16694 2024-03-26 cs.CL cs.PL cs.SE 82%

HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language Generalization

Qiwei Peng, Yekun Chai, Xuhong Li

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.PL

Comments LREC-COLING 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.01210 2023-11-01 cs.SE cs.CL cs.LG 82%

Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Jiawei Liu, Chunqiu Steven Xia, Yuyao Wang, Lingming Zhang

专题命中 代码评测 :code generation(title);program synthesis(abstract);分类 cs.SE、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏