arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1721 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 1721 篇

2003.11768 2023-06-21 cs.LG cs.AI cs.SE stat.ML 82%

On-the-Fly Adaptation of Source Code Models using Meta-Learning

Disha Shrivastava, Hugo Larochelle, Daniel Tarlow

专题命中 代码评测 :code model(title,abstract);分类 cs.SE、cs.AI、cs.LG

Comments This paper has been withdrawn because we found a bug in the FOMAML implementation that invalidates some of the key claims in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.10264 2022-12-21 cs.LG cs.CL cs.SE 82%

ReCode: Robustness Evaluation of Code Generation Models

Shiqi Wang, Zheng Li, Haifeng Qian, Chenghao Yang, Zijian Wang, Mingyue Shang, Varun Kumar, Samson Tan, Baishakhi Ray, Parminder Bhatia, Ramesh Nallapati, Murali Krishna Ramanathan, Dan Roth, Bing Xiang

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.CL、cs.LG

Comments Code and data available at https://github.com/amazon-science/recode

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00267 2026-08-04 cs.SE cs.CL 新提交 81%

LoopsBench: From Harness Engineering to Loop Engineering in Coding Agent Evaluation

LoopsBench:在基准测试编码智能体中从 harness 工程转向 loop 工程

Han Li, Zhemin Fang, Rili Feng, Yingqi Zhao, Jiaheng Liu, Pengfei Gao, He Ye, Dayi Lin, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

专题命中 代码评测 :coding agent(title,abstract);分类 cs.SE、cs.CL

AI总结 该研究针对编码智能体基准测试中持续执行洞察不足的问题,推出长周期基准 LoopsBench,含112个多领域任务,评估得最强配置解决25%任务,开源相关数据代码。

Comments Project page: https://loopsbench.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26144 2026-06-24 cs.SE cs.AI cs.CV 版本更新 81%

VISTA: An End-to-End Benchmark for Visual Spec-to-Web-App Coding Agents

VISTA:面向视觉规格到网页应用编码智能体的端到端基准

JunJia Guo, Yuhang Yao, Jiawei, Zhou, Jingdi Chen

机构 * University of Arizona(亚利桑那大学) Zoom Stony Brook University(石溪大学)

专题命中 代码评测 :coding agent(title);code generation(abstract);分类 cs.SE、cs.AI

AI总结 提出VISTA基准,通过多维度输入条件和评估指标,衡量基于LLM的智能体从视觉规格生成功能完整、视觉一致的网页应用的能力。

Comments Project page: https://kaboider.github.io/VIS_APP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14516 2026-06-15 cs.AI cs.CL cs.CY 新提交 81%

Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results

Every Eval Ever:AI评估结果的统一模式与社区仓库

Jan Batzner, Sree Harsha Nelaturu, Damian Stachura, Anastassia Kornilova, Jon Crall, Tommaso Cerruti, Yanan Long, Yifan Mai, Sanchit Ahuja, Asaf Yehudai, Marek Šuppa, John P. Lalor, Oluwagbemike Olowe, Jatin Ganhotra, Brian H. Hu, Eliya Habba, Andrew M. Bean, Chang Liu, Sander Land, Steven Dillmann, Aniketh Garikaparthi, Elron Bandel, Saki Imai, James Edgell, Wm. Matthew Kennedy, Jenny Chim, Patrick Meusling, Asteria Kaeberlein, Venkata Ramachandra Karthik Chundi, Manasi Patwardhan, Martin Ku, Austin Meek, Leon Knauer, Brian Wingenroth, Srishti Yadav, Usman Gohar, Felix Friedrich, Michelle Lin, Jennifer Mickel, Arman Cohan, Stella Biderman, Irene Solaiman, Zeerak Talat, Anka Reuel, Mubashara Akhtar, Gjergji Kasneci, Avijit Ghosh, Leshem Choshen

机构 * Technical University Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Weizenbaum Institute(魏岑鲍姆研究所) Zuse Institute Berlin(柏林祖泽研究所) Evidence Prime Trustible Kitware ETH Zurich(苏黎世联邦理工学院) StickFlux Labs Stanford University(斯坦福大学) Northeastern University(东北大学) IBM Research(IBM研究院) Comenius University Bratislava(布拉迪斯拉发夸美纽斯大学) Cisco(思科) University of Notre Dame(圣母大学) Hebrew University of Jerusalem(耶路撒冷希伯来大学) University of Oxford(牛津大学) Ohio University(俄亥俄大学) Writer TCS Research(塔塔咨询服务研究院) Oxford University Press(牛津大学出版社) Queen Mary University of London(伦敦玛丽女王大学) Technical University Berlin(柏林工业大学) University of Delaware(特拉华大学) Cinemo Johns Hopkins University(约翰霍普金斯大学) University of Copenhagen(哥本哈根大学) ELLIS(欧洲学习与智能系统实验室) Iowa State University(爱荷华州立大学) Meta FAIR University of Montreal(蒙特利尔大学) Mila Quebec AI Institute(Mila魁北克人工智能研究所) EleutherAI Yale University(耶鲁大学) Hugging Face University of Edinburgh(爱丁堡大学) Harvard University(哈佛大学) ETH AI Center(ETH人工智能中心) MIT(麻省理工学院) MIT-IBM Watson Lab(MIT-IBM沃森实验室)

专题命中 代码评测 :repository(title,abstract);分类 cs.CL、cs.AI

AI总结 针对AI评估结果格式不统一、难以比较的问题,提出首个共享模式与社区众包仓库,通过标准化表示、自动转换器和社区数据库实现跨评估框架的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12047 2026-04-21 cs.AI cs.SE 81%

ContractEval: A Benchmark for Evaluating Contract-Satisfying Assertions in Code Generation

ContractEval:一个用于评估代码生成中合同满足断言的基准测试

Soohan Lim, Joonghyuk Hahn, Hyunwoo Park, Sang-Ki Ko, Yo-Sub Han

机构 * Yonsei University(延世大学) University of Seoul(首尔大学)

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.AI

AI总结 ContractEval通过显式陈述合同,评估生成代码是否满足合同要求,揭示当前LLM在合同满足上的不足。

Comments 18 pages, 10 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26137 2026-03-30 cs.SE cs.AI 81%

ATime-Consistent Benchmark for Repository-Level Software Engineering Evaluation

面向仓库级别的软件工程评估的时间一致性基准

Xianpeng, Sun, Haonan Sun, Tian Yu, Sheng Ma, Qincheng Zhang, Lifei Rao, Chen Tian

专题命中 代码评测 :repository(title,abstract);分类 cs.SE、cs.AI

AI总结 本文提出时间一致性基准方法,通过冻结仓库时间点并利用历史代码知识评估未来任务,展示提示构造对软件工程评估的重要性。

Comments 10 pages, 10 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06251 2026-03-17 cs.SE cs.AI 81%

DesignBench: A Comprehensive Benchmark for MLLM-based Front-end Code Generation

DesignBench: 一个全面的基于MLLM的前端代码生成基准测试

Jingyu Xiao, Ming Wang, Man Ho Lam, Yuxuan Wan, Junliang Liu, Yintong Huo, Michael R. Lyu

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.AI

AI总结 DesignBench针对MLLM在前端工程中的应用,提出多框架、多任务的评估基准,涵盖生成、编辑和修复三个任务,通过900个网页样本分析模型性能,揭示框架特定限制和任务瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03708 2026-02-03 cs.PL cs.AI 81%

MHRC-Bench: A Multilingual Hardware Repository-Level Code Completion benchmark

MHRC-Bench: 一个多语言硬件仓库级代码补全基准

Qingyun Zou, Jiahao Cui, Nuo Chen, Bingsheng He, Weng-Fai Wong

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 代码评测 :repository(title,abstract);分类 cs.AI、cs.PL

AI总结 MHRC-Bench是首个多语言硬件仓库级代码补全基准,涵盖三种硬件设计编码风格,通过代码结构和硬件导向语义标签进行补全任务评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04952 2025-09-30 cs.CL cs.SE 81%

ArtifactsBench: Bridging the Visual-Interactive Gap in LLM Code Generation Evaluation

Chenchen Zhang, Yuhang Li, Can Xu, Jiaheng Liu, Ao Liu, Changzhi Zhou, Ken Deng, Dengpeng Wu, Guanhua Huang, Kejiao Li, Qi Yi, Ruibin Xiong, Shihui Hu, Yue Zhang, Yuhao Jiang, Zenan Xu, Yuanxing Zhang, Wiggin Zhou, Chayse Zhou, Fengzong Lian

机构 * Tencent Hunyuan Team(腾讯文脉团队)

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18993 2025-09-16 cs.SE cs.AI 81%

GitTaskBench: A Benchmark for Code Agents Solving Real-World Tasks Through Code Repository Leveraging

Ziyi Ni, Huacan Wang, Shuo Zhang, Shuo Lu, Ziyang He, Wang You, Zhenheng Tang, Yuntao Du, Bill Sun, Hongzhang Liu, Sen Hu, Ronghao Chen, Bo Li, Xin Li, Chen Hu, Binxing Jiao, Daxin Jiang, Pin Lyu

机构 * UCAS(中国科学技术大学) CASIA(中国科学院自动化研究所) BUPT(北京理工大学) NUS(新加坡国立大学) StepFun HKUST(香港理工大学) SDU(山东大学) PINAI USYD(悉尼大学) PKU(北京大学) USTC(中国科学技术大学)

专题命中 代码评测 :repository(title,abstract);分类 cs.SE、cs.AI

Comments Highly practical, Well-motivated, Actionable

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20439 2025-07-29 cs.SE cs.AI 81%

When Prompts Go Wrong: Evaluating Code Model Robustness to Ambiguous, Contradictory, and Incomplete Task Descriptions

Maya Larbi, Amal Akli, Mike Papadakis, Rihab Bouyousfi, Maxime Cordy, Federica Sarro, Yves Le Traon

机构 * University of Luxembourg(卢森堡大学) University College London(伦敦大学学院)

专题命中 代码评测 :code model(title);code generation(abstract);分类 cs.SE、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18789 2025-06-11 cs.SE cs.CL 81%

From Output to Evaluation: Does Raw Instruction-Tuned Code LLMs Output Suffice for Fill-in-the-Middle Code Generation?

Wasi Uddin Ahmad, Somshubra Majumdar, Boris Ginsburg

机构 * NVIDIA Santa Clara, CA 95051, USA(NVIDIA Santa Clara 分部)

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.CL

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07010 2025-06-03 cs.SE cs.CL 81%

ProjectEval: A Benchmark for Programming Agents Automated Evaluation on Project-Level Code Generation

Kaiyuan Liu, Youcheng Pan, Yang Xiang, Daojing He, Jing Li, Yexing Du, Tianrun Gao

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室)

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.CL

Comments 17 pages (9 Appendix pages), 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10452 2025-05-30 cs.CL cs.AI 81%

DynaCode: A Dynamic Complexity-Aware Code Benchmark for Evaluating Large Language Models in Code Generation

Wenhao Hu, Jinhao Duan, Chunchen Wei, Li Zhang, Yue Zhang, Kaidi Xu

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Drexel University(德雷塞尔大学)

专题命中 代码评测 :code generation(title,abstract);分类 cs.CL、cs.AI

Comments 18 pages, 13 figures. Accepted to the ACL 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09027 2025-05-15 cs.SE cs.AI 81%

Tests as Prompt: A Test-Driven-Development Benchmark for LLM Code Generation

Yi Cui

机构 * ONEKQ Lab, USA(ONEKQ实验室)

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.AI

Comments arXiv admin note: text overlap with arXiv:2409.05177

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07701 2025-03-12 cs.SE cs.AI 81%

Automated Benchmark Generation for Repository-Level Coding Tasks

Konstantinos Vergopoulos, Mark Niklas Müller, Martin Vechev

专题命中 代码评测 :repository(title,abstract);分类 cs.SE、cs.AI

Comments Accepted at DL4C@ICLR'25 and FMWild@ICLR'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03806 2025-02-07 cs.SE cs.LG 81%

Should Code Models Learn Pedagogically? A Preliminary Evaluation of Curriculum Learning for Real-World Software Engineering Tasks

Kyi Shin Khant, Hong Yi Lin, Patanamon Thongtanunam

专题命中 代码评测 :code model(title,abstract);分类 cs.SE、cs.LG

Comments Accepted by the 22nd International Conference on Mining Software Repositories (MSR 25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16050 2025-01-28 cs.SE cs.AI 81%

Skeleton-Guided-Translation: A Benchmarking Framework for Code Repository Translation with Fine-Grained Quality Evaluation

Xing Zhang, Jiaheng Wen, Fangkai Yang, Pu Zhao, Yu Kang, Junhao Wang, Maoquan Wang, Yufan Huang, Elsie Nallipogu, Qingwei Lin, Yingnong Dang, Saravan Rajmohan, Dongmei Zhang, Qi Zhang

专题命中 代码评测 :repository(title,abstract);分类 cs.SE、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.21199 2025-01-03 cs.SE cs.CL 81%

HumanEval Pro and MBPP Pro: Evaluating Large Language Models on Self-invoking Code Generation

Zhaojian Yu, Yilun Zhao, Arman Cohan, Xiao-Ping Zhang

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22821 2024-10-31 cs.CL cs.SE 81%

EvoCodeBench: An Evolving Code Generation Benchmark with Domain-Specific Evaluations

Jia Li, Ge Li, Xuanming Zhang, Yunfei Zhao, Yihong Dong, Zhi Jin, Binhua Li, Fei Huang, Yongbin Li

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.CL

Comments Accepted by the 38th Conference on Neural Information Processing Systems (NeurIPS 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07331 2024-10-14 cs.CL cs.AI 81%

DA-Code: Agent Data Science Code Generation Benchmark for Large Language Models

Yiming Huang, Jianwen Luo, Yan Yu, Yitong Zhang, Fangyu Lei, Yifan Wei, Shizhu He, Lifu Huang, Xiao Liu, Jun Zhao, Kang Liu

专题命中 代码评测 :code generation(title,abstract);分类 cs.CL、cs.AI

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13204 2024-08-26 cs.AI cs.SE 81%

DOMAINEVAL: An Auto-Constructed Benchmark for Multi-Domain Code Generation

Qiming Zhu, Jialun Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun, Shing-Chi Cheung

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12635 2024-06-19 cs.SE cs.AI 81%

ScenEval: A Benchmark for Scenario-Based Evaluation of Code Generation

Debalina Ghosh Paul, Hong Zhu, Ian Bayley

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.AI

Comments Accepted for publication in the conference proceedings of IEEE AITest 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03130 2024-06-19 cs.SE cs.AI 81%

User Centric Evaluation of Code Generation Tools

Tanha Miah, Hong Zhu

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.AI

Comments The paper is accepted by IEEE AITest 2024 at IEEE CISOSE 2024 Congress as an invited paper, and will appear in the AITest 2024 Conference Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.01861 2023-08-15 cs.CL cs.AI 81%

ClassEval: A Manually-Crafted Benchmark for Evaluating LLMs on Class-level Code Generation

Xueying Du, Mingwei Liu, Kaixin Wang, Hanlin Wang, Junwei Liu, Yixuan Chen, Jiayi Feng, Chaofeng Sha, Xin Peng, Yiling Lou

专题命中 代码评测 :code generation(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.14868 2023-03-30 cs.LG cs.CL 81%

Multi-lingual Evaluation of Code Generation Models

Ben Athiwaratkun, Sanjay Krishna Gouda, Zijian Wang, Xiaopeng Li, Yuchen Tian, Ming Tan, Wasi Uddin Ahmad, Shiqi Wang, Qing Sun, Mingyue Shang, Sujan Kumar Gonugondla, Hantian Ding, Varun Kumar, Nathan Fulton, Arash Farahani, Siddhartha Jain, Robert Giaquinto, Haifeng Qian, Murali Krishna Ramanathan, Ramesh Nallapati, Baishakhi Ray, Parminder Bhatia, Sudipta Sengupta, Dan Roth, Bing Xiang

专题命中 代码评测 :code generation(title,abstract);分类 cs.CL、cs.LG

Comments Code and data release: https://github.com/amazon-research/mxeval

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.11501 2022-11-22 cs.SE cs.CL 81%

DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation

Yuhang Lai, Chengxi Li, Yiming Wang, Tianyi Zhang, Ruiqi Zhong, Luke Zettlemoyer, Scott Wen-tau Yih, Daniel Fried, Sida Wang, Tao Yu

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.14751 2020-12-01 cs.SE cs.PL 81%

Toward a Benchmark Repository for Software Maintenance Tool Evaluations with Humans

Matúš Sulír

专题命中 代码评测 :repository(title,abstract);分类 cs.SE、cs.PL

Journal ref Proceedings of the 2019 ACM SIGPLAN International Conference on Systems, Programming, Languages, and Applications: Software for Humanity (SPLASH Companion '19), ACM, 2019, pp. 7-8

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14852 2024-02-26 cs.CL cs.AI cs.LG 80%

HumanEval on Latest GPT Models -- 2024

Daniel Li, Lincoln Murr

专题命中 代码评测 :code generation(abstract);repository(abstract);program synthesis(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏