arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1721 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 1721 篇

2603.26337 2026-08-12 cs.SE 版本更新 79%

RACE-Bench: A Reasoning-Augmented Benchmark for Repository-Level Code Agents on Feature Addition

一个用于评估具有中间推理的仓库级代码代理的基准测试:在特性添加任务上

Shuhan Liu, Zhiyi Zhao, Xing Hu, Kui Liu, Xiaohu Yang, Xin Xia

专题命中 代码评测 :repository(title,abstract);分类 cs.SE

AI总结 本文提出RACE-bench基准,用于评估仓库级代码代理在特性添加任务中的推理能力,通过执行补丁验证和结构化中间推理地面真相,分析代理的推理质量与实现步骤转换性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13995 2026-06-15 cs.CL 新提交 79%

Dialogue SWE-Bench: A Benchmark for Dialogue-Driven Coding Agents

Dialogue SWE-Bench: 对话驱动的编码智能体基准

Brendan King, Jeffrey Flanigan

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 代码评测 :coding agent(title,abstract);分类 cs.CL

AI总结 提出Dialogue SWE-Bench基准,通过用户模拟器评估编码智能体在对话中解决软件工程问题的能力,并引入模式引导智能体提升对话性能3-14%。

Comments 22 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13141 2026-05-14 cs.SE 79%

UIBenchKit: A unified toolkit for design-to-code model evaluation

UIBenchKit:一个统一的用于设计到代码模型评估的工具包

Chinh T. Le, Trevor Ong Yee Siang, Jingyu Xiao, Yuxuan Wan, Yintong Huo

专题命中 代码评测 :code model(title);code generation(abstract);分类 cs.SE

AI总结 本文提出UIBenchKit,一个统一的工具包,用于评估设计到代码任务,提供一致的环境和分析接口,推动网页工程的基准测试和创新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29852 2026-04-01 cs.GR cs.AI cs.CV 79%

VectorGym: A Multitask Benchmark for SVG Code Generation, Sketching, and Editing

VectorGym:一个多任务基准用于SVG代码生成、草图和编辑

Juan Rodriguez, Haotian Zhang, Abhay Puri, Tianyang Zhang, Rishav Pramanik, Meng Lin, Xiaoqing Xie, Marco Terral, Darsh Kaushik, Aly Shariff, Perouz Taslakian, Spandana Gella, Sai Rajeswar, David Vazquez, Christopher Pal, Marco Pedersoli

机构 * ServiceNow Research(ServiceNow 研究院) Mila, Quebec AI Institute(Mila 魁北克人工智能研究所) Columbia University(哥伦比亚大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Stony Brook University(石溪大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Minzu University of China(中央民族大学) University of Waterloo(滑铁卢大学) Canada CIFAR AI Chair(加拿大 CIFAR 人工智能讲席) Computer Vision Center(计算机视觉中心)

专题命中 代码评测 :code generation(title,abstract);分类 cs.AI

AI总结 VectorGym提出一个涵盖SVG生成、复杂编辑和视觉理解的多任务基准,通过专家标注解决现有基准的不足,采用多任务强化学习方法,训练出性能领先的Qwen3-VL模型,公开可用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25804 2026-03-30 cs.CL 79%

RealChart2Code: Advancing Chart-to-Code Generation with Real Data and Multi-Task Evaluation

RealChart2Code:通过真实数据和多任务评估推进图表到代码生成

Jiajun Zhang, Yuying Li, Zhixun Li, Xingyu Guo, Jingzhuo Wu, Leqi Zheng, Yiran Yang, Jianke Zhang, Qingbin Li, Shannan Yan, Zhetong Li, Changguo Jia, Junfei Wu, Zilei Wang, Qiang Liu, Liang Wang

机构 * USTC(中国科学技术大学) THU(清华大学) CUHK(香港中文大学) UCAS(中国科学院大学) CASIA(中国科学院自动化研究所) BNU(北京师范大学) BUPT(北京邮电大学) BIT(北京理工大学) PKU(北京大学)

专题命中 代码评测 :code generation(title,abstract);分类 cs.CL

AI总结 本文提出RealChart2Code基准,通过真实数据和多任务评估,评估VLMs在复杂图表生成中的性能,揭示其在多面板图表上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06358 2026-03-09 cs.SE 79%

A Scalable Benchmark for Repository-Oriented Long-Horizon Conversational Context Management

面向仓库的长 horizon 对话上下文管理可扩展基准

Yang Liu, Li Zhang, Fang Liu, Ping Lin, Xinyi Li

专题命中 代码评测 :repository(title,abstract);分类 cs.SE

AI总结 本文提出LoCoEval,首个面向仓库开发场景的长 horizon 对话上下文管理基准,评估了多种方法并提出改进方案,提升了代码助手在复杂对话中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04449 2026-02-05 cs.SE 79%

What's in a Benchmark? The Case of SWE-Bench in Automated Program Repair

基准中有什么?SWE-Bench在自动程序修复中的案例

Matias Martinez, Xavier Franch

专题命中 代码评测 :program repair(title,abstract);分类 cs.SE

AI总结 本文研究了SWE-Bench排行榜上的提交来源、LLM使用情况及行业参与度,揭示了专有LLM在自动程序修复中的主导地位。

Comments Accepted in 2026 IEEE/ACM 48th International Conference on Software Engineering (ICSE-SEIP'26). https://doi.org/10.1145/3786583.3786904

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23824 2026-01-14 cs.SE 79%

SolContractEval: A Benchmark for Evaluating Contract-Level Solidity Code Generation

SolContractEval: 一个用于评估合同级Solidity代码生成的基准

Zhifan Ye, Jiachi Chen, Zhenzhe Shao, Lingfeng Bao, Xiaohu Yang, Zhongxin Liu

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE

AI总结 SolContractEval是一个用于评估Solidity代码生成的合同级基准,发现Claude-3.7-Sonnet在整体表现最佳,但模型在复杂逻辑和Solidity特定功能上仍有不足。

Comments Accepted by ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15621 2025-11-18 cs.SE 79%

DSCodeBench: A Realistic Benchmark for Data Science Code Generation

Shuyin Ouyang, Dong Huang, Jingwen Guo, Zeyu Sun, Qihao Zhu, Jie M. Zhang

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08127 2025-11-12 cs.SE 79%

A Small Leak Sinks All: Exploring the Transferable Vulnerability of Source Code Models

Weiye Li, Wenyi Tang

专题命中 代码评测 :code model(title,abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11334 2025-10-07 cs.AI 79%

Program Synthesis Benchmark for Visual Programming in XLogoOnline Environment

Chao Wen, Jacqueline Staub, Adish Singla

专题命中 代码评测 :program synthesis(title,abstract);分类 cs.AI

Comments ACL'25 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15804 2025-06-18 cs.SE 79%

CodeImprove: Program Adaptation for Deep Code Models

Ravishka Rathnasuriya, Zijie Zhao, Wei Yang

专题命中 代码评测 :code model(title,abstract);分类 cs.SE

Comments In Proceedings of the 47th IEEE/ACM International Conference on Software Engineering (ICSE 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10995 2025-06-16 cs.SE 79%

Evaluating Small-Scale Code Models for Code Clone Detection

Jorge Martinez-Gil

专题命中 代码评测 :code model(title,abstract);分类 cs.SE

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10365 2025-06-13 cs.SE 79%

AutoGEEval++: A Multi-Level and Multi-Geospatial-Modality Automated Evaluation Framework for Large Language Models in Geospatial Code Generation on Google Earth Engine

Shuyang Hou, Zhangxiao Shen, Huayi Wu, Haoyue Jiao, Ziqi Liu, Lutong Xie, Chang Liu, Jianyuan Liang, Yaxian Qing, Xiaopu Zhang, Dehua Peng, Zhipeng Gui, Xuefeng Guan

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15037 2025-05-19 cs.CL 79%

mHumanEval -- A Multilingual Benchmark to Evaluate Large Language Models for Code Generation

Nishat Raihan, Antonios Anastasopoulos, Marcos Zampieri

专题命中 代码评测 :code generation(title,abstract);分类 cs.CL

Comments 30 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06774 2025-05-13 cs.SE 79%

The First Prompt Counts the Most! An Evaluation of Large Language Models on Iterative Example-Based Code Generation

Yingjie Fu, Bozhou Li, Linyi Li, Wentao Zhang, Tao Xie

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE

Comments Accepted by ISSTA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02133 2025-05-06 cs.SE 79%

Enhancing LLM Code Generation: A Systematic Evaluation of Multi-Agent Collaboration and Runtime Debugging for Improved Accuracy, Reliability, and Latency

Nazmus Ashrafi, Salah Bouktif, Mohammed Mediani

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15122 2025-02-24 cs.LG 79%

MONSTER: Monash Scalable Time Series Evaluation Repository

Angus Dempster, Navid Mohammadi Foumani, Chang Wei Tan, Lynn Miller, Amish Mishra, Mahsa Salehi, Charlotte Pelletier, Daniel F. Schmidt, Geoffrey I. Webb

专题命中 代码评测 :repository(title,abstract);分类 cs.LG

Comments 45 pages; 38 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02827 2025-02-06 cs.SE 79%

COFFE: A Code Efficiency Benchmark for Code Generation

Yun Peng, Jun Wan, Yichen Li, Xiaoxue Ren

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE

Comments This paper has been accepted by FSE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04329 2024-11-14 cs.CL 79%

CodeTree: Agent-guided Tree Search for Code Generation with Large Language Models

Jierui Li, Hung Le, Yingbo Zhou, Caiming Xiong, Silvio Savarese, Doyen Sahoo

专题命中 代码评测 :code generation(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07565 2024-10-04 cs.CL 79%

On Leakage of Code Generation Evaluation Datasets

Alexandre Matton, Tom Sherborne, Dennis Aumiller, Elena Tommasone, Milad Alizadeh, Jingyi He, Raymond Ma, Maxime Voisin, Ellen Gilsenan-McMahon, Matthias Gallé

专题命中 代码评测 :code generation(title,abstract);分类 cs.CL

Comments EMNLP 2024 Findings. 5 main pages, 9 in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.13178 2024-09-23 cs.SE 79%

A Systematic Evaluation of Large Code Models in API Suggestion: When, Which, and How

Chaozheng Wang, Shuzheng Gao, Cuiyun Gao, Wenxuan Wang, Chun Yong Chong, Shan Gao, Michael R. Lyu

专题命中 代码评测 :code model(title,abstract);分类 cs.SE

Comments This paper is accepted in ASE 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10280 2024-09-17 cs.SE 79%

ComplexCodeEval: A Benchmark for Evaluating Large Code Models on More Complex Code

Jia Feng, Jiachen Liu, Cuiyun Gao, Chun Yong Chong, Chaozheng Wang, Shan Gao, Xin Xia

专题命中 代码评测 :code model(title);code generation(abstract);分类 cs.SE

Comments Accepted by the 39th IEEE/ACM International Conference on Automated Software Engineering (ASE 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11160 2024-08-30 cs.AI 79%

Low-Cost Language Models: Survey and Performance Evaluation on Python Code Generation

Jessica López Espejel, Mahaman Sanoussi Yahaya Alassan, Merieme Bouhandi, Walid Dahhane, El Hassane Ettifouri

专题命中 代码评测 :code generation(title,abstract);分类 cs.AI

Comments Under review at Elsevier's Engineering Applications of Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.01250 2023-06-05 cs.SE 79%

Active Code Learning: Benchmarking Sample-Efficient Training of Code Models

Qiang Hu, Yuejun Guo, Xiaofei Xie, Maxime Cordy, Lei Ma, Mike Papadakis, Yves Le Traon

专题命中 代码评测 :code model(title,abstract);分类 cs.SE

Comments 12 pages, ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.08388 2023-02-08 cs.CL 79%

MCoNaLa: A Benchmark for Code Generation from Multiple Natural Languages

Zhiruo Wang, Grace Cuenca, Shuyan Zhou, Frank F. Xu, Graham Neubig

专题命中 代码评测 :code generation(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.10397 2022-11-24 cs.CL cs.AI cs.PL cs.SE 79%

CodeT: Code Generation with Generated Tests

Bei Chen, Fengji Zhang, Anh Nguyen, Daoguang Zan, Zeqi Lin, Jian-Guang Lou, Weizhu Chen

专题命中 代码评测 :code generation(title);分类 cs.SE、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.06164 2022-10-12 cs.PL 79%

Metric Program Synthesis

John Feser, Isil Dillig, Armando Solar-Lezama

专题命中 代码评测 :program synthesis(title,abstract);分类 cs.PL

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.13179 2022-07-22 cs.SE 79%

AixBench: A Code Generation Benchmark Dataset

Yiyang Hao, Ge Li, Yongqiang Liu, Xiaowei Miao, He Zong, Siyuan Jiang, Yang Liu, He Wei

专题命中 代码评测 :code generation(title,abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.10168 2021-08-24 cs.AI 79%

CGEMs: A Metric Model for Automatic Code Generation using GPT-3

Aishwarya Narasimhan, Krishna Prasad Agara Venkatesha Rao, Veena M B

专题命中 代码评测 :code generation(title,abstract);分类 cs.AI

Comments 11 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏