arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1721 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 1721 篇

2607.26117 2026-07-30 cs.SE cs.AI cs.LG 新提交 78%

Try Again, Don't Look Back: Blind Resampling Outperforms Self-Repair in Small Code Models

再试一次,不要回头:小型代码模型中盲重采样优于自我修复

Yuvraj Verma

专题命中 代码评测 :code model(title);分类 cs.SE、cs.AI、cs.LG

AI总结 该研究针对MBPP+数据集在三种规模代码模型上发现,盲重采样在7B以下表现最优,成本远低于其他重试方法,而基于自身失败尝试的自我修复存在锚定效应导致的性能损失。

Comments Code, pre-registrations and run traces: https://github.com/vermayuvraj/self-improving-agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06624 2026-07-15 cs.AI cs.LG cs.SE 版本更新 78%

AgentLens: Production-Assessed Trajectory Reviews for Coding Agent Evaluation

AgentLens:用于编码智能体评估的生产评估轨迹审查

Andrey Podivilov, Vadim Lomshakov, Sergey Savin, Matvei Startsev, Roman Pozharskiy, Maksim Parshin, Sergey Nikolenko

机构 * Explyt St. Petersburg Department of the Steklov Institute of Mathematics(圣彼得堡斯捷克洛夫数学研究所圣彼得堡分部) St. Petersburg State University(圣彼得堡国立大学)

专题命中 代码评测 :coding agent(title);分类 cs.SE、cs.AI、cs.LG

AI总结 介绍用于编码智能体评估的AgentLens基准,结合形式验证、大语言模型编写的轨迹审查和并排比较来评估智能体整个轨迹,不仅能排名,还可用于诊断模型行为、比较智能体版本及发现产品回归问题,且已开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07379 2026-06-09 cs.LG cs.AI cs.CL stat.ME 版本更新 78%

Do Coding Agents Deceive Us? Detecting and Preventing Cheating via Capped Evaluation with Randomized Tests

编码智能体会欺骗我们吗?通过带随机测试的上限评估检测和防止作弊

Thanawat Lodkaew, Johannes Ackermann, Soichiro Nishimori, Nontawat Charoenphakdee, Masashi Sugiyama, Takashi Ishida

机构 * The University of Tokyo(东京大学) RIKEN(理化学研究所)

专题命中 代码评测 :coding agent(title);分类 cs.CL、cs.AI、cs.LG

AI总结 提出CapCode框架,通过设置上限评估检测模型在编码任务中的作弊行为,并设计CapReward奖励机制防止作弊,实验表明该方法能有效检测和减少作弊。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17508 2026-03-24 cs.CV 78%

Omni-I2C: A Holistic Benchmark for High-Fidelity Image-to-Code Generation

Omni-I2C:一个全面的图像到代码生成基准测试

Jiawei Zhou, Chi Zhang, Xiang Feng, Qiming Zhang, Haibo Qiu, Lihuo He, Dengpan Ye, Xinbo Gao, Jing Zhang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Independent Researcher(独立研究者) Xidian University(西安电子科技大学) Guangzhou University(广州大学)

专题命中 代码评测 :code generation(title,abstract)

AI总结 本文提出Omni-I2C基准测试,评估大多模态模型将复杂数字图形转化为可执行代码的能力,揭示当前模型在视觉感知与生成表达方面的协同挑战及性能差距。

Comments 35 pages, 26 figures, change authors' information in page 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22908 2025-09-30 cs.SE cs.LG cs.PL 78%

A benchmark for vericoding: formally verified program synthesis

Sergiu Bursuc, Theodore Ehrenborg, Shaowei Lin, Lacramioara Astefanoaei, Ionel Emilian Chiosa, Jure Kukovec, Alok Singh, Oliver Butterley, Adem Bizid, Quinn Dougherty, Miranda Zhao, Max Tan, Max Tegmark

专题命中 代码评测 :program synthesis(title);分类 cs.SE、cs.LG、cs.PL

Comments 25 pages, 1 figure; data available at https://github.com/Beneficial-AI-Foundation/vericoding-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20938 2025-09-08 cs.DC 78%

ParEval-Repo: A Benchmark Suite for Evaluating LLMs with Repository-level HPC Translation Tasks

Joshua H. Davis, Daniel Nichols, Ishan Khillan, Abhinav Bhatele

专题命中 代码评测 :repository(title,abstract)

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16763 2025-08-26 cs.CV 78%

WebMMU: A Benchmark for Multimodal Multilingual Website Understanding and Code Generation

Rabiul Awal, Mahsa Massoud, Aarash Feizi, Zichao Li, Suyuchen Wang, Christopher Pal, Aishwarya Agrawal, David Vazquez, Siva Reddy, Juan A. Rodriguez, Perouz Taslakian, Spandana Gella, Sai Rajeswar

机构 * ServiceNow Mila Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) École de Technologie Supérieure (ETS)(高等技术学院) Polytechnique Montréal(蒙特利尔理工学院)

专题命中 代码评测 :code generation(title,abstract)

Comments This paper has been accepted to the EMNLP 2025 main conference. Check the project page here: https://webmmu-paper.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11014 2025-07-16 cs.NI 78%

SIMCODE: A Benchmark for Natural Language to ns-3 Network Simulation Code Generation

Tasnim Ahmed, Mirza Mohammad Azwad, Salimur Choudhury

专题命中 代码评测 :code generation(title,abstract)

Comments This paper has been accepted for presentation at the 50th IEEE Conference on Local Computer Networks (LCN) - special track on Large Language Models and Networking

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16292 2024-10-23 cs.SE cs.AI cs.CL 78%

An evaluation of LLM code generation capabilities through graded exercises

Álvaro Barbero Jiménez

专题命中 代码评测 :code generation(title);分类 cs.SE、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03733 2024-10-22 cs.LG cs.AI cs.CL 78%

Planning In Natural Language Improves LLM Search For Code Generation

Evan Wang, Federico Cassano, Catherine Wu, Yunfeng Bai, Will Song, Vaskar Nath, Ziwen Han, Sean Hendryx, Summer Yue, Hugh Zhang

专题命中 代码评测 :code generation(title);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
physics/0509007 2009-12-01 physics.data-an 78%

The repository of physical models used for the CODATA-2002 FPC (re-)evaluation

A. S. Siver

专题命中 代码评测 :repository(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08866 2026-02-10 cs.SE 77%

ArkEval: Benchmarking and Evaluating Automated CodeRepair for ArkTS

ArkEval: 对ArkTS自动代码修复的基准测试与评估

Bang Xie, Senjian Zhang, Zhiyuan Peng, Wei Chen, Chenhao Ying, Yuan Luo

专题命中 代码评测 :code generation(abstract);program repair(abstract);repository(abstract);分类 cs.SE

AI总结 ArkEval为ArkTS自动代码修复提供首个全面基准,通过挖掘官方仓库问题并采用LLM测试机制,评估了四种先进模型的修复能力,揭示了LLM在该领域的现状与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06976 2026-02-10 cs.CL cs.AI cs.LG cs.PL 77%

Bridging the Knowledge Void: Inference-time Acquisition of Unfamiliar Programming Languages for Coding Tasks

弥合知识鸿沟:在推理时获取不熟悉编程语言以完成编码任务

Chen Shen, Wei Cheng, Jingyue Yang, Huan Zhang, Yuhan Wu, Wei Hu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国) National Institute of Healthcare Data Science, Nanjing University, China(健康数据科学国家研究院,南京大学,中国)

专题命中 代码评测 :code generation(abstract);program repair(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ILA-agent框架,通过推理时动态交互获取不熟悉编程语言,提升编码任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17419 2025-12-22 cs.SE cs.AI cs.CL cs.LG 77%

SWE-Bench++: A Framework for the Scalable Generation of Software Engineering Benchmarks from Open-Source Repositories

SWE-Bench++: 一个从开源仓库生成可扩展软件工程基准的框架

Lilin Wang, Lucas Ramalho, Alan Celestino, Phuc Anthony Pham, Yu Liu, Umang Kumar Sinha, Andres Portillo, Onassis Osunwa, Gabriel Maduekwe

机构 * Research & Development, Turing(研发与图灵)

专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 SWE-Bench++通过自动化生成多语言软件工程基准,提升仓库级代码生成的评估与改进

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.19114 2024-03-29 cs.SE cs.CL cs.LG cs.PL 77%

Top Leaderboard Ranking = Top Coding Proficiency, Always? EvoEval: Evolving Coding Benchmarks via LLM

Chunqiu Steven Xia, Yinlin Deng, Lingming Zhang

专题命中 代码评测 :code generation(abstract);program synthesis(abstract);分类 cs.SE、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20478 2026-07-24 cs.SE cs.AI 新提交 76%

Verifier-First Evaluation of Agentic LLMs for Infrastructure-as-Code Generation

用于基础设施即代码生成的智能语言模型的验证优先评估

Mohamed Jouini

专题命中 代码评测 :code generation(title);分类 cs.SE、cs.AI

AI总结 研究针对自然语言生成基础设施即代码的问题,对七种智能策略在特定基准测试上进行验证优先评估,通过多种方法得出如主动检索提升性能、迭代优化有收敛效果等五个主要发现,为相关研究提供了重要参考。

Comments 26 pages, 3 figures, 17 tables. Benchmark dataset available at https://huggingface.co/datasets/iac-eval-v2/iac-eval-v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22248 2026-06-23 cs.LG cs.CL 新提交 76%

SamatNext v0.2-B: An Exploratory Study of RMS-Normalized Hybrid Decoders for Curriculum Retention in Small Code Models

SamatNext v0.2-B: 针对小型代码模型中课程保留的RMS归一化混合解码器的探索性研究

Samat Zharassov

专题命中 代码评测 :code model(title);分类 cs.CL、cs.LG

AI总结 提出SamatNext v0.2-B混合解码器,在课程微调中通过RMS归一化和输出缩放校准交替使用差分注意力层与简化线性状态混合器,在Python代码课程上相比Transformer基线显著提升保留率,但长期早期阶段保留仍较弱。

Comments 12 pages, 3 tables. Technical report. Code and reproducibility artifacts: https://github.com/samat2003/samatnext-v0.1/tree/samatnext-v02-lsm-rmsnorm. v2 adds an AI-assisted software development disclosure; no changes to main results

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04459 2026-05-18 cs.CR cs.AI cs.SE 76%

Benchmark of Benchmarks: Unpacking Influence and Code Repository Quality in LLM Safety Benchmarks

基准的基准:解构影响与代码仓库质量在LLM安全基准中的作用

Junjie Chu, Xinyue Shen, Ye Leng, Michael Backes, Yun Shen, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心) University of Waterloo(滑铁卢大学) Flexera(Flexera公司)

专题命中 代码评测 :repository(title);分类 cs.SE、cs.AI

AI总结 本文通过系统研究31个LLM安全基准及382篇非基准论文,发现仅39%的基准仓库可直接运行,且缺乏伦理考量。研究揭示社区采用基准与作者声望和代码运行性相关,但与代码质量无关,指出安全基准可能存在安全隐患和不可比性问题。

Comments 24 pages. 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22597 2026-04-29 cs.SE cs.CL 76%

TimeMachine-bench: A Benchmark for Evaluating Model Capabilities in Repository-Level Migration Tasks

TimeMachine-bench:一个评估仓库级迁移任务模型能力的基准

Ryo Fujii, Makoto Morishita, Kazuki Yano, Jun Suzuki

机构 * Tohoku University(东大理工大学) Future Corporation(未来公司) RIKEN(日本理化学研究所) NII LLMC(国家信息研究所LLMC)

专题命中 代码评测 :repository(title);分类 cs.SE、cs.CL

AI总结 本文提出TimeMachine-bench基准,用于评估软件迁移任务中的模型能力,通过自动化构建GitHub仓库测试失败数据集,评估基于11种模型的基线方法,发现LLM在迁移任务中仍存在可靠性挑战。

Comments Accepted to EACL 2026 Main, camera-ready

Journal ref Proceedings of the 19th Conference of the European Chapter of the Association for Computational Linguistics (Volume 1: Long Papers), pages 8233-8264, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16990 2025-09-16 cs.CL cs.AI 76%

TeXpert: A Multi-Level Benchmark for Evaluating LaTeX Code Generation by LLMs

Sahil Kale, Vijaykant Nadadur

机构 * Knowledgeverse AI(知识verse AI)

专题命中 代码评测 :code generation(title);分类 cs.CL、cs.AI

Comments Accepted to the SDProc Workshop @ ACL 2025

Journal ref Proceedings of the Fifth Workshop on Scholarly Document Processing (SDP 2025), pages 7-16, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05881 2025-09-09 cs.SE cs.AI 76%

GeoAnalystBench: A GeoAI benchmark for assessing large language models for spatial analysis workflow and code generation

Qianheng Zhang, Song Gao, Chen Wei, Yibo Zhao, Ying Nie, Ziru Chen, Shijie Chen, Yu Su, Huan Sun

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) The Ohio State University(俄亥根州立大学)

专题命中 代码评测 :code generation(title);分类 cs.SE、cs.AI

Comments 34 pages, 8 figures

Journal ref Transactions in GIS, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.04030 2023-02-13 cs.SE cs.AI 76%

CrossCodeBench: Benchmarking Cross-Task Generalization of Source Code Models

Changan Niu, Chuanyi Li, Vincent Ng, Bin Luo

专题命中 代码评测 :code model(title);分类 cs.SE、cs.AI

Comments ICSE 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.05480 2023-02-07 cs.SE cs.AI 76%

CodeS: Towards Code Model Generalization Under Distribution Shift

Qiang Hu, Yuejun Guo, Xiaofei Xie, Maxime Cordy, Lei Ma, Mike Papadakis, Yves Le Traon

专题命中 代码评测 :code model(title);分类 cs.SE、cs.AI

Comments accepted by ICSE'23-NIER

详情

展开后加载摘要…

URL PDF HTML 收藏
1805.08490 2019-04-18 cs.LG cs.PL stat.ML 76%

Generative Code Modeling with Graphs

Marc Brockschmidt, Miltiadis Allamanis, Alexander L. Gaunt, Oleksandr Polozov

专题命中 代码评测 :code model(title);分类 cs.LG、cs.PL

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16011 2026-07-21 cs.SE cs.AI cs.CL 版本更新 75%

FormulaCode: Evaluating Agentic Optimization on Large Codebases

FormulaCode: 评估在大规模代码库上进行代理优化

Atharva Sehgal, James Hou, Akanksha Sarkar, Ishaan Mantripragada, Swarat Chaudhuri, Jennifer J. Sun, Yisong Yue

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) California Institute of Technology(加州理工学院) Cornell University(康奈尔大学)

专题命中 代码评测 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 FormulaCode是一个评估大型真实代码库上代理优化能力的基准,包含957个从科学Python仓库挖掘出的性能瓶颈,配以专家撰写的补丁和平均264.6个社区维护的性能工作负载,揭示了前沿LLM代理在多目标优化上的重大挑战。

Comments ICML Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04177 2026-06-09 cs.SE cs.AI cs.LG 版本更新 75%

CodeTaste: Can LLMs Generate Human-Level Code Refactorings?

CodeTaste:LLM能否生成人类级别的代码重构?

Alex Thillen, Niels Mündler, Veselin Raychev, Martin Vechev

机构 * University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院)

专题命中 代码评测 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 研究LLM代理在代码重构中的能力,通过CodeTaste基准测试发现,代理在详细指定重构时表现良好,但难以自主发现人类选择的重构,提出“先提议后实现”分解可改善对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12185 2026-02-17 cs.SE cs.CL cs.LG 75%

EVALOOOP: A Self-Consistency-Centered Framework for Assessing Large Language Model Robustness in Programming

EVALOOOP:一种以自一致性为中心的大型语言模型编程鲁棒性评估框架

Sen Fang, Weiyuan Ding, Mengshi Zhang, Zihao Chen, Bowen Xu

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 代码评测 :code generation(abstract);coding agent(abstract);分类 cs.SE、cs.CL、cs.LG

AI总结 EVALOOOP通过自一致性反馈循环评估LLM在编程任务中的鲁棒性,利用ASL度量揭示模型在持续自指代转换中的语义保持能力。

Comments 27 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11077 2026-01-19 cs.SE cs.AI cs.CL 75%

ABC-Bench: Benchmarking Agentic Backend Coding in Real-World Development

ABC-Bench: 评估现实世界开发中自主后端编码的基准测试

Jie Yang, Honglin Guo, Li Ji, Jiazheng Zhou, Rui Zheng, Zhikai Lei, Shuo Zhang, Zhiheng Xi, Shichun Liu, Yuxin Wang, Bo Wang, Yining Zheng, Tao Gui, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Qiji Zhifeng Co., Ltd.(上海启济智风有限公司) Shanghai Innovation Institute(上海创新研究院)

专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 ABC-Bench是一个评估自主后端编码在真实可执行工作流中性能的基准测试,通过224个实际任务揭示了当前模型在复杂后端工程任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10820 2026-01-19 cs.LG cs.AI cs.CL cs.MA 75%

Towards Reliable ML Feature Engineering via Planning in Constrained-Topology of LLM Agents

通过LLM代理的受限拓扑规划实现可靠的机器学习特征工程

Himanshu Thakur, Anusha Kamath, Anurag Muthyala, Dhwani Sanmukhani, Smruthi Mukund, Jay Katukuri

机构 * Meta Menlo Park, CA(Meta 洛杉矶公园分校) JPMorgan Chase & Co.(摩根大通公司)

专题命中 代码评测 :code generation(abstract);coding agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于LLM代理的受限拓扑规划框架,通过多步骤生成代码提升特征工程的可靠性与效率,实验显示在数据集和实际应用中均取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20854 2025-10-13 cs.SE cs.AI cs.CL 75%

An LLM-as-Judge Metric for Bridging the Gap with Human Evaluation in SE Tasks

Xin Zhou, Kisub Kim, Ting Zhang, Martin Weyssow, Luis F. Gomes, Guang Yang, Kui Liu, Xin Xia, David Lo

机构 * Singapore Management University(新加坡国立管理学院) DGIST(韩国高等智能科学研究院) Monash University(墨尔本大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Huawei Software Engineering Application Technology Lab(华为软件工程应用技术实验室) Zhejiang University(浙江大学)

专题命中 代码评测 :code generation(abstract);program repair(abstract);分类 cs.SE、cs.CL、cs.AI

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏