arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1721 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 1721 篇

2507.10641 2025-07-16 cs.SE cs.AI cs.CL 75%

A Code Comprehension Benchmark for Large Language Models for Code

Jayant Havare, Saurav Chaudhary, Ganesh Ramakrishnan, Kaushik Maharajan, Srikanth Tamilselvam

机构 * IIT Bombay(印度理工学院博伊斯分校) IBM Research(IBM研究院)

专题命中 代码评测 :code generation(abstract);code model(abstract);分类 cs.SE、cs.CL、cs.AI

Comments 10 Pages, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09063 2025-07-15 cs.SE cs.AI cs.LG 75%

SetupBench: Assessing Software Engineering Agents' Ability to Bootstrap Development Environments

Avi Arora, Jinu Jang, Roshanak Zilouchian Moghaddam

专题命中 代码评测 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06215 2025-02-11 cs.SE cs.AI cs.CL 75%

LessLeak-Bench: A First Investigation of Data Leakage in LLMs Across 83 Software Engineering Benchmarks

Xin Zhou, Martin Weyssow, Ratnadira Widyasari, Ting Zhang, Junda He, Yunbo Lyu, Jianming Chang, Beiqi Zhang, Dan Huang, David Lo

专题命中 代码评测 :code generation(abstract);program repair(abstract);分类 cs.SE、cs.CL、cs.AI

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09997 2024-10-15 cs.SE cs.AI cs.CL 75%

Collu-Bench: A Benchmark for Predicting Language Model Hallucinations in Code

Nan Jiang, Qi Li, Lin Tan, Tianyi Zhang

专题命中 代码评测 :code generation(abstract);program repair(abstract);分类 cs.SE、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.05987 2023-02-21 cs.CL cs.AI cs.SE 75%

DocPrompting: Generating Code by Retrieving the Docs

Shuyan Zhou, Uri Alon, Frank F. Xu, Zhiruo Wang, Zhengbao Jiang, Graham Neubig

专题命中 代码评测 :code generation(abstract);code model(abstract);分类 cs.SE、cs.CL、cs.AI

Comments ICLR 2023 (notable-top-25%); code and data are available at https://github.com/shuyanzhou/docprompting

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01518 2026-08-07 cs.SE 版本更新 74%

Probe to Generate: Program Variant-Guided Test Augmentation for Repository-Level Repair Benchmarks

基准测试足够强大吗?基于突变的诊断和回归套件的增强

Chenglin Li, Yisen Xu, Zehao Wang, Shin Hwei Tan, Tse-Hsun, Chen

专题命中 代码评测 :repository(title);分类 cs.SE

AI总结 本文提出STING框架,通过语义改变的程序变体增强回归测试,提高基准测试的可靠性。实验显示,77%的实例存在至少一个存活变体,测试覆盖率提升,修复率下降,揭示了基准测试的不足。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07744 2026-07-10 cs.SE 新提交 74%

PERFOPT-Bench: Evaluating Coding Agents on Software Performance Optimization

PERFOPT-Bench:评估软件性能优化中的编码代理

Yingyun Cui, Yi Xie, Piaohong Wang, Jiawei Ma, Bo Liu, Liangliang Cao

专题命中 代码评测 :coding agent(title);分类 cs.SE

AI总结 该研究介绍PERFOPT-Bench基准,用于评估软件性能优化中编码代理的完整性能工程循环。通过7个长期任务评估7个不同的代理堆栈,发现优化性能取决于工作负载,原始加速作基准分数不安全,还提出中继试验可恢复额外空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02390 2026-07-03 cs.LG 新提交 74%

DecompRL: Solving Harder Problems by Learning Modular Code Generation

DecompRL: 通过学习模块化代码生成解决更难的问题

Juliette Decugis, Fabian Gloeckle, Francis Bach, Taco Cohen, Gabriel Synnaeve

机构 * FAIR at Meta Inria, \'Ecole Normale Sup\'erieure

专题命中 代码评测 :code generation(title);分类 cs.LG

AI总结 提出DecompRL算法,通过强化学习将问题分解为可复用的子函数,重组模块生成候选解,将GPU瓶颈转移至CPU评估,在LiveCodeBench和CodeContests上超越标准RL基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12606 2026-05-12 cs.LG 74%

RelBench v2: A Large-Scale Benchmark and Repository for Relational Data

RelBench v2:关系数据的大型基准和存储库

Justin Gu, Rishabh Ranjan, Charilaos Kanatsoulis, Haiming Tang, Martin Jurkovic, Valter Hudovernik, Mark Znidar, Pranshu Chaturvedi, Parth Shroff, Fengyu Li, Jure Leskovec

机构 * Stanford University(斯坦福大学) National University of Singapore(新加坡国立大学) University of Ljubljana(卢布尔雅那大学) Kumo AI University of Oxford(牛津大学)

专题命中 代码评测 :repository(title);分类 cs.LG

AI总结 RelBench v2引入了四个大规模关系数据集,扩展了基准测试,并引入了自动补全任务,展示了关系学习模型在多表预测中的优势。

Comments Published at ICLR 2026. Website: https://relbench.stanford.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06565 2026-04-08 cs.CL 74%

EVM-QuestBench: An Execution-Grounded Benchmark for Natural-Language Transaction Code Generation

EVM-QuestBench: 一个基于执行的自然语言交易代码生成基准测试

Pei Yang, Wanyi Chen, Ke Wang, Lynn Ai, Eric Yang, Tianyu Shi

机构 * Gradient Soochow University(苏州大学)

专题命中 代码评测 :code generation(title);分类 cs.CL

AI总结 本文提出EVM-QuestBench,一个基于执行的自然语言交易脚本生成基准测试,包含107个任务,通过动态评估和模块化架构评估20个模型,发现单步精度与多步流程完成存在显著差异。

Comments 10 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13251 2026-03-17 cs.AI 74%

ManiBench: A Benchmark for Testing Visual-Logic Drift and Syntactic Hallucinations in Manim Code Generation

ManiBench:一个用于测试Manim代码生成中视觉-逻辑漂移和语法幻觉的基准测试

Nabin Oli

机构 * Sunway College Kathmandu(加德满都阳光学院) Birmingham City University(伯明翰城市大学)

专题命中 代码评测 :code generation(title);分类 cs.AI

AI总结 ManiBench旨在评估LLM在生成Manim CE代码时的性能,针对语法幻觉和视觉-逻辑漂移两种关键失败模式,包含150-200个问题,涵盖微积分、线性代数、概率、拓扑和AI等领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13213 2026-03-16 cs.SE 74%

MoEKD: Mixture-of-Experts Knowledge Distillation for Robust and High-Performing Compressed Code Models

MoEKD:混合专家知识蒸馏用于鲁棒且高性能的压缩代码模型

Md. Abdul Awal, Mrigank Rochan, Chanchal K. Roy

专题命中 代码评测 :code model(title);分类 cs.SE

AI总结 本文提出MoEKD框架,通过混合专家架构实现多专家知识蒸馏,提升压缩模型的鲁棒性和性能,实验表明在漏洞检测任务中,MoEKD在对抗鲁棒性和预测性能上均优于现有基线方法。

Comments Accepted to the Research Track of the Evaluation and Assessment in Software Engineering (EASE) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20823 2025-12-25 cs.AR cs.AI 74%

NotSoTiny: A Large, Living Benchmark for RTL Code Generation

NotSoTiny: 一个大规模、活体的RTL代码生成基准

Razine Moundir Ghorab, Emanuele Parisi, Cristian Gutierrez, Miquel Alberti-Binimelis, Miquel Moreto, Dario Garcia-Gasulla, Gokcen Kestor

机构 * Barcelona Supercomputing Center(巴塞罗那超级计算中心) Universitat Politecnica de Catalunya(加泰罗尼亚理工大学)

专题命中 代码评测 :code generation(title);分类 cs.AI

AI总结 NotSoTiny是一个大规模、活体的RTL代码生成基准,通过评估LLM生成结构丰富且具有上下文意识的RTL代码的能力,以克服当前LLM在硬件设计中的限制并推动技术发展。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01081 2025-05-05 cs.AI 74%

MADIL: An MDL-based Framework for Efficient Program Synthesis in the ARC Benchmark

Sébastien Ferré

机构 * IRISA(里索斯研究所)

专题命中 代码评测 :program synthesis(title);分类 cs.AI

Comments 54 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07990 2024-05-14 cs.CL cs.CV 74%

Plot2Code: A Comprehensive Benchmark for Evaluating Multi-modal Large Language Models in Code Generation from Scientific Plots

Chengyue Wu, Yixiao Ge, Qiushan Guo, Jiahao Wang, Zhixuan Liang, Zeyu Lu, Ying Shan, Ping Luo

专题命中 代码评测 :code generation(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.09163 2023-04-17 cs.CL 74%

UniCausal: Unified Benchmark and Repository for Causal Text Mining

Fiona Anting Tan, Xinyu Zuo, See-Kiong Ng

专题命中 代码评测 :repository(title);分类 cs.CL

Comments 15 pages include References

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20911 2026-07-24 cs.CL cs.SE 新提交 73%

Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction

腾讯工作伙伴基准测试:一个具有抗污染任务构建的多领域编码智能体基准测试

Tencent WorkBuddy Bench Team, Siqi Cai, Shaopeng Chen, Xiang Fei, Yong Mao, Zihan Xu, Zhiheng Lyu, Zhijian Shao, Yuchen Shi, Shuwen Zhang, Chaofan Qiu, Linjie Che, Xiaoxi Zhao, Feng Wu, Kai Zhang, Chaofan Zhu, Yubin Qi, Xiaoyun Liang, Peijie Dong, Yunhao Zhang, Yuanjie Zhu, Ling Jiang, Xianjun Zhang, Zhehang Chu, Anyuan Sang, Zhen Feng, Sen Nie, Shi Wu, Yuanzhen Xu, Xin Li, Ning Yang, Zhiqiang Dong, Hande Dong, Qiang Lin, Yi Liu, Yunsheng Wu, Ke Li, Xing Sun

机构 * Tencent(腾讯) Youtu Lab(腾讯优图实验室) Keen Security Lab(腾讯安全科恩实验室) Workbuddy(腾讯工作伙伴) Yunding Security Lab(腾讯云鼎实验室)

专题命中 代码评测 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.CL

AI总结 介绍腾讯工作伙伴基准测试这一多领域编码智能体评估套件,核心是统一评估框架,任务经反向设计防污染,数据集公开,四个子集探测工作不同方面,以统一格式和协议运行,还给出跨模型排行榜。

Comments 30 pages, 9 figures. Project page: https://workbuddybench.com/ ; code: https://github.com/Tencent/workbuddy-bench ; dataset: https://huggingface.co/datasets/tencent/workbuddy-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26648 2026-07-21 cs.SE cs.AI 版本更新 73%

Vision2Web: A Hierarchical Benchmark for Visual Website Development with Agent Verification

Vision2Web: 一个用于视觉网站开发的分层基准,包含代理验证

Zehai He, Wenyi Hong, Zhen Yang, Ziyang Pan, Mingdao Liu, Xiaotao Gu, Jie Tang

机构 * Tsinghua University(清华大学)

专题命中 代码评测 :code generation(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文提出Vision2Web基准,用于评估视觉网站开发能力,包含193个任务和16类,通过GUI代理验证器和基于VLM的裁判器评估多个视觉语言模型,揭示了在全栈开发中现有模型的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00041 2026-07-02 cs.SE cs.AI 新提交 73%

ATM: CID-Brokered Pre-Write Admission for Multi-Agent Code Co-Synthesis

ATM:基于CID的预写准入机制用于多智能体代码协同合成

Eagl Huang

专题命中 代码评测 :software agent(abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 提出ATM框架,通过CID代理和适配器引导的原子化,解决多智能体LLM系统中并发写意图的准入、组合与序列化问题,支持可审计性和有限恢复能力。

Comments 40 pages, 8 figures. Source code and supplementary artifact links are described in the manuscript appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14084 2026-05-22 cs.LG cs.AI 73%

TIP: Token Importance in On-Policy Distillation

TIP: on-policy distillation 中的 token 重要性

Yuanda Xu, Hejian Sang, Zhengze Zhou, Ran He, Zhipeng Wang, Alborz Geramifard

专题命中 代码评测 :repository(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本研究探讨了在 on-policy 知识蒸馏中哪些 token 对学习信号最有用,提出了一种基于学生熵和教师-学生分歧的双轴分类方法,并通过实验验证了在有限内存条件下使用少量 token 进行蒸馏的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06296 2026-04-21 cs.PL cs.AI 73%

VeriEquivBench: An Equivalence Score for Ground-Truth-Free Evaluation of Formally Verifiable Code

VeriEquivBench:一种无需真实地面真相的正式可验证代码评估等价分数

Lingfei Zeng, Fengdi Che, Xuhan Huang, Fei Ye, Xu Xu, Binhang Yuan, Jie Fu

机构 * Huazhong University of Science and Technology(华中科技大学) University of Alberta(阿尔伯塔大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Hong Kong University of Science and Technology(香港科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 代码评测 :code generation(abstract);coding agent(abstract);分类 cs.AI、cs.PL

AI总结 本文提出VeriEquivBench,通过2389个复杂算法问题评估正式可验证代码的生成与推理能力,揭示当前LLM在生成正式规范和代码方面的挑战,推动可扩展可靠编码代理的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17204 2026-03-19 cs.CL cs.AR cs.PL 73%

CODMAS: A Dialectic Multi-Agent Collaborative Framework for Structured RTL Optimization

CODMAS:一种基于辩证多智能体协作的结构化RTL优化框架

Che-Ming Chang, Prashanth Vijayaraghavan, Ashutosh Jadhav, Charles Mackin, Vandana Mukherjee, Hsinyu Tsai, Ehsan Degan

机构 * National Taiwan University(国立台湾大学) IBM Research(IBM研究院)

专题命中 代码评测 :code generation(abstract);coding agent(abstract);分类 cs.CL、cs.PL

AI总结 CODMAS通过结合结构化辩证推理与领域感知代码生成和确定性评估,实现RTL优化自动化,显著提升了时钟门控的功耗降低和流水线的延迟减少效果。

Journal ref EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11935 2026-03-17 cs.LG cs.AI 73%

MobileKernelBench: Can LLMs Write Efficient Kernels for Mobile Devices?

MobileKernelBench: LLMs能否为移动设备编写高效的内核?

Xingze Zou, Jing Wang, Yuhua Zheng, Xueyi Chen, Haolei Bai, Lingcheng Kong, Syed A. R. Abu-Bakar, Zhaode Wang, Chengfei Lv, Haoji Hu, Huan Wang

专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨LLMs能否为移动设备编写高效内核,提出MobileKernelBench框架,发现现有模型在移动框架中表现不佳,提出MoKA多智能体系统提升编译成功率和性能。

Comments Paper webpage: https://zeezou-isee.github.io/Mobilekernelbench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17489 2026-02-05 cs.CL cs.AI 73%

MapCoder-Lite: Distilling Multi-Agent Coding into a Single Small LLM

MapCoder-Lite:将多智能体编码 distilling 进单一小型 LLM

Woongkyu Lee, Junhee Cho, Jungwook Choi

机构 * Hanyang University(翰阳大学) Samsung SDS(三星SDS)

专题命中 代码评测 :code generation(abstract);coding agent(abstract);分类 cs.CL、cs.AI

AI总结 MapCoder-Lite通过三支柱方法将多智能体编码distilling进单一7B模型,显著提升代码生成性能并降低资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05860 2025-12-15 cs.SE cs.AI 73%

Benchmarking AI Models in Software Engineering: A Review, Search Tool, and Unified Approach for Elevating Benchmark Quality

在软件工程中评估AI模型:一项综述、搜索工具和统一方法以提高基准质量

Roham Koohestani, Philippe de Bekker, Begüm Koç, Maliheh Izadi

机构 * EEMCS faculty, Delft University of Technology(代尔夫特理工大学EEMCS学院)

专题命中 代码评测 :code generation(abstract);code model(abstract);分类 cs.SE、cs.AI

AI总结 本文提出BenchScout和BenchFrame,通过统一框架提升软件工程AI模型的基准质量,改进现有基准并验证其有效性。

Comments Accepted for publication in IEEE Transactions on Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07921 2025-12-10 cs.SE cs.AI 73%

DeepCode: Open Agentic Coding

DeepCode: 开放代理编程

Zongwei Li, Zhonghang Li, Zirui Guo, Xubin Ren, Chao Huang

机构 * The University of Hong Kong(香港大学)

专题命中 代码评测 :repository(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 DeepCode通过系统信息流管理,实现文档到代码库的高保真合成,超越现有商业代理和人类专家,推动自主科学复现的发展。

Comments for source code, please see https://github.com/HKUDS/DeepCode

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04324 2025-12-05 cs.CL cs.AI 73%

DAComp: Benchmarking Data Agents across the Full Data Intelligence Lifecycle

DAComp: 在全数据智能生命周期中跨领域评估数据代理

Fangyu Lei, Jinxiang Meng, Yiming Huang, Junjie Zhao, Yitong Zhang, Jianwen Luo, Xin Zou, Ruiyi Yang, Wenbo Shi, Yan Gao, Shizhu He, Zuo Wang, Qian Liu, Yang Wang, Ke Wang, Jun Zhao, Kang Liu

机构 * Institute of Automation, CAS(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.CL、cs.AI

AI总结 DAComp通过210个任务评估数据代理在数据工程与分析中的能力,揭示现有代理在复杂流程编排和开放性推理中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03013 2025-12-04 cs.SE cs.LG 73%

Cataloguing Hugging Face Models to Software Engineering Activities: Automation and Findings

对Hugging Face模型进行软件工程活动的分类:自动化与发现

Alexandra González, Xavier Franch, David Lo, Silverio Martínez-Fernández

机构 * Universitat Politècnica de Catalunya(政治与技术大学) Singapore Management University(新加坡管理大学)

专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.SE、cs.LG

AI总结 本文通过分类Hugging Face上的预训练模型,揭示了软件工程中模型的应用现状与不足,为自动化场景提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02330 2025-09-03 cs.SE cs.AI 73%

ReCode: Improving LLM-based Code Repair with Fine-Grained Retrieval-Augmented Generation

Yicong Zhao, Shisong Chen, Jiacheng Zhang, Zhixu Li

机构 * College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院) Fudan University(复旦大学) Shanghai Institute of Artificial Intelligence for Education(教育人工智能研究所) East China Normal University(华东师范大学) School of Information, Renmin University of China(信息学院,中国人民大学) School of Smart Governance, Renmin University of China(智能治理学院,中国人民大学)

专题命中 代码评测 :code generation(abstract);program repair(abstract);分类 cs.SE、cs.AI

Comments Accepted by CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10182 2025-07-15 cs.SE cs.AI 73%

Breaking the Myth: Can Small Models Infer Postconditions Too?

Gehao Zhang, Zhenting Wang, Juan Zhai

机构 * University of Massachusetts(马萨诸塞大学) Rutgers University(罗格斯大学)

专题命中 代码评测 :code model(abstract);repository(abstract);分类 cs.SE、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏