arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1722 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 1722 篇

2410.21647 2025-06-26 cs.SE cs.CL 73%

Can Language Models Replace Programmers for Coding? REPOCOD Says 'Not Yet'

Shanchao Liang, Yiran Hu, Nan Jiang, Lin Tan

机构 * Purdue University(普渡大学)

专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.SE、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17482 2025-05-26 cs.AI cs.CL 73%

From Reasoning to Generalization: Knowledge-Augmented LLMs for ARC Benchmark

Chao Lei, Nir Lipovetzky, Krista A. Ehinger, Yanchuan Chang

机构 * School of Computing and Information Systems, The University of Melbourne(计算与信息系统学院,墨尔本大学)

专题命中 代码评测 :code generation(abstract);program synthesis(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02326 2024-09-05 cs.CL cs.AI 73%

Arctic-SnowCoder: Demystifying High-Quality Data in Code Pretraining

Yuxiang Wei, Hojae Han, Rajhans Samdani

专题命中 代码评测 :code generation(abstract);code model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.14936 2023-07-28 cs.CL cs.AI cs.LG cs.PL cs.SE 73%

PanGu-Coder2: Boosting Large Language Models for Code with Ranking Feedback

Bo Shen, Jiaxin Zhang, Taihong Chen, Daoguang Zan, Bing Geng, An Fu, Muhan Zeng, Ailun Yu, Jichuan Ji, Jingyang Zhao, Yuenan Guo, Qianxiang Wang

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.10739 2023-05-08 cs.LG cs.SE 73%

BigIssue: A Realistic Bug Localization Benchmark

Paul Kassianik, Erik Nijkamp, Bo Pang, Yingbo Zhou, Caiming Xiong

专题命中 代码评测 :program repair(abstract);repository(abstract);分类 cs.SE、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.10423 2023-04-21 cs.SE cs.AI cs.NE 73%

Fully Autonomous Programming with Large Language Models

Vadim Liventsev, Anastasiia Grishina, Aki Härmä, Leon Moonen

专题命中 代码评测 :program repair(abstract);program synthesis(abstract);分类 cs.SE、cs.AI

Comments Accepted for publication in the Genetic and Evolutionary Computation Conference (GECCO 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13516 2025-05-21 cs.MA cs.AI 72%

HALO: Hierarchical Autonomous Logic-Oriented Orchestration for Multi-Agent LLM Systems

Zhipeng Hou, Junyi Tang, Yipeng Wang

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学) Chongqing University(重庆大学)

专题命中 代码评测 :repository(abstract,comments);code generation(abstract);分类 cs.AI

Comments The code repository is available at https://github.com/23japhone/HALO

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20939 2025-06-27 cs.CV 71%

AIR-VIEW: The Aviation Image Repository for Visibility Estimation of Weather, A Dataset and Benchmark

Chad Mourning, Zhewei Wang, Justin Murray

机构 * School of Electrical Engineering and Computer Science, Ohio University(电气工程与计算机科学学院,俄亥俄大学)

专题命中 代码评测 :repository(title)

Comments 5 pages, meant as citation for dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04181 2026-08-06 cs.SE 新提交 70%

MergeSE: Post-Hoc Model Merging for Software Engineering Tasks Without Retraining

MergeSE:无需重新训练的软件工程任务事后模型合并

Palash R. Roy, Banani Roy, Kevin A. Schneider, Chanchal K. Roy

专题命中 代码评测 :code model(abstract);repository(abstract);分类 cs.SE

AI总结 MergeSE是一款开源工具,可对HuggingFace编码器检查点进行无训练合并,支持软件工程多类分类任务,能解决代码模型分布偏移导致的性能下降问题,合并效率高且性能优异。

Comments Accepted at ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22768 2026-07-30 cs.CL 版本更新 70%

ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation

ML2B:评估大语言模型跨语言ML流水线生成能力的基准

Ekaterina Trofimova, Zosia Shamina, Maria Selifanova, Artem Zaitsev, Remi Savchuk, Maxim Minets, Daria Ozerova, Emil Sataev, Denis Zuenko, Andrey E. Ustyuzhanin

机构 * HSE University(俄罗斯伏尔加格勒国立大学) Constructor University(Constructor大学) National University of Singapore(新加坡国立大学)

专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.CL

AI总结 ML2B是首个评估大语言模型跨语言ML流水线生成能力的基准,含多领域多语言任务,实验发现跨语言性能退化高度依赖任务,挑战了传统多语言模型能力假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23784 2026-07-28 cs.RO cs.AI 新提交 70%

A Few Words Go a Long Way: Language Guided Robot Policy Synthesis

寥寥数语,成效显著:语言引导的机器人策略合成

Daphne Chen, Archit Ritesh Jain, Eric Goossen, Emma Romig, Michael Murray, Nick Walker, Maya Cakmak

机构 * University of Washington(华盛顿大学) Microsoft Research(微软研究院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 代码评测 :coding agent(abstract);program synthesis(abstract);分类 cs.AI

AI总结 研究针对视觉-语言-动作模型难以解释等问题,提出ARCHITECT框架,利用大语言模型编码代理合成模块化机器人程序,通过人类自然语言修正引导策略并积累技能库,在机器人基准评估中表现出色,提供了新的机器人学习方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22642 2026-07-28 cs.AI cs.CL cs.LG cs.MA cs.SE 新提交 70%

CRAFT: Learn the Schema, Execute the Plan

CRAFT:学习模式,执行计划

Aakash Kolekar, Sahika Genc, Shahriar Shariat, Bunyamin Sisman, Tibor Mezi, Barbara Poblete, Shree Vandana Kachroo, Calvin Chi, Parth Parmar, Ari Singer, Prayaas Jain, Cindy Barker, Benoit Dumoulin

机构 * Amazon Advertising Foundations(亚马逊广告基金会) Amazon Web Services Agentic AI(亚马逊网络服务代理人工智能)

专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 研究企业编码代理将自然语言分析请求转换为可执行代码时的问题,提出两阶段训练后方法 CRAFT,先进行模式剥离的 PLAN 监督微调,再用执行形状的强化学习,评估显示其在多方面有提升并减少负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02931 2026-07-07 cs.AI 新提交 70%

VERITAS: Towards a General-Purpose Replication Tool for Scientific Research

VERITAS:迈向科学研究的通用复制工具

Haokun Liu, Filbert Aurelian Tjiaranata, Chenhao Tan

机构 * University of Chicago(芝加哥大学) University of Indonesia(印度尼西亚大学)

专题命中 代码评测 :repository(abstract);coding agent(abstract);分类 cs.AI

AI总结 针对科研成果独立验证难且手工复制慢贵的问题,提出VERITAS框架,围绕CLI编码代理构建,可提取论文主张、运行方法并判断主张,在多领域评估中性能达最优。

Comments 21 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05001 2026-06-04 cs.SE 70%

TeleSWEBench: A Commit-Driven Benchmark for Evaluating LLM-Powered Software Engineering in Telecommunications

TeleSWEBench:一个面向电信领域评估基于LLM的软件工程的提交驱动基准

Pranshav Gajjar, Ali Mamaghani, Dinesh Bharadia, Vijay K Shah

专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.SE

AI总结 提出TeleSWEBench,首个面向电信领域的提交驱动基准,通过从srsRAN 5G仓库挖掘真实提交并构建734个可执行测试用例,结合分层LLM评判框架TeleJudge,评估ASE工具在电信软件工程中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26457 2026-05-27 cs.SE cs.AI cs.CL cs.PL 70%

Verus-SpecGym: An Agentic Environment for Evaluating Specification Autoformalization

Verus-SpecGym: 用于评估规范自动形式化的智能体环境

Anmol Agarwal, Natalie Neamtu, Pranjal Aggarwal, Seungone Kim, Jannis Limperg, Cedric Flamant, Kanna Shimizu, Bryan Parno, Sean Welleck

机构 * CMU(卡内基梅隆大学) Amazon(亚马逊)

专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 提出 Verus-SpecGym 环境与 Verus-SpecBench 基准,通过执行规范机制和对抗性测试评估 LLM 智能体将非正式编程问题转化为形式规范的能力,发现前沿模型可解决 77.8% 的任务但存在遗漏假设等脆弱性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26275 2026-04-30 cs.SE 70%

Agentic AI in the Software Development Lifecycle: Architecture, Empirical Evidence, and the Reshaping of Software Engineering

软件开发生命周期中的代理AI:架构、实证证据与软件工程的重塑

Happy Bhati

专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.SE

AI总结 本文探讨代理AI在软件开发生命周期中的应用,提出六层参考架构,分析代理SDLC与传统SDLC的差异,并通过实证数据展示其在性能、生产力和劳动力市场的影响。

Comments 9 pages, 5 figures, 2 tables, survey paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23088 2026-04-28 cs.SE cs.AI cs.CL cs.PL 70%

Code Broker: A Multi-Agent System for Automated Code Quality Assessment

Code Broker:一个用于自动化代码质量评估的多智能体系统

Samer Attrah

机构 * Independent researcher(独立研究者) California, USA(美国加州)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 Code Broker通过多智能体架构对Python代码进行分析并生成质量评估报告,结合LLM推理与静态分析工具,提升代码审查的效率与准确性。

Comments 8 pages, 1 figure, 2 tables, 28 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19742 2026-04-22 cs.SE 70%

PlayCoder: Making LLM-Generated GUI Code Playable

PlayCoder: 使LLM生成的GUI代码可播放

Zhiyuan Peng, Wei Tao, Xin Yin, Chenhao Ying, Yuan Luo, Yiwen Guo

专题命中 代码评测 :code generation(abstract);repository(abstract);分类 cs.SE

AI总结 本文提出PlayCoder框架,通过生成、评估和迭代修复GUI代码,提升代码的逻辑正确性和语义对齐,实现功能正确性和交互逻辑的改进。

Comments September 11, 2025 Submitted to FSE2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15976 2026-03-18 cs.AI 70%

An Agentic Evaluation Framework for AI-Generated Scientific Code in PETSc

面向AI生成科学代码的PETSc代理评估框架

Hong Zhang, Barry Smith, Satish Balay, Le Chen, Murat Keceli, Lois Curfman McInnes, Junchao Zhang

机构 * Argonne National Laboratory(阿贡国家实验室)

专题命中 代码评测 :code generation(abstract);coding agent(abstract);分类 cs.AI

AI总结 本文提出petscagent-bench框架,通过代理评估代理的方式,评估AI生成的科学代码在正确性、性能、代码质量等方面的表现,揭示传统指标的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00205 2026-02-02 cs.SE cs.CR 70%

Towards a Benchmark for Dependency Decision-Making

面向依赖决策制定的基准测试

Tanmay Singla, Berk Çakar, Paschal C. Amusuo, James C. Davis

专题命中 代码评测 :repository(abstract);coding agent(abstract);分类 cs.SE

AI总结 本文提出DepDec-Bench基准测试,用于评估人工智能编码代理在依赖决策中的安全性和效率,通过分析实际依赖变更数据,揭示代理在版本选择、依赖重用及安全影响方面的表现。

Comments Under review at JAWS 2026. 5 pages, 1 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20495 2025-11-25 cs.CL cs.AI cs.IR cs.LG cs.SE 70%

ReCode: Updating Code API Knowledge with Reinforcement Learning

ReCode: 通过强化学习更新代码API知识

Haoze Wu, Yunzhi Yao, Wenhao Yu, Ningyu Zhang

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 ReCode通过强化学习方法提升LLMs在动态API环境下的代码生成能力,尤其在CodeUpdateArena任务中表现优异。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02778 2025-11-05 cs.CV cs.CL 70%

VCode: a Multimodal Coding Benchmark with SVG as Symbolic Visual Representation

Kevin Qinghong Lin, Yuhao Zheng, Hangyu Ran, Dantong Zhu, Dongxing Mao, Linjie Li, Philip Torr, Alex Jinpeng Wang

专题命中 代码评测 :code generation(abstract);program synthesis(abstract);分类 cs.CL

Comments Project page: https://csu-jpg.github.io/VCode Github: https://github.com/CSU-JPG/VCode

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27063 2025-11-03 cs.LG cs.AI cs.CL cs.IT cs.SE math.IT 70%

Towards a Measure of Algorithm Similarity

Shairoz Sohail, Taher Ali

专题命中 代码评测 :program synthesis(abstract);分类 cs.SE、cs.CL、cs.AI

Comments 11 pages, many figures and images

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04605 2025-10-07 cs.SE 70%

Exploring the Power of Diffusion Large Language Models for Software Engineering: An Empirical Investigation

Jingyao Zhang, Tianlin Li, Xiaoyu Zhang, Qiang Hu, Bin Shi

专题命中 代码评测 :code generation(abstract);program repair(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07942 2025-07-21 cs.SE 70%

Adversarial Attack Classification and Robustness Testing for Large Language Models for Code

Yang Liu, Armstrong Foundjem, Foutse Khomh, Heng Li

专题命中 代码评测 :code generation(abstract);code model(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24324 2025-06-02 cs.LG cs.CL cs.PL cs.SE 70%

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation

Ivan Petrukha, Yana Kurliak, Nataliia Stulova

机构 * MacPaw

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.CL、cs.LG

Comments Accepted to FORGE'25 Benchmarking on 15.01.2025, to be published by IEEE under the CC BY-NC-ND 4.0 license. This is the accepted version of the article (5 pages, 2 figures, 1 table). DOI will be added upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17928 2025-05-29 cs.SE cs.AI cs.CL cs.LG 70%

Towards Practical Defect-Focused Automated Code Review

Junyi Lu, Lili Jiang, Xiaojia Li, Jianbing Fang, Fengjun Zhang, Li Yang, Chun Zuo

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.CL、cs.AI

Comments Accepted as Spotlight at the 42nd International Conference on Machine Learning (ICML 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07473 2025-05-13 cs.AI 70%

Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks

Kai Xu, YiWei Mao, XinYi Guan, ZiLong Feng

机构 * ByteDance(字节跳动)

专题命中 代码评测 :code generation(abstract);coding agent(abstract);分类 cs.AI

Comments 28 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03543 2025-04-09 cs.SE cs.AI cs.CL cs.LG 70%

CodeEditorBench: Evaluating Code Editing Capability of Large Language Models

Jiawei Guo, Ziming Li, Xueling Liu, Kaijing Ma, Tianyu Zheng, Zhouliang Yu, Ding Pan, Yizhi LI, Ruibo Liu, Yue Wang, Shuyue Guo, Xingwei Qu, Xiang Yue, Ge Zhang, Wenhu Chen, Jie Fu

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07832 2025-03-12 cs.AI cs.CL cs.LG cs.SE 70%

RefactorBench: Evaluating Stateful Reasoning in Language Agents Through Code

Dhruv Gautam, Spandan Garg, Jinu Jang, Neel Sundaresan, Roshanak Zilouchian Moghaddam

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.CL、cs.AI

Comments ICLR 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏