arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-03-18 至 2026-03-18 共收录 21 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 12 篇

2509.18808 2026-03-18 cs.SE 83%

SR-Eval: Evaluating LLMs on Code Generation under Stepwise Requirement Refinement

SR-Eval: 评估在逐步需求细化下的LLM代码生成能力

Zexun Zhan, Shuzheng Gao, Ruida Hu, Cuiyun Gao

专题命中 代码生成 :code generation(title,abstract);repository(abstract);分类 cs.SE

AI总结 SR-Eval是一个针对迭代代码生成的评估基准,通过多轮交互模拟真实开发流程,评估LLM在逐步需求细化下的表现,发现最佳模型在功能级任务中仅达到22.67%的完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23135 2026-03-18 cs.LG cs.AI cs.LO cs.PL cs.SE 83%

VERINA: Benchmarking Verifiable Code Generation

VERINA:可验证代码生成基准测试

Zhe Ye, Zhengxu Yan, Jingxuan He, Timothe Kasriel, Kaiyu Yang, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) Meta FAIR

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 本文提出VERINA基准测试,用于全面评估代码、规范及证明生成能力,揭示LLM在可验证代码生成中的挑战,特别是证明生成的困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15707 2026-03-18 cs.SE cs.AI 81%

SEMAG: Self-Evolutionary Multi-Agent Code Generation

SEMAG:自演化多智能体代码生成

Yulin Peng, Haowen Hou, Xinxin Zhu, Ying Tiffany He, F. Richard Yu

机构 * College of Computer Science and Software Engineering, Shenzhen University, China(深圳大学计算机科学与软件工程学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ), China(广东省人工智能与数字经济发展实验室(深圳)) School of Information Technology, Carleton University, Canada(卡尔顿大学信息技术学院)

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE、cs.AI

AI总结 SEMAG通过自演化多智能体框架提升代码生成适应性,实现更高准确率和更强的模型自适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16526 2026-03-18 cs.AI 79%

Exploring different approaches to customize language models for domain-specific text-to-code generation

探索不同方法以定制语言模型用于领域特定的文本到代码生成

Luís Freire, Fernanda A. Andaló, Nicki Skafte Detlefsen

机构 * Technical University of Denmark(丹麦技术大学) The LEGO Group(乐高集团)

专题命中 代码生成 :code generation(title,abstract);分类 cs.AI

AI总结 本文探讨了如何通过合成数据集定制小型语言模型用于领域特定的代码生成,比较了少样本提示、检索增强生成和LoRA微调三种方法,发现LoRA在准确性和领域对齐上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16158 2026-03-18 cs.LG 79%

Execution-Grounded Credit Assignment for GRPO in Code Generation

基于执行的信用分配用于代码生成中的GRPO

Abhijit Kumar, Natalya Kumar, Shikhar Gupta

机构 * ICLR 2026 Workshop on Scaling Post-Training for LLMs (SPOT)(ICLR 2026 工作组:扩大训练后大语言模型(SPOT))

专题命中 代码生成 :code generation(title,abstract);分类 cs.LG

AI总结 本文提出基于执行的信用分配方法EGCA,通过执行轨迹局部化GRPO更新,提升代码生成的单元测试通过率,实验表明在HumanEval和MBPP数据集上效果优于GRPO。

Comments Accepted at SPOT ICLR 2026 (https://openreview.net/forum?id=nqkVB5EVXJ)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14837 2026-03-18 cs.CV cs.AI 79%

Improved Iterative Refinement for Chart-to-Code Generation via Structured Instruction

改进的图表到代码生成的迭代细化方法:基于结构化指令

Chengzhi Xu, Yuyang Wang, Lai Wei, Lichao Sun, Weiran Huang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Shanghai Innovation Institute(上海创新研究院) Lehigh University(莱特大学) MIFA Lab(MIFA实验室)

专题命中 代码生成 :code generation(title,abstract);分类 cs.AI

AI总结 本文提出基于结构化指令的ChartIR方法,通过区分视觉理解和代码翻译任务,提升图表到代码生成的性能,实验显示在Qwen2-VL和GPT-4o上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15004 2026-03-18 cs.CR cs.AI cs.CL 62%

From Vulnerabilities to Remediation: A Systematic Literature Review of LLMs in Code Security

从漏洞到修复:对LLMs在代码安全中应用的系统文献综述

Enna Basic, Alberto Giaretta

机构 * Department of Computer Science, Örebro University(奥雷布罗大学计算机科学系)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 本文系统综述了LLMs在代码安全中的应用,探讨其引入漏洞类型、漏洞检测与修复能力及提示策略影响,以及数据中毒攻击对其性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14805 2026-03-18 cs.PL cs.AI 62%

Sharing State Between Prompts and Programs

在提示和程序之间共享状态

Ellie Y. Cheng, Logan Weber, Tian Jin, Michael Carbin

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.PL

AI总结 本文提出共享程序状态抽象,使提示可直接访问程序变量并实现控制流,通过Nightjar系统验证了其在任务准确性和代码效率上的优势。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16434 2026-03-18 cs.AI q-fin.TR 57%

From Natural Language to Executable Option Strategies via Large Language Models

从自然语言到可执行期权策略的大型语言模型

Haochen Luo, Zhengzhao Lai, Junjie Xu, Yifan Li, Tang Pok Hin, Yuan Zhang, Chen Liu

机构 * City University of Hong Kong(香港城市大学) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Shanghai University of Finance and Economics(上海财经大学) University of Science and Technology of China(中国科学技术大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本文提出Option Query Language,通过语法规则将期权市场抽象为高层 primitives,使LLM能作为语义解析器生成可执行期权策略,并通过新数据集验证其优于直接生成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16216 2026-03-18 cs.CE cs.AI cs.ET 57%

Generative AI for Quantum Circuits and Quantum Code: A Technical Review and Taxonomy

生成式AI用于量子电路和量子代码:技术综述与分类

Juhani Merilehto

机构 * University of Vaasa(瓦萨大学) University of Turku(图尔库大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 综述13个生成系统和5个支持数据集,探讨量子电路和代码生成的分类与训练方法,发现生成系统在语法和语义层面有所覆盖,但缺乏对量子硬件的端到端评估。

Comments 20 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15997 2026-03-18 cs.MM cs.CL cs.SC 57%

Visual Set Program Synthesizer

视觉集合程序合成器

Zehua Cheng, Wei Dai, Wenhu Zhang, Thomas Lukasiewicz, Jiahao Sun

机构 * Department of Computer Science, University of Oxford(牛津大学计算机科学系) Department of Computer Science and Engineering, Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) Institute of Logic and Computation, TU Wien(维也纳技术大学逻辑与计算研究所)

专题命中 代码生成 :program synthesis(abstract);分类 cs.CL

AI总结 本文提出通过视觉程序合成解决复杂视觉推理问题,引入Set-VQA基准测试,显著提升回答准确性并提高透明度。

Comments 10 pages, IEEE International Conference on Multimedia and Expo 2026

Journal ref IEEE International Conference on Multimedia and Expo 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15691 2026-03-18 cs.SE 57%

VibeContract: The Missing Quality Assurance Piece in Vibe Coding

VibeContract: vibe编码中缺失的质量保证环节

Song Wang

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本文提出VibeContract框架,通过将高层次自然语言意图分解为任务序列并生成任务级合同,以提升LLM生成代码的正确性、鲁棒性和可维护性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 2 篇

2603.16124 2026-03-18 cs.SE cs.AI cs.CL 82%

SWE-QA-Pro: A Representative Benchmark and Scalable Training Recipe for Repository-Level Code Understanding

SWE-QA-Pro:一个代表性的基准和可扩展的训练配方用于仓库级代码理解

Songcheng Cai, Zhiheng Lyu, Yuansheng Ni, Xiangchao Chen, Baichuan Zhou, Shenzhe Zhu, Yi Lu, Haozhe Wang, Chi Ruan, Benjamin Schneider, Weixu Zhang, Xiang Li, Andy Zheng, Yuyu Zhang, Ping Nie, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) University of Toronto(多伦多大学) The Hong Kong University of Science and Technology(香港科学与技术大学) McGill University & MILA(麦吉尔大学及MILA) Verdent AI, Inc.(Verdent AI公司)

专题命中 软件智能体 :repository(title,abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本文提出SWE-QA-Pro基准,通过多样化的长尾仓库和可执行环境构建,验证了代理工作流在代码理解任务中的优势,并提出可扩展的合成数据管道和两阶段训练方法,使小型模型在复杂行为学习中取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15914 2026-03-18 cs.LG cs.AI 62%

The Agentic Researcher: A Practical Guide to AI-Assisted Research in Mathematics and Machine Learning

代理研究员:人工智能辅助数学和机器学习研究的实用指南

Max Zimmer, Nico Pelleriti, Christophe Roux, Sebastian Pokutta

机构 * Department for AI in Society, Science, and Technology(人工智能与社会、科学和技术部门) Zuse Institute Berlin(柏林Zuse研究所) Institute of Mathematics(数学研究所) Technische Universität Berlin(柏林技术大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种开源框架,通过方法学规则将CLI编码代理转化为自主研究助手,并通过深度学习和数学案例研究,指导研究人员如何有效利用AI工具进行研究。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 1 篇

2603.15921 2026-03-18 cs.SE cs.AI 62%

VIBEPASS: Can Vibe Coders Really Pass the Vibe Check?

VIBEPASS:振动编码器真的能通过振动检查吗?

Srijan Bansal, Jiao Fangkai, Yilun Zhou, Austin Xu, Shafiq Joty, Semih Yavuz

机构 * Salesforce AI Research(Salesforce AI研究院) Nanyang Technological University(南洋理工大学)

专题命中 程序修复 :program repair(abstract);分类 cs.SE、cs.AI

AI总结 本文研究了振动编码器在自主软件工程中的能力,发现故障定位推理是瓶颈,而非代码生成或测试有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 3 篇

2603.15976 2026-03-18 cs.AI 70%

An Agentic Evaluation Framework for AI-Generated Scientific Code in PETSc

面向AI生成科学代码的PETSc代理评估框架

Hong Zhang, Barry Smith, Satish Balay, Le Chen, Murat Keceli, Lois Curfman McInnes, Junchao Zhang

机构 * Argonne National Laboratory(阿贡国家实验室)

专题命中 代码评测 :code generation(abstract);coding agent(abstract);分类 cs.AI

AI总结 本文提出petscagent-bench框架,通过代理评估代理的方式,评估AI生成的科学代码在正确性、性能、代码质量等方面的表现,揭示传统指标的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11808 2026-03-18 cs.AI 57%

Automating Skill Acquisition through Large-Scale Mining of Open-Source Agentic Repositories: A Framework for Multi-Agent Procedural Knowledge Extraction

通过大规模开源代理仓库挖掘实现技能自动化获取:一种多代理过程知识提取框架

Shuzhen Bi, Mengsong Wu, Hao Hao, Keqian Li, Wentao Liu, Siyu Song, Hongbo Zhao, Aimin Zhou

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文提出一种多代理过程知识提取框架,通过挖掘开源仓库获取高质量代理技能,结合安全治理和评估指标实现可扩展的知识获取,提升知识转移效率40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17325 2026-03-18 cs.LG cs.AI cs.CL 56%

Generalizable End-to-End Tool-Use RL with Synthetic CodeGym

通用端到端工具使用强化学习与合成CodeGym

Weihua Du, Hailei Gong, Zhan Ling, Kang Liu, Lingfeng Shen, Xuesong Yao, Yufei Xu, Dingyuan Shi, Yiming Yang, Jiecao Chen

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)

专题命中 代码评测 :分类 cs.CL、cs.AI、cs.LG;repository(comments)

AI总结 本文提出CodeGym框架,通过合成多样化的多轮工具使用环境,提升LLM代理在不同任务配置下的泛化能力,实验显示Qwen2.5-32B-Instruct在OOD基准测试中准确率提升8.7个百分点。

Comments 24 pages. Accepted to ICLR 2026. Project repository: https://github.com/StigLidu/CodeGym

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 3 篇

2603.16107 2026-03-18 cs.SE cs.AI 81%

RepoReviewer: A Local-First Multi-Agent Architecture for Repository-Level Code Review

RepoReviewer: 一种面向仓库级别的多智能体架构

Peng Zhang

专题命中 仓库级理解 :repository(title,abstract);分类 cs.SE、cs.AI

AI总结 RepoReviewer通过分解仓库获取、上下文合成、文件分析等步骤,提供一种实用的仓库级自动化审查架构,强调系统设计与可重用的评估工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16733 2026-03-18 cs.AI cs.CL cs.SE 67%

IQuest-Coder-V1 Technical Report

IQuest-Coder-V1 技术报告

Jian Yang, Wei Zhang, Shawn Guo, Zhengmao Ye, Lin Jing, Shark Liu, Yizhi Li, Jiajun Wu, Cening Liu, X. Ma, Yuyang Song, Siwei Wu, Yuwen Li, L. Liao, T. Zheng, Ziling Huang, Zelong Huang, Che Liu, Yan Xing, Renyuan Li, Qingsong Cai, Hanxu Yan, Siyue Wang, Shikai Li, Jason Klein Liu, An Huang, Yongsheng Kang, Jinxing Zhang, Chuan Hao, Haowen Wang, Weicheng Gu, Ran Tao, Mingjie Tang, Peihao Wu, Jianzhou Wang, Xianglong Liu, Weifeng Lv, Bryan Dai

机构 * IQuest Coder Team(IQuest Coder团队)

专题命中 仓库级理解 :repository(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本文介绍IQuest-Coder-V1系列模型,通过代码流多阶段训练范式提升软件逻辑动态演化能力,结合预训练、中训练和后训练阶段,实现代码智能在代理软件工程、编程竞赛和复杂工具使用中的先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04537 2026-03-18 cs.SE 57%

ICCheck: A Portable, Language-Agnostic Tool for Synchronizing Code Clones

ICCheck:一种跨语言、可移植的代码克隆同步工具

Motoki Abe, Shinpei Hayashi

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 ICCheck 是一种跨语言、可移植的代码克隆同步工具,通过现有无语言依赖的克隆搜索技术,结合 Git 仓库实现,能够在多种编程语言和开发环境中检测并建议同步代码克隆的修改。

Comments Accepted manuscript in Science of Computer Programming

详情

展开后加载摘要…

URL PDF HTML 收藏