arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-05-12 至 2026-05-12 共收录 55 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 22 篇

2605.08112 2026-05-12 cs.SE cs.AI cs.CE cs.LG cs.LO 89%

Context-Augmented Code Generation: How Product Context Improves AI Coding Agent Decision Compliance by 49%

上下文增强的代码生成:产品上下文如何通过49%提高AI编码代理的决策合规性

Drew Dillon, Kasyap Varanasi

机构 * Brief(简述)

专题命中 代码生成 :coding agent(title,abstract);code generation(title);repository(abstract,comments);分类 cs.SE、cs.AI、cs.LG

AI总结 本文提出一个衡量决策合规性的基准,通过产品上下文检索系统提升AI编码代理的决策合规性,实验结果显示合规率从46%提升至95%。

Comments 16 pages, 3 figures, 16 tables. Benchmark repository: https://github.com/brief-hq/dcbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08553 2026-05-12 cs.SE cs.AI cs.LG 85%

VeriContest: A Competitive-Programming Benchmark for Verifiable Code Generation

VeriContest:一个用于可验证代码生成的竞技编程基准

Zichen Xie, Mrigank Pawagi, Yuxin Liu, Aaditi Rai, Lize Shao, John Berberian, Sicong Che, Wenxi Wang

机构 * University of Virginia(弗吉尼亚大学) Indian Institute of Science(印度科学研究院) Rice University(里士曼大学) Independent Researcher(独立研究者)

专题命中 代码生成 :code generation(title,abstract);program synthesis(abstract);分类 cs.SE、cs.AI、cs.LG

AI总结 VeriContest通过946个LeetCode和Codeforces问题,评估可验证代码生成的性能,揭示模型在生成规范和证明时的瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07833 2026-05-12 cs.LG cs.AI 81%

MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation

MURPHY:具有回顾性信用分配的反馈感知GRPO用于多轮代码生成

Chanakya Ekbote, Vijay Lingam, Sujay Sanghavi, Jun Huan, Behrooz Omidvar-Tehrani, Anoop Deoras, Stefano Soatto

机构 * Massachusetts Institute of Technology(麻省理工学院) AWS AI(AWS人工智能)

专题命中 代码生成 :code generation(title,abstract);分类 cs.AI、cs.LG

AI总结 MURPHY通过构建反馈条件化的rollout树,实现多轮自修正代码生成,采用最大奖励和平均奖励策略,并引入post-rollout剪枝机制,提升多轮优化效率。

Comments 21 pages, 2 figures, 8 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09023 2026-05-12 cs.SE 79%

Using Semantic Distance to Estimate Uncertainty in LLM-Based Code Generation

利用语义距离估计基于大语言模型的代码生成的不确定性

Weilin He, Arindam Sharma, Cristina David

专题命中 代码生成 :code generation(title,abstract);分类 cs.SE

AI总结 本文提出基于语义距离的不确定性估计方法,通过衡量生成程序执行行为的差异性,提升代码生成的正确性评估效果,在多个基准测试中优于现有方法。

Comments Preprint. 23 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08680 2026-05-12 cs.SE cs.AI cs.LG 78%

Semantic Voting: Execution-Grounded Consensus for LLM Code Generation

语义投票:基于执行的共识机制用于大语言模型代码生成

Shan Jiang, Zijian Yi, Chenguang Zhu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 代码生成 :code generation(title);分类 cs.SE、cs.AI、cs.LG

AI总结 本文研究了大语言模型代码生成中基于执行的共识机制,通过比较不同方法发现输入质量对结果影响更大,语义投票在多数配置中表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10133 2026-05-12 cs.CR cs.SE 74%

Usability as a Weapon: Attacking the Safety of LLM-Based Code Generation via Usability Requirements

可用性作为武器:通过可用性需求攻击基于LLM的代码生成的安全性

Yue Li, Xiao Li, Hao Wu, Yue Zhang, Yechao Zhang, Yating Liu, Fengyuan Xu, Sheng Zhong

专题命中 代码生成 :code generation(title);分类 cs.SE

AI总结 研究通过可用性需求攻击LLM生成代码的安全性,提出U-SPLOIT框架,利用可用性压力导致安全约束被忽略,成功率达98.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06464 2026-05-12 cs.SE 70%

To What Extent Does Agent-generated Code Require Maintenance? An Empirical Study

代理生成的代码需要多少维护?一项实证研究

Shota Sawada, Tatsuya Shirai, Yutaro Kashiwa, Ken'ichi Yamaguchi, Hiroshi Iwata, Hajimu Iida

专题命中 代码生成 :code generation(abstract);coding agent(abstract);分类 cs.SE

AI总结 研究通过分析AI生成与人工编写代码的维护情况,发现AI代码维护频率较低,主要修改类型为功能扩展,而人工代码则以修复bug为主,人类开发者主导了大部分维护工作。

Comments 6 pages, 2 figures, 2 tables. Accepted at the 30th International Conference on Evaluation and Assessment in Software Engineering (EASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03783 2026-05-12 cs.LG cs.AI cs.CL 67%

Efficient Estimation of Kernel Surrogate Models for Task Attribution

高效估计用于任务归因的核替代模型

Zhenshuo Zhang, Minxuan Duan, Hongyang R. Zhang

机构 * Northeastern University(东北大学)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出核替代模型用于高效估计任务归因,通过第二阶分析建立线性替代模型与影响函数的联系,并在多个任务设置中验证其有效性,实现更高的相关性和可扩展性。

Comments 27 pages. Appeared in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09985 2026-05-12 cs.AI cs.LG cs.NE 62%

Prospective Compression in Human Abstraction Learning

前瞻性压缩在人类抽象学习中的作用

Leonardo Hernandez Cano, Ivan Zareski, Luisa El Amouri, Pinzhe Zhao, Max Mascini, Emanuele Sansone, Yewen Pu, Bonan Zhao, Marta Kryven

机构 * Massachusetts Institute of Technology(麻省理工学院) Dalhousie University(达尔豪斯大学) Nanyang Technological University(南洋理工大学)

专题命中 代码生成 :program synthesis(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了非平稳环境下人类如何前瞻性压缩未来任务,通过模式构建任务发现人类抽象学习与现有回顾性压缩算法存在差异。

Comments under review at neurips 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09745 2026-05-12 cs.LG cs.AI cs.IT math.IT 62%

Entropy-informed Decoding: Adaptive Information-Driven Branching

基于熵的信息解码:自适应信息驱动的分支

Benjamin Patrick Evans, Sumitra Ganesh, Leo Ardon

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) JP Morgan AI Research, London, UK(摩根大通AI研究,伦敦,英国) JP Morgan AI Research, New York, USA(摩根大通AI研究,纽约,美国)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出EDEN解码框架,通过自适应分配计算资源提升生成效率,在数学推理、代码生成等任务中优于传统解码策略。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04078 2026-05-12 cs.LG cs.AI 62%

Validity-Calibrated Reasoning Distillation

有效性校准的推理蒸馏

Khouloud Saadi, Di Wang

机构 * Department of Computer Science(计算机科学系) KAUST(科威特大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出有效性校准的推理蒸馏框架,通过动态监督机制优化学习信号分配,提升数学推理、代码生成和指令遵循任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02372 2026-05-12 cs.CR cs.AI cs.SE 62%

Scam2Prompt: A Scalable Framework for Auditing Malicious Scam Endpoints in Production LLMs

Scam2Prompt: 一种可扩展的框架,用于审计生产LLM中的恶意诈骗端点

Zhiyang Chen, Tara Saba, Xun Deng, Xujie Si, Fan Long

机构 * OpenAI

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 Scam2Prompt通过生成开发者风格提示来测试LLM生成恶意代码的能力,发现4.24%的LLM会生成恶意URL,且在2025年发布的七种LLM中,恶意代码生成率高达12.9%-47.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10754 2026-05-12 cs.AI 57%

The Agent Use of Agent Beings: Agent Cybernetics Is the Missing Science of Foundation Agents

代理行为的代理使用:代理循证学是基础代理的缺失科学

Xinrun Wang, Chang Yang, He Zhao, Zhuoyi Lin, Shuyue Hu

机构 * Singapore Management University(新加坡管理大学) The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学) Institute for Infocomm Research, Agency for Science, Technology and Research (A*STAR)(信息通信研究院,科技研究局(A*STAR)) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本文提出代理循证学作为基础代理的理论基础,通过将经典循证学定律映射到代理设计原则,提出可靠性、持续运行和自我改进三大工程需求,以指导复杂任务中的代理设计与部署。

Comments Preliminary Work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10712 2026-05-12 cs.SE cs.CR 57%

AutoSOUP: Safety-Oriented Unit Proof Generation for Component-level Memory-Safety Verification

AutoSOUP:面向组件级内存安全验证的安全导向单元证明

Paschal C. Amusuo, Ricardo Calvo, Dharun Anandayuvaraj, Taylor Le Lievre, Kevin Kolyakov, Elijah Jorgensen, Aravind Machiry, James C. Davis

专题命中 代码生成 :program synthesis(abstract);分类 cs.SE

AI总结 AutoSOUP通过安全导向单元证明自动化组件级内存安全验证,结合确定性程序合成与LLM,生成可验证的证明以提高内存安全验证的自动化水平。

Comments 13 main pages, 7 appendix pages, 2 figures, 5 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07525 2026-05-12 cs.SE 57%

Can LLMs Solve Science or Just Write Code? Evaluating Quantum Solver Generation

LLMs能否解决科学问题或只是编写代码?评估量子求解器生成

Luciano Baresi, Domenico Bianculli, Maryse Ernzer, Livia Lestingi, Fabrizio Pastore, Seung Yeob Shin

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本文提出Q-SAGE方法,通过迭代优化评估LLM生成量子求解器的能力,发现迭代改进提升成功率但带来计算开销,模型能力增强后失败模式从执行错误转为数值不准确,揭示LLM在量子软件中的局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11578 2026-05-12 cs.AI 57%

Efficient LLM Collaboration via Planning

通过规划实现高效的LLM协作

Byeongchan Lee, Jonghoon Lee, Dongyoung Kim, Jaehyung Kim, Kyungjoon Park, Dongjun Lee, Jinwoo Shin

机构 * KAIST(韩国科学技术院) Yonsei University(延世大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本文提出COPE框架,通过规划模型与执行模型的协作,提升小模型和大模型在复杂任务中的性能,同时显著降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09675 2026-05-12 cs.AI cs.MA 57%

CodeClinic: Evaluating Automation of Coding Skills for Clinical Reasoning Agents

CodeClinic:评估临床推理代理的编码技能自动化

Timothy Ossowski, Xinchi Liu, Danyal Maqbool, Vaibhav Dhanuka, Sheng Zhang, Hoifung Poon, Majid Afshar, Tyler Bradshaw, Junjie Hu

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Microsoft Research(微软研究院)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 CodeClinic通过MIMIC-IV构建基准,评估LLM代理是否能合成和组合可重用的临床技能,而非依赖固定工具库,包含纵向ICU监控和组合信息检索任务,提升多步推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08941 2026-05-12 cs.AI 57%

MDGYM: Benchmarking AI Agents on Molecular Simulations

MDGYM:在分子模拟上评估AI代理的基准测试

Vinay Kumar, Satyendra Rajput, Mausam, N. M. Anoop Krishnan

机构 * Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(印度理工学院德里人工智能学院) Department of Computer Science and Engineering, Indian Institute of Technology Delhi(印度理工学院德里计算机科学与工程系) Department of Civil and Environmental Engineering, Indian Institute of Technology Delhi(印度理工学院德里土木与环境工程系)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本文通过MDGYM基准测试,评估了AI代理在分子动力学模拟中的表现,发现现有代理在物理推理方面存在显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08687 2026-05-12 cs.DB cs.AI 57%

PrepBench: How Far Are We from Natural-Language-Driven Data Preparation?

PrepBench: 我们距离自然语言驱动的数据准备还有多远?

Jingzhe Xu, Rui Wang, Jiannan Wang, Guoliang Li

机构 * Department of Computer Science and Technology, BNRist, Tsinghua University(计算机科学与技术系,BNRist,清华大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 PrepBench评估自然语言驱动的数据准备能力,涵盖交互澄清、代码生成和代码到工作流翻译三项核心能力,通过爬取数据挑战并设计系统性基准,揭示当前LLM在实现该范式转变中的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08472 2026-05-12 cs.AI 57%

Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models

中期使用自生成数据提升语言模型中的强化学习

Aswin RRV, Jacob Dineen, Divij Handa, Mihir Parmar, Ben Zhou, Swaroop Mishra, Chitta Baral

机构 * Arizona State University(亚利桑那州立大学) Google Cloud AI Research(谷歌云人工智能研究) Google DeepMind(谷歌DeepMind)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本文研究在强化学习前使用多样化的自生成数据提升语言模型的强化学习效果,通过自生成数据训练后,模型在数学推理等任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29632 2026-05-12 cs.MA cs.AI 57%

An Empirical Study of Multi-Agent Collaboration for Automated Research

多智能体协作在自动化研究中的实证研究

Yang Shen, Zhenyi Yi, Ziyi Zhao, Lijun Sun, Dongyang Li, Chin-Teng Lin, Yuhui Shi

机构 * University of Technology Sydney(悉尼技术大学) Southern University of Science and Technology(南方科技大学) Shenzhen Technology University(深圳技术大学) Tongji University(同济大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 本文通过实证研究比较了不同多智能体结构在自动化机器学习优化中的效果,发现子代理架构在时间受限下更稳定高效,而智能体团队架构在计算预算充足时能实现深度理论对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04910 2026-05-12 cs.SE 57%

Reducing the Costs of Proof Synthesis on Rust Systems by Scaling Up a Seed Training Set

通过扩大种子训练集来降低Rust系统证明合成的成本

Nongyu Di, Tianyu Chen, Shan Lu, Shuai Lu, Yeyun Gong, Peng Cheng, Jacob R. Lorch, Yuan Yao, Xiaoxing Ma

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本文提出VeruSyn数据合成管道,通过自合成和教程合成扩大Verus验证工具的数据集,生成690万Rust程序及其形式化规格证明,提升代码生成模型的性价比和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 12 篇

2605.08468 2026-05-12 cs.CL cs.AI cs.LG 85%

PYTHALAB-MERA: Validation-Grounded Memory, Retrieval, and Acceptance Control for Frozen-LLM Coding Agents

PYTHALAB-MERA:基于验证的内存、检索与接受控制用于冻结LLM编码代理

Mehmet Iscan

机构 * PythaLab, Yildiz Technical University(PythaLab,伊兹密尔技术大学)

专题命中 软件智能体 :coding agent(title,abstract);code generation(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PYTHALAB-MERA通过轻量级外部控制器实现验证基础的内存管理、适应性检索与延迟信用分配,提升冻结本地模型在编码任务中的验证成功率。

Comments 28 pages, 4 figures, 7 tables; local CLI artifact evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08366 2026-05-12 cs.LG cs.SE 81%

SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution

SWE Atlas:超越问题解决的编码代理基准测试

Mohit Raghavendra, Soham Dan, Miguel Romero Calvo, Yannis Yiming He, Johannes Baptist Mols, Gautam Anand, Cole McCollum, Edgar Arakelyan, Vijay Bharadwaj, Andrew Park, Jeff Da, MohammadHossein Rezaei, Bing Liu, Brad Kenstler, Yunzhong He

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.LG

AI总结 SWE Atlas通过涵盖代码库问答、测试编写和重构三个软件工程流程,提供了一种新的基准测试套件,评估编码代理的正确性和工程质量。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08927 2026-05-12 cs.PL 79%

Quantitative Comparison of Credible Compilation and Verification In Coding Agent Compiler Development

代码代理编译器开发中可信编译与验证的定量比较

Martin Rinard

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.PL

AI总结 本文通过首个由人类监督的验证编译器,比较了可信编译与验证两种编译验证方法的效率,发现验证需要更多开发工作量,且验证优化选择更不高效的算法,证书检查时间占主导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09863 2026-05-12 cs.CR cs.AI cs.CL cs.IR cs.LG 67%

Nautilus Compass: Black-box Persona Drift Detection for Production LLM Agents

Nautilus Compass:生产LLM代理的黑盒人格漂移检测

Chunxiao Wang

机构 * Yiluo Technology Co., Ltd.(亿洛科技有限公司)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Nautilus Compass通过提示文本层的余弦相似度检测生产编码代理的人格漂移,无需调用LLM提取事实,实现高效且低成本的代理记忆层。

Comments 19 pages, 6 figures. MIT-licensed code + reproduction scripts at github.com/chunxiaoxx/nautilus-compass

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09283 2026-05-12 cs.AI cs.CL 62%

A Prompt-Aware Structuring Framework for Reliable Reuse of AI-Generated Content in the Agentic Web

面向可靠重用的AI生成内容结构化框架

Shusaku Egami, Masahiro Hamasaki

机构 * National Institute of Advanced Industrial Sciencen

专题命中 软件智能体 :software agent(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种结构化框架,通过在生成时自动附加元数据,提升AI生成内容的可追溯性和可靠性,以支持其安全重用。

Comments 5 pages, 2 figures, Accepted at FAAW@WWW2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10480 2026-05-12 cs.AI 57%

ASIA: an Autonomous System Identification Agent

ASIA:一个自主系统识别代理

Dario Piga, Marco Forgione

机构 * Dalle Molle Institute for Artificial Intelligence (IDSIA), SUPSI(达勒莫利人工智能研究所(IDSIA),SUPSI)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 ASIA通过自主编码代理自动完成系统识别中的模型选择与参数调优,基于两个基准测试分析其搜索行为和发现的架构策略,探讨了该方法的潜力与局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09879 2026-05-12 cs.AI 57%

M2A: Synergizing Mathematical and Agentic Reasoning in Large Language Models

M2A:在大型语言模型中协同数学与代理推理

Junjian Wang, Xin Zhou, Qiran Xu, Kun Zhan

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Li Auto Inc.(Li Auto公司)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文提出M2A框架,通过模型融合协同数学与代理推理,提升多任务学习下的推理稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09684 2026-05-12 cs.CR cs.AI 57%

MonitoringBench: Semi-Automated Red-Teaming for Agent Monitoring

MonitoringBench: 面向代理监控的半自动化红队测试

Monika Jotautaitė, Maria Angelica Martinez, Ollie Matthews, Tyler Tracy

机构 * Independent(独立)

专题命中 软件智能体 :coding agent(abstract);分类 cs.AI

AI总结 本文提出半自动化红队方法,针对代理监控中的攻击检测问题,通过改进攻击生成和测试流程,构建了包含2644条攻击轨迹的MonitoringBench基准,评估监控能力与失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏