arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-07-03 至 2026-07-03 共收录 23 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 8 篇

2607.02436 2026-07-03 cs.SE cs.AI 新提交 76%

Reasoning effort, not tool access, buys first-try reliability in agentic code generation: an observational study

推理努力,而非工具访问,决定了智能体代码生成的首试可靠性:一项观察性研究

Achint Mehta

机构 * TrendAI

专题命中 代码生成 :code generation(title);分类 cs.SE、cs.AI

AI总结 本研究通过90次独立智能体运行构建同一应用,发现推理努力(从高到极高)将首试完美运行率从28%提升至89%,而测试工具虽增加成本却未改善功能得分或可靠性。

Comments 22 pages, 5 figures, 10 tables. Dataset and evaluation artifacts: https://doi.org/10.5281/zenodo.21134406

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01867 2026-07-03 cs.SE cs.AI 新提交 73%

An Exploratory Study on LLM-Generated Code and Comments in Code Repositories

关于LLM生成的代码和注释在代码仓库中的探索性研究

Yongyi Ji, Jiaji Wang, Yi Zhou, Fuxiang Chen, Hongji Yang

机构 * School of Computing and Mathematical Sciences, University of Leicester(利兹大学计算与数学科学学院)

专题命中 代码生成 :code generation(abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 本研究通过检测工具分析2021-2025年公司和社区维护的仓库,发现LLM生成的代码随时间减少且多出现在测试用例中,注释则相对稳定;公司仓库中LLM生成内容比例更高,且仅少数人工标记的bug与LLM生成代码相关。

Comments Accepted to The Journal of Systems & Software (JSS) on 1 July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01235 2026-07-03 cs.CL cs.AI cs.SE 新提交 67%

TokenScope: Token-Level Explainability and Interpretability for Code-Oriented Tasks in Large Language Models

TokenScope: 面向大型语言模型中代码任务的令牌级可解释性与解释性

Amirreza Esmaeili, Fatemeh Fard

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 提出TokenScope工具,通过令牌级指标、注意力模式和抽象语法树聚合,实现解码时信号与结构分析的统一,支持交互式令牌替换和反事实分支,以系统研究LLM在代码生成中的行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01595 2026-07-03 cs.AI cs.CL 新提交 62%

Safe and Adaptive Cloud Healing: Verifying LLM-Generated Recovery Plans with a Neural-Symbolic World Model

安全且自适应的云修复:使用神经符号世界模型验证LLM生成的恢复计划

Junyan Tan, Haoran Lin, Siyuan Guo, Yichen Fang, Xinyue Luo, Tianyu Shen, Zeyu Qiao

机构 * Zhejiang University(浙江大学)

专题命中 代码生成 :program synthesis(abstract);分类 cs.CL、cs.AI

AI总结 提出PASE框架,将LLM作为规划引擎生成恢复计划,通过神经符号世界模型验证可行性,并利用DRL优化提示,实现动态自适应修复,显著降低恢复时间并提高未知故障检测精度。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01232 2026-07-03 cs.LG cs.CL 新提交 62%

Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training

一层就够了吗?训练单个Transformer层可以匹配全参数RL训练

Zijian Zhang, Rizhen Hu, Athanasios Glentis, Dawei Li, Chung-Yiu Yau, Hongzhou Lin, Mingyi Hong

机构 * University of Minnesota(明尼苏达大学) Peking University(北京大学) Amazon(亚马逊)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.LG

AI总结 发现RL训练收益高度集中在少数Transformer层,仅训练单层即可恢复大部分全参数RL收益,且高贡献层集中在模型中部。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02052 2026-07-03 cs.SE 新提交 57%

Mitigating Package Hallucinations in Large Language Models via Model Editing

通过模型编辑缓解大型语言模型中的包幻觉

Shuhan Liu, Yukai Zhao, Xing Hu, Kui Liu, Xiaohu Yang, Xin Xia

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 提出BOUND框架,通过定位与包幻觉相关的模块并应用边界感知的LoRA适配器编辑,有效降低LLM在包推荐、代码生成等任务中的包幻觉率,同时保持有效包推荐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01248 2026-07-03 cs.CY cs.AI 新提交 57%

A Practice Auditing Framework for Large Language Model Use: Collective Empiricism, Pseudo-Rational Cognition, and Governance of AI-Generated Content

大型语言模型使用的实践审计框架:集体经验主义、伪理性认知与AI生成内容治理

Yang Zhao, Yingshuo Li, Zeyu Zhang

机构 * School of Information and Electronics, Beijing Institute of Technology(信息与电子学院,北京理工大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 提出实践审计框架,通过集体经验主义和伪理性认知概念分析LLM使用中的认知风险,并设计基于需求定义、证据审计等步骤的治理流程。

Comments English manuscript. 2 tables, 17 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31763 2026-07-03 cs.AI 新提交 57%

A Self-Evolving Agentic System for Automated Generation and Execution of Biological Protocols

一种用于自动生成和执行生物实验协议的自演化智能体系统

Yankai Jiang, Weiting Tang, Haoran Sun, Zhenyu Tang, Yuejie Hou, Yingnan Han, Rubo Wang, Yueyuxiao Yang, Cheng Liang, Lilong Wang, Wenjie Lou, Xiaosong Wang, Lei Bai, Meng Yang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Genoria AI

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 提出自演化多智能体系统ProtoPilot,结合专家基准与评估框架,将生物协议自动转化为可执行代码,并通过湿实验反馈迭代优化,实现高通过率的自主实验。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 6 篇

2607.01929 2026-07-03 cs.SE 新提交 83%

Beyond Textual Repository Exploration: Dual-Modal Structural Reasoning for Agentic Issue Resolution

超越文本仓库探索:面向智能体问题解决的双模态结构推理

Jiayi Zhang, Kai Huang, Yang Liu, Chunyang Chen

专题命中 软件智能体 :repository(title,abstract);program repair(abstract);分类 cs.SE

AI总结 提出DUALVIEW框架,通过模块耦合图、函数调用图、类层次图和程序依赖图四种图视图,结合视觉与文本响应,使智能体在仓库探索中直接推理代码依赖结构,提升长时域问题解决性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02389 2026-07-03 cs.AI cs.CR cs.SE 新提交 81%

Steerability via constraints: a substrate for scalable oversight of coding agents

通过约束实现可操控性:编码智能体可扩展监督的基础

Thomas Winninger

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 提出通过访问控制、网络策略和工具强制编码规范等传统工程管理方法约束编码智能体,以降低人类监督成本并提升安全性;实验表明约束基板使后门检测召回率从54.5%提升至90.9%。

Comments Accepted to the Deep Learning for Code Workshop at the 43rd International Conference on Machine Learning, Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01810 2026-07-03 cs.SE cs.AI 新提交 81%

Decoupling Code Complexity from Newcomer Participation: A Causal Study of AI Coding Agent Adoption in OSS

解耦代码复杂度与新参与者参与度:AI编码代理在开源软件中采纳的因果研究

Weiwei Xu, Xuanning Cui, Hengzhi Ye, Minghui Zhou

机构 * School of Computer Science, Peking University(北京大学计算机学院) Key Laboratory of High Confidence Software Technologies, Ministry of Education, China(教育部高可信软件技术重点实验室)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 通过因果推断方法,研究AI编码代理(如Cursor和Claude Code)在开源项目中的采纳是否会导致新参与者减少,发现采纳后新参与者流入未显著下降,代码复杂度虽有增加但未影响新人参与。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01418 2026-07-03 cs.SE cs.AI cs.HC 新提交 81%

Adoption and Impact of Command-Line AI Coding Agents: A Study of Microsoft's Early 2026 Rollout of Claude Code and GitHub Copilot CLI

命令行AI编码代理的采用与影响:微软2026年初推出Claude Code和GitHub Copilot CLI的研究

Emerson Murphy-Hill, Jenna Butler, Alexandra Savelieva

机构 * Microsoft(微软)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 研究微软2026年初推出Claude Code和GitHub Copilot CLI时,数万名工程师的采用模式、留存因素及对代码合并的影响,发现社交网络驱动首次使用,编码活跃度关联留存,采用者合并PR数量增加约24%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02294 2026-07-03 cs.SE 新提交 79%

Coding Agents Are Guessing: Measuring Action-Boundary Violations in Underspecified DevOps Instructions

编码代理在猜测:测量欠指定DevOps指令中的动作边界违规

Zimo Ji, Zekai Zhang, Congying Xu, Zongjie Li, Yudong Gao, Shuai Wang, Shing-Chi Cheung

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 提出UnderSpecBench基准,通过69个任务族和2208个提示变体,评估编码代理在欠指定DevOps指令下的动作边界违规,发现55.8-67.8%的运行至少违反一个边界,表明完成度评估高估了安全自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02357 2026-07-03 cs.CR cs.SE 新提交 57%

Cloak and Detonate: Scanner Evasion and Dynamic Detection of Agent Skill Malware

伪装与引爆:技能型恶意软件的扫描规避与动态检测

Zimo Ji, Congying Xu, Zongjie Li, Yudong Gao, Xin Wei, Shuai Wang, Shing-Chi Cheung

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 针对LLM编码代理技能市场中的恶意技能,提出两种规避静态扫描的方法(结构混淆和自提取技能打包),并设计基于沙箱运行时行为审计的检测系统SkillDetonate,实现97%检测率与2%误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 2 篇

2607.01360 2026-07-03 cs.SE 新提交 70%

Benchmarking Code Improvement with Progressive, Adaptive, and Interactive Feedback

使用渐进式、自适应和交互式反馈对代码改进进行基准测试

Cuong Chi Le, Aashish Yadavally, Minh Le-Anh, Tien N. Nguyen

专题命中 程序修复 :code generation(abstract);program repair(abstract);分类 cs.SE

AI总结 提出PAIR-Bench基准,通过渐进式提示和结构化反馈协议,细粒度评估大语言模型在代码改进中的修复能力、泛化能力和所需辅助程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01597 2026-07-03 cs.SE 新提交 57%

A Single Patch Is Not Enough: Deterministic Fusion of Repair Candidates

单个补丁不够:修复候选的确定性融合

Boyang Yang, Xiangliang Hu, Luyao Ren, Yanjun Chen, Bach Le, Tegawendé F. Bissyandé, Haoye Tian

专题命中 程序修复 :coding agent(abstract);分类 cs.SE

AI总结 针对代码修复中候选补丁池的“pass@k到pass@1”差距,提出PatchFusion方法,通过确定性原子证据融合选择并构造最终补丁,无需测试结果,在三个基准上优于现有选择器。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 代码评测 1 篇

2607.02390 2026-07-03 cs.LG 新提交 74%

DecompRL: Solving Harder Problems by Learning Modular Code Generation

DecompRL: 通过学习模块化代码生成解决更难的问题

Juliette Decugis, Fabian Gloeckle, Francis Bach, Taco Cohen, Gabriel Synnaeve

机构 * FAIR at Meta Inria, \'Ecole Normale Sup\'erieure

专题命中 代码评测 :code generation(title);分类 cs.LG

AI总结 提出DecompRL算法,通过强化学习将问题分解为可复用的子函数,重组模块生成候选解,将GPU瓶颈转移至CPU评估,在LiveCodeBench和CodeContests上超越标准RL基线。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仓库级理解 6 篇

2607.01764 2026-07-03 cs.AI 新提交 79%

Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction

Mastermind: 基于策略学习的仓库级漏洞复现

Mingzhe Du, Luu Anh Tuan, Tianyi Wu, Renyang Liu, Zhijiang Guo, Dong Huang, See-Kiong Ng

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 仓库级理解 :repository(title,abstract);分类 cs.AI

AI总结 提出Mastermind双循环框架,通过策略学习(SFT+GRPO)提升LLM代理在仓库级漏洞复现中的表现,在260个训练任务和200个测试任务上达到84.5%通过率,并成功迁移至不同执行器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01609 2026-07-03 cs.LG 新提交 57%

SINA: A Fully Automated Circuit Schematic Image to Netlist Generator Using Artificial Intelligence

SINA: 一种使用人工智能的全自动电路原理图图像到网表生成器

Saoud Aldowaish, Yashwanth Karumanchi, Kai-Chen Chiang, Mohammed Ayman Habib, Finn Murphy, Rishen Cao, Morteza Fayazi

机构 * The Department of Electrical and Computer Engineering, University of Utah(犹他大学电气与计算机工程系) The Department of Electrical, Computer & Energy Engineering, University of Colorado Boulder(科罗拉多大学博尔德分校电气、计算机与能源工程系)

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 提出SINA,一种全自动开源流水线,集成深度学习、连通分量标记、OCR和视觉语言模型,实现从电路原理图图像到网表的转换,在IC和PCB级别均达到96.67%的生成准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01494 2026-07-03 cs.SE cs.ET cs.HC cs.SI 新提交 57%

Insights from GitHub Community on the Matter Standard: Developer Perspectives and Challenges

GitHub社区对Matter标准的洞察:开发者视角与挑战

Muhammad Hassan, Carl Gunter, Susan Landau, Masooda Bashir

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 通过分析GitHub上超过13,000个议题,识别出Matter标准在测试、互操作性、开发及平台网络方面的四大挑战,为改进测试基础设施和跨厂商指南提供机会。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26979 2026-07-03 cs.SE 新提交 57%

How Much Static Structure Do Code Agents Need? A Study of Deterministic Anchoring

代码智能体需要多少静态结构?关于确定性锚定的研究

Zhihao Lin, Mingyi Zhou, Yizhuo Yang, Li Li

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 研究轻量级静态分析(如调用图、继承层次)作为确定性锚定,通过注入结构注释提高代码智能体导航的可复现性和稳定性,发现锚定效果依赖粒度与仓库特性。

Comments Accepted to the ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA 2026). 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26297 2026-07-03 cs.DC cs.CE 新提交 50%

A Distributed Quantum Approximate Optimization Algorithm Simulator for Engineering Design Optimization

面向工程设计优化的分布式量子近似优化算法模拟器

Ali Rajabi, Milad Hasanzadeh, Amin Kargarian

专题命中 仓库级理解 :repository(abstract)

AI总结 提出一个兼容Qiskit的分布式量子近似优化算法模拟器,用于解决工程设计中的QUBO问题,支持单QPU和分布式多QPU执行模式,并包含运行时优化和图形界面。

Comments 37 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13306 2026-07-03 cs.GT 新提交 50%

EconCSLib: AI-Assisted Lean Formalization for Economics & Computation research

EconCSLib: 人工智能辅助的经济学与计算研究Lean形式化

Nikhil Garg

专题命中 仓库级理解 :repository(abstract)

AI总结 提出EconCSLib,一个基于Lean 4的库和工作流,利用语言模型辅助形式化经济学与计算领域的研究论文,通过人-AI-Lean协作流程实现论文声明到形式化语句的翻译与验证。

Comments Accepted to EC'26 Workshop on AI-Driven Research in EconCS (AI-EconCS '26)

详情

展开后加载摘要…

URL PDF HTML 收藏