arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-07-03 至 2026-07-03 共收录 10 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 10 篇

2604.22659 2026-07-03 cs.SE 版本更新 83%

RealBench: A Repo-Level Code Generation Benchmark Aligned with Real-World Software Development Practices

RealBench: 一个与真实世界软件开发实践对齐的仓库级代码生成基准测试

Jia Li, Hongyi Deng, Yiran Zhang, Kechi Zhang, Tianqi Shao, Tiankuo Zhao, Weinan Wang, Zhi Jin, Ge Li, Yang Liu, Yingtao Fang, Yihong Dong

专题命中 代码生成 :code generation(title,abstract);repository(abstract);分类 cs.SE

AI总结 RealBench通过结合自然语言需求和UML图,评估LLM在结构化设计下的代码生成能力,揭示了LLM在仓库级代码生成中的性能差距和优化策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02436 2026-07-03 cs.SE cs.AI 新提交 76%

Reasoning effort, not tool access, buys first-try reliability in agentic code generation: an observational study

推理努力,而非工具访问,决定了智能体代码生成的首试可靠性:一项观察性研究

Achint Mehta

机构 * TrendAI

专题命中 代码生成 :code generation(title);分类 cs.SE、cs.AI

AI总结 本研究通过90次独立智能体运行构建同一应用,发现推理努力(从高到极高)将首试完美运行率从28%提升至89%,而测试工具虽增加成本却未改善功能得分或可靠性。

Comments 22 pages, 5 figures, 10 tables. Dataset and evaluation artifacts: https://doi.org/10.5281/zenodo.21134406

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01867 2026-07-03 cs.SE cs.AI 新提交 73%

An Exploratory Study on LLM-Generated Code and Comments in Code Repositories

关于LLM生成的代码和注释在代码仓库中的探索性研究

Yongyi Ji, Jiaji Wang, Yi Zhou, Fuxiang Chen, Hongji Yang

机构 * School of Computing and Mathematical Sciences, University of Leicester(利兹大学计算与数学科学学院)

专题命中 代码生成 :code generation(abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 本研究通过检测工具分析2021-2025年公司和社区维护的仓库,发现LLM生成的代码随时间减少且多出现在测试用例中,注释则相对稳定;公司仓库中LLM生成内容比例更高,且仅少数人工标记的bug与LLM生成代码相关。

Comments Accepted to The Journal of Systems & Software (JSS) on 1 July 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01235 2026-07-03 cs.CL cs.AI cs.SE 新提交 67%

TokenScope: Token-Level Explainability and Interpretability for Code-Oriented Tasks in Large Language Models

TokenScope: 面向大型语言模型中代码任务的令牌级可解释性与解释性

Amirreza Esmaeili, Fatemeh Fard

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 提出TokenScope工具,通过令牌级指标、注意力模式和抽象语法树聚合,实现解码时信号与结构分析的统一,支持交互式令牌替换和反事实分支,以系统研究LLM在代码生成中的行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01595 2026-07-03 cs.AI cs.CL 新提交 62%

Safe and Adaptive Cloud Healing: Verifying LLM-Generated Recovery Plans with a Neural-Symbolic World Model

安全且自适应的云修复:使用神经符号世界模型验证LLM生成的恢复计划

Junyan Tan, Haoran Lin, Siyuan Guo, Yichen Fang, Xinyue Luo, Tianyu Shen, Zeyu Qiao

机构 * Zhejiang University(浙江大学)

专题命中 代码生成 :program synthesis(abstract);分类 cs.CL、cs.AI

AI总结 提出PASE框架,将LLM作为规划引擎生成恢复计划,通过神经符号世界模型验证可行性,并利用DRL优化提示,实现动态自适应修复,显著降低恢复时间并提高未知故障检测精度。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01232 2026-07-03 cs.LG cs.CL 新提交 62%

Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training

一层就够了吗?训练单个Transformer层可以匹配全参数RL训练

Zijian Zhang, Rizhen Hu, Athanasios Glentis, Dawei Li, Chung-Yiu Yau, Hongzhou Lin, Mingyi Hong

机构 * University of Minnesota(明尼苏达大学) Peking University(北京大学) Amazon(亚马逊)

专题命中 代码生成 :code generation(abstract);分类 cs.CL、cs.LG

AI总结 发现RL训练收益高度集中在少数Transformer层,仅训练单层即可恢复大部分全参数RL收益,且高贡献层集中在模型中部。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22063 2026-07-03 cs.SE cs.AI 版本更新 62%

RedCoder: Automated Multi-Turn Red Teaming for Code LLMs

RedCoder: 面向代码大语言模型的自动化多轮红队测试

Wenjie Jacky Mo, Qin Liu, Xiaofei Wen, Dongwon Jung, Hadi Askari, Wenxuan Zhou, Zhe Zhao, Muhao Chen

机构 * University of California, Davis(加州大学戴维斯分校) University of Southern California(南加州大学)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 提出RedCoder,一个通过多轮对话诱导代码大模型生成漏洞代码的自动化红队测试智能体,采用多智能体博弈生成原型对话和攻击策略库,并微调LLM作为骨干,实验表明其优于现有单轮和多轮方法。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02052 2026-07-03 cs.SE 新提交 57%

Mitigating Package Hallucinations in Large Language Models via Model Editing

通过模型编辑缓解大型语言模型中的包幻觉

Shuhan Liu, Yukai Zhao, Xing Hu, Kui Liu, Xiaohu Yang, Xin Xia

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 提出BOUND框架,通过定位与包幻觉相关的模块并应用边界感知的LoRA适配器编辑,有效降低LLM在包推荐、代码生成等任务中的包幻觉率,同时保持有效包推荐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01248 2026-07-03 cs.CY cs.AI 新提交 57%

A Practice Auditing Framework for Large Language Model Use: Collective Empiricism, Pseudo-Rational Cognition, and Governance of AI-Generated Content

大型语言模型使用的实践审计框架:集体经验主义、伪理性认知与AI生成内容治理

Yang Zhao, Yingshuo Li, Zeyu Zhang

机构 * School of Information and Electronics, Beijing Institute of Technology(信息与电子学院,北京理工大学)

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 提出实践审计框架,通过集体经验主义和伪理性认知概念分析LLM使用中的认知风险,并设计基于需求定义、证据审计等步骤的治理流程。

Comments English manuscript. 2 tables, 17 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31763 2026-07-03 cs.AI 新提交 57%

A Self-Evolving Agentic System for Automated Generation and Execution of Biological Protocols

一种用于自动生成和执行生物实验协议的自演化智能体系统

Yankai Jiang, Weiting Tang, Haoran Sun, Zhenyu Tang, Yuejie Hou, Yingnan Han, Rubo Wang, Yueyuxiao Yang, Cheng Liang, Lilong Wang, Wenjie Lou, Xiaosong Wang, Lei Bai, Meng Yang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Genoria AI

专题命中 代码生成 :code generation(abstract);分类 cs.AI

AI总结 提出自演化多智能体系统ProtoPilot,结合专家基准与评估框架,将生物协议自动转化为可执行代码,并通过湿实验反馈迭代优化,实现高通过率的自主实验。

详情

展开后加载摘要…

URL PDF HTML 收藏