arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-07 至 2026-08-07 共收录 26 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码生成 4 篇

2503.17181 2026-08-07 cs.SE cs.AI cs.CL 交叉投稿 67%

A Study of LLMs' Preferences for Libraries and Programming Languages

对大型语言模型在库和编程语言偏好方面的研究

Lukas Twist, Mark Harman, Don Syme, Joost Noppen, Helen Yannakoudakis, Detlef Nauck, Jie M. Zhang

机构 * King’s College London(伦敦国王学院) University College London(伦敦大学学院) Digital AI Research, BT Group(BT集团数字人工智能研究)

专题命中 代码生成 :code generation(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本研究探讨了大型语言模型在生成代码时对库和编程语言的选择偏好,通过实证研究分析了八种不同大型语言模型在库和语言选择上的倾向,发现模型倾向于使用广泛采用的库如NumPy,并且在某些情况下这种选择并非必要,同时也显示出对Python的偏好,尽管在某些高性能项目初始化任务中Python并非最优选择。

Comments 21 pages, 10 tables, 3 figures. Accepted to Findings of ACL 2026

Journal ref Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14111 2026-08-07 cs.AI cs.DC cs.LG 62%

CUDA-L1: Improving CUDA Optimization via Contrastive Reinforcement Learning

CUDA-L1: 通过对比强化学习提升CUDA优化

Xiaoya Li, Albert Wang, Guoyin Wang, Jiwei Li, Chris Shum

机构 * DeepReinforce Team(深强化团队)

专题命中 代码生成 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 CUDA-L1通过对比强化学习提升CUDA优化,实现显著加速并展示出优化策略的可移植性和有效性。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05959 2026-08-07 cs.SE 新提交 57%

AgentExecutor: Partial Code Execution via Agentic Context Generation

AgentExecutor:基于智能体上下文生成的部分代码执行工具

Junkai Chen, Chengran Yang, Xing Hu, Zhenhao Li, Xin Xia, David Lo

专题命中 代码生成 :program synthesis(abstract);分类 cs.SE

AI总结 本文提出多智能体框架AgentExecutor,通过三阶段设计和自适应优化策略提升部分代码执行效果,在两个数据集上的覆盖度、执行时间和成本均优于现有最优方法Treefix。

Comments ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05561 2026-08-07 cs.SE 新提交 57%

Exploring Dependence, Overreliance, and Addiction Related Behaviors Associated with Large Language Model Use Among Software Engineers

探索软件工程师使用大语言模型(LLMs)相关的依赖、过度依赖及成瘾相关行为

Ronnie de Souza Santos, Italo Santos, Matheus de Moraes Leça, Cleyton Magalhaes, Mairieli Wessel

专题命中 代码生成 :code generation(abstract);分类 cs.SE

AI总结 本研究通过对119名软件从业者的调查,分析了工程师使用LLMs时的依赖、过度依赖及成瘾相关行为,发现LLMs已成为软件工程的习惯性工具,多数使用具功能性,需促进适当依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 8 篇

2608.05886 2026-08-07 cs.SE cs.AI 新提交 84%

CodeGrep: An RL-Trained Retrieval Agent for LLM Coding Agents

CodeGrep:用于LLM编码智能体的基于强化学习训练的检索智能体

Wuya Chen, Yihao yang, Yang Cao, Yue Lin

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 该研究针对LLM编码智能体查找文件效率低的问题,提出基于GRPO训练的14B检索智能体CodeGrep,在SWE-Bench Verified上保持解决率的同时,减少了交互轮数和token使用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06153 2026-08-07 cs.SE cs.AI 新提交 81%

Learning Globally Reusable Skills for Coding Agents

为编码智能体学习全局可复用技能

Chen Yang, Jiashuo Tian, Ziqi Wang, Xinyin Liu, Meiru Ye, Junjie Chen

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 研究针对编码智能体技能进化的过拟合与泛化问题,提出GSE框架,通过技能关系图、聚类整合与回放验证优化,在多个编码任务与智能体上实现性能提升,效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19380 2026-08-07 cs.SE cs.LG 版本更新 81%

ClayBuddy: A Framework, Evaluation, & Mitigation of Coding Agent Failures

AgentArmor:编码代理失败的框架、评估与缓解

Kenneth Ge, Andre Assis

机构 * Anthropic Fellows Program(Anthropic Fellow 项目) Constellation

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.LG

AI总结 提出AgentArmor框架,通过系统提示增强、命令分类器、三振政策等机制,缓解编码代理因规范不足、能力错误和工具错误导致的失败,显著提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05223 2026-08-07 cs.SE cs.CR 新提交 79%

Towards a Risk Assessment of Malicious Skill Files in Coding Agents

面向编码智能体中恶意技能文件的风险评估

Rui Yang, Michael Fu, Kla Tantithamthavorn, Chetan Arora, Joey Chua

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 该研究针对编码智能体技能接口的恶意文件风险,提出对抗性技能合成方法与评估流水线,发现企业级智能体易被恶意技能利用,仅少数运行有明确安全识别,呼吁企业提前评估风险。

Comments 29 pages, 6 figures, 6 tables. Preprint; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02687 2026-08-07 cs.CR cs.SE 版本更新 79%

PolicyGuard: Prompt-Configurable Semantic DLP for LLM Coding Agents

PolicyGuard:面向LLM编码智能体的可配置提示语义数据防泄漏方案

Kyutae Park, Jungwon Kim, Daeyeol Shim

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE

AI总结 针对LLM编码智能体的PolicyGuard框架,以自然语言策略文件引导LLM分类用户提示,在冻结测试集和隐藏保留集上表现优异,泛化与跨模型能力突出。

Comments This paper is being withdrawn because it was submitted prior to completion of a required institutional review process. The authors intend to resubmit after the review is complete

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01347 2026-08-07 cs.CL 版本更新 79%

Same Task, Different Work: Prompt-Induced Waste in Coding Agents

提示词诱导的大推理模型浪费:一项预注册的双框架编码智能体基准测试

Sarel Weinberger, Amir Hozez

机构 * PointFive

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL

AI总结 该研究通过预注册基准测试发现,提示词措辞和智能体框架会大幅影响大推理编码智能体的成本,部分提示指令可成倍增加推理成本却不提升任务成功率,框架选择的成本差异更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05884 2026-08-07 cs.CR cs.CL 新提交 74%

The Vulnerability With No CVE: Managing Persistent Gaps Between Mandate and Authority in AI Coding Agents

无CVE的漏洞:管理AI编码智能体中授权与权限之间的持续差距

Shayell Aharon Salomon Amir Shaked Matan Noga

专题命中 软件智能体 :coding agent(title);分类 cs.CL

AI总结 该研究针对AI编码智能体中授权与权限的持续差距,提出智能体姿态漏洞(APV)的概念,区分其与相关风险,提供定义、模式、生命周期等内容,为相关安全管理提供可操作框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09297 2026-08-07 cs.SE cs.AI 版本更新 62%

SkillMOO: Multi-Objective Optimization of Agent Skills for Software Engineering

SkillMOO:软件工程中代理技能的多目标优化

Jingzhi Gong, Ruizhen Gu, Zhiwei Fei, Yazhuo Cao, Lukas Twist, Alina Geiger, Shuo Han, Dominik Sobania, Federica Sarro, Jie M. Zhang

机构 * King's College London(伦敦国王学院) Queen's University Belfast(贝尔法斯特女王大学) Nanjing University(南京大学) Johannes Gutenberg University Mainz(美因茨约翰尼斯·古滕贝格大学) University College London(伦敦大学学院) University of Duisburg-Essen(杜伊斯堡- Essen大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文提出SkillMOO框架,通过LLM提议的编辑和NSGA-II算法优化代理技能包,提升任务成功率并降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 程序修复 1 篇

2604.02647 2026-08-07 cs.SE 版本更新 79%

From Guessing to Seeing: Enhancing LLM-Based Program Repair via Trace-Guided Multi-strategy Debate

通过多智能体辩论引导的运行时执行轨迹指导的自动程序修复

Jiaqing Wu, Tong Wu, Manqing Zhang, Yunwei Dong, Bo Shen

专题命中 程序修复 :program repair(title,abstract);分类 cs.SE

AI总结 本文提出TraceRepair框架,利用运行时事实作为共享约束进行补丁验证,通过多智能体协作提高修复效率和泛化能力,实验显示其在修复缺陷和处理新 bug 数据集上表现优异。

Comments 13 pages, 4 figures, 10 tables. Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 测试生成 1 篇

2608.05822 2026-08-07 cs.SE 新提交 57%

Agent-Based Test Assertion Generation via Diverse Perspective Aggregation

基于智能体的多视角聚合测试断言生成

Dong Wang, Qiaoyu Han, Lin Yang, Jianyi Zhou, Guangtai Liang, Junjie Chen

专题命中 测试生成 :code generation(abstract);分类 cs.SE

AI总结 针对现有LLM断言生成方法的局限,提出基于智能体的AssertMate框架,通过三个组件聚合多视角,在Defects4J和EvoSuite验证中性能显著优于现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 代码评测 3 篇

2604.01518 2026-08-07 cs.SE 版本更新 74%

Probe to Generate: Program Variant-Guided Test Augmentation for Repository-Level Repair Benchmarks

基准测试足够强大吗?基于突变的诊断和回归套件的增强

Chenglin Li, Yisen Xu, Zehao Wang, Shin Hwei Tan, Tse-Hsun, Chen

专题命中 代码评测 :repository(title);分类 cs.SE

AI总结 本文提出STING框架,通过语义改变的程序变体增强回归测试,提高基准测试的可靠性。实验显示,77%的实例存在至少一个存活变体,测试覆盖率提升,修复率下降,揭示了基准测试的不足。

Comments Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21140 2026-08-07 cs.SE cs.AI 版本更新 62%

Matching Matters: A Fair Quality-Efficiency Benchmark for Command-Line Agents

AgentMeter: 评估基于CLI的本地任务求解智能体的模型-CLI匹配

Han Chi, Jiaxin Qi, Yan Cui, Baisheng Lai, Jianqiang Huang

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) Hangzhou Institute for Advanced Study, Chinese Academy of Sciences(中国科学院杭州高等研究院)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 提出AgentMeter基准,通过成功锚定、成本感知的AMS指标评估模型与CLI的匹配,发现模型和CLI选择不可解耦,需作为部署单元评估。

Comments 13 pages, 4 figures, 12 tables; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06183 2026-08-07 cs.AI 新提交 57%

MicroEvo: Knowledge-Guided LLM Sampling for Efficient Microarchitecture Design Space Exploration

MicroEvo:知识引导的大语言模型采样用于高效微架构设计空间探索

Jia Xiong, Runkai Li, Chenxu Niu, Guangyuan Gao, Changwen Xing, Yifan Zhang, Xinlai Wan, Jieran Cui, Chen Bai, Yusheng Hua, Ying Wang, Ming Ling, Xi Wang, Tao Xie

机构 * Southeast University(东南大学) National Center of Technology Innovation for EDA(国家EDA技术创新中心) NVIDIA Corporation(英伟达公司) Fudan University(复旦大学) Nanjing University of Posts and Telecommunications(南京邮电大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Peking University(北京大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 MicroEvo是结合LLM与MCTS的知识引导框架,用于多目标微架构优化,可提升帕累托前沿质量与搜索效率,具备工业级可扩展性。

Comments Accepted by ICCAD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 仓库级理解 9 篇

2608.04783 2026-08-07 cs.SE cs.AI 版本更新 84%

RepoProbe: Benchmarking Architecture-Aware Repository Comprehension with Checklists

RepoProbe:基于清单的架构感知代码仓库理解基准测试

Yuexi Yang, Alyssa Wu, Ji Luo, Richeng Xuan, Zhichao Hu, Yuhong Liu, Zhen Qin

专题命中 仓库级理解 :repository(title,abstract);code generation(abstract);分类 cs.SE、cs.AI

AI总结 本研究推出RepoProbe基准,采用基于清单的验证协议,发现SOTA LLMs存在编辑偏差,且高清晰度与技术正确性间有差距,提升了代码仓库理解评估的可靠性。

Comments Accepted to the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026). Replication package: https://github.com/Tencent-Hunyuan/RepoProbe

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05855 2026-08-07 cs.DC 新提交 78%

RepoOMP: Repository-Aware Hotspot OpenMP Parallelization via Dependency-Aware Context Reduction

RepoOMP:基于仓库感知的热点OpenMP并行化方法——通过依赖感知的上下文缩减

Yongjie Qian, Ke Gao, Zhibin Zhang, Shaohui Peng, Ling Li

专题命中 仓库级理解 :repository(title,abstract)

AI总结 RepoOMP是一种混合框架,通过构建MAP和STC,在951个热点上实现平均加速比8.23×至8.96×,降低智能体令牌成本,为仓库热点并行化提供证据引导的工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05938 2026-08-07 cs.CV cs.LG 新提交 57%

MirrorNet: Can Medical Image Anonymization Really Protect Patient Identity?

MirrorNet:医学图像匿名化真的能保护患者身份吗?

Attila Simkó

机构 * Umeå University(于默奥大学)

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 本研究提出MirrorNet模型,通过耦合循环一致变分自编码器发现去标识化医学扫描仍可识别患者,建议将其作为生物识别数据管理,相关代码与模型已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05253 2026-08-07 cs.LG 新提交 57%

Beyond Rotations: AuroOFT for Expressive Quantized Orthogonal Fine-Tuning

超越旋转:用于表达性量化正交微调的AuroOFT

Yue Han, Dianlin Wang

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 该研究针对量化正交微调(qoft)的线性正交变换局限,提出AuroOFT方法,在保留qoft稳定分支的基础上附加零起点门控低秩非线性残差,在Qwen2.5设置上提升性能并减少可训练参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05250 2026-08-07 cs.LG 新提交 57%

Beyond Full-Model Rollback: AuroSFT for Adapter-State Multi-Task Fine-Tuning

超越全模型回滚:用于适配器状态多任务监督微调的AuroSFT

Yue Han, Ziniu Liu

专题命中 仓库级理解 :repository(abstract);分类 cs.LG

AI总结 针对多任务SFT的全模型回滚成本高的问题,提出参数高效框架AuroSFT,将状态转为可合并的适配器状态,在保留骨干网络的比较中平均准确率达61.36%,优于msft的59.85%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04661 2026-08-07 cs.SE 版本更新 57%

An Exploratory Study of Agent Plans for Agentic AI Coding Tools in Open-Source Software

面向开源软件中智能体式AI编码工具的智能体计划探索性研究

Muhammad Auwal Abubakar, Seyedmoein Mohsenimofidi, Jai Lal Lulla, Jie M. Zhang, Christoph Treude, Sebastian Baltes, Matthias Galster

专题命中 仓库级理解 :repository(abstract);分类 cs.SE

AI总结 本文通过筛选36710个GitHub仓库识别出85个Markdown智能体计划文件,研究其支持的软件工程工作类型与提供的执行指导,明确其是研究人-智能体工作流任务意图的丰富工件。

Comments 14 pages, 2 figures, 4 tables. Accepted at the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026), Emerging Results, Vision, and Reflection Papers Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05316 2026-08-07 cs.CR 新提交 50%

The Trust-Free Aggregation Layer of the Unicity Infrastructure

Unicity基础设施的无信任聚合层

Risto Laanoja, Mike Gault, Dirk Draheim, Ahto Buldas

专题命中 仓库级理解 :repository(abstract)

AI总结 该研究提出Unicity区块链基础设施的无信任聚合层,采用RSMT、Plonky3 STARK工具包等技术,实现无可信设置,达每秒万次插入及毫秒级验证的双重支付防护方案。

Comments 42 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02018 2026-08-07 cs.CV 版本更新 50%

Invisible Ink Threats: Adversarial Goals Behind Legitimate Tasks in Computer-Use Agents

隐形墨水威胁:计算机使用智能体中合法任务背后的对抗目标

Jia-Chen Zhang, Ze-Yu Zhang, Kai-Wei Zhang

专题命中 仓库级理解 :repository(abstract)

AI总结 该研究针对计算机使用智能体的隐形墨水威胁,构建II-Bench与HITLCUA框架评估后发现,低危害注入可绕过防御,暴露出现有CUAs的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16987 2026-08-07 cs.CV 版本更新 50%

DVAR: Adversarial Multi-Agent Debate for Video Authenticity Detection

DVAR:对抗性多智能体辩论用于视频真实性检测

Hongyuan Qi, Feifei Shao, Ming Li, Hehe Fan, Jun Xiao

机构 * Zhejiang University(浙江大学) Guangming Lab(光明实验室)

专题命中 仓库级理解 :repository(abstract)

AI总结 DVAR通过多智能体辩论框架,将视频真实性检测转化为结构化推理过程,利用生成假设代理与自然机制代理的竞争,结合MDL框架和GenVideoKB知识库,实现对未知生成架构的强泛化能力。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏