arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-07-21 至 2026-07-21 共收录 12 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 12 篇

2607.18064 2026-07-21 cs.SE cs.AI 新提交 81%

Autoresearch with Coding Agents: Generalizers and Metric-Maximizers on Quran Recitation Data

使用编码智能体进行自动研究:古兰经诵读数据上的泛化器和指标最大化器

Nursultan Askarbekuly, Mohamad Al Mdfaa, Ahmed Helaly, Gonzalo Ferrer, Manuel Mazzara

机构 * Innopolis University(因诺波利斯大学) Skolkovo Institute of Science and Technology(斯克尔科沃科学与技术研究所)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 研究在古兰经诵读数据任务中智能体自动研究模式,Claude Code和OpenAI Codex从同一起点出发,先发明相同算法后有分歧,添加测试集后情况变化,还提炼出评估自主智能体的五条设计规则,智能体解决方案超越手工管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12463 2026-07-21 cs.AI cs.CL 版本更新 81%

Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models

作为编码智能体基础模型中间训练的函数感知中间填充

Yubo Wang, Jiarong Liang, Yuxuan Zhang, Xuye Liu, Cong Wei, Yuyu Zhang, Ping Nie, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) University of British Columbia(英属哥伦比亚大学) NVIDIA(英伟达公司) Verdent AI(Verdent人工智能公司) Vector Institute(向量研究所)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对编码智能体将外部工具返回集成到推理中的问题,利用函数感知中间填充进行中间训练,在多个模型上提升了性能,并减轻了后训练对非智能体编码等基准测试的能力侵蚀。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21372 2026-07-21 cs.AI 版本更新 79%

NEMO: Execution-Aware Optimization Modeling via Autonomous Coding Agents

NEMO: 通过自主编码代理实现执行感知的优化建模

Yang Song, Anoushka Vyas, Zirui Wei, Sina Khoshfetrat Pakazad, Henrik Ohlsson, Graham Neubig

机构 * Language Technologies Institute, School of Computer Science, Carnegie Mellon University, Pittsburgh, PA, USA(语言技术研究所,计算机科学学院,卡内基梅隆大学,匹兹堡,PA,美国)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI

AI总结 提出NEMO系统,利用自主编码代理将决策问题的自然语言描述转化为可执行的数学优化实现,通过执行感知的架构和协调模式实现最先进的性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12428 2026-07-21 cs.CR 版本更新 78%

Trust but Verify? Uncovering the Security Debt of Autonomous Coding Agents

信任但要验证?揭示自主编码代理的安全债务

A H M Nazmus Sakib, Dipayan Banik, Murtuza Jadliwala

专题命中 软件智能体 :coding agent(title,abstract)

AI总结 本文利用AIDev数据集,通过大语言模型评判框架和人工分析,研究自主编码代理生成拉取请求中的安全代码异味。发现38.9%的请求含安全异味,供应链问题和硬编码凭证占比高,揭示了安全风险及开发者警惕性降低问题,强调需实施上下文感知安全护栏。

Comments Accepted at the KDD 2026 Workshop on Agentic Software Engineering (AgenticSE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17937 2026-07-21 cs.SE 新提交 74%

When and How Context Rot Appears in Coding Agents: A White-Box Study of Agent Skills in Code Auditing

在长上下文情况下代理技能如何失效:代码审计中的白盒研究

Yue Xue

专题命中 软件智能体 :coding agent(title);分类 cs.SE

AI总结 研究长上下文下代码审计中代理技能失效问题,通过改变上下文分类故障位置,对比不同条件下Codex等运行情况,发现长上下文影响大,不同任务表现有别,外部检查表效果好,编码代理支架有帮助,给出故障分类和实证案例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17799 2026-07-21 cs.SE cs.AI cs.CL 版本更新 67%

Position: Coding Benchmarks Are Misaligned with Agentic Software Engineering

立场:编程基准与智能体软件工程不一致

Maria I. Gorinova, Macey Baker, Amy Heineike, Maksim Shaposhnikov, Rob Willoughby, Dru Knox

机构 * Tessl

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本文指出当前编程基准在智能体时代存在三大问题:混淆模型与系统框架、单一参考答案惩罚有效替代方案、缺乏组件级信号导致迭代困难,并提出应重新设计基准以对齐智能体软件工程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18213 2026-07-21 cs.CL cs.SE 新提交 62%

SWE-Pruner Pro: The Coder LLM Already Knows What to Prune

SWE-Pruner Pro:编码语言模型已知道该修剪什么

Yuhang Wang, Yuling Shi, Shaoqiu Zhang, Jialiang Liang, Shilin He, Siyu Ye, Yuting Chen, Kai Cai, Xiaodong Gu

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL

AI总结 研究针对编码代理长上下文修剪问题,提出SWE-Pruner Pro,利用代理内部表示直接修剪工具输出。在多基准测试中节省令牌,保持任务质量,在MiMo-V2-Flash上提升解决率和准确率。

Comments Project page: https://github.com/Ayanami1314/swe-pruner-pro

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17686 2026-07-21 cs.SE cs.AI 新提交 62%

Integrating High-Level Requirements to Low-Level Tests with Machine-Readable V&V Specifications

通过机器可读的验证与确认规范将高级需求集成到低级测试中

Mansur Arief, Nur Ahmad Khatim, Ali Akarma, Ahmad Alfan Alfian Irfan

机构 * Systems Engineering, King Fahd University of Petroleum Faculty of Computer Information Systems Islamic University of Madinah Madinah, Saudi Arabia Division of Information Science, Nara Institute of Science

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 研究针对人工智能和网络物理系统中高级需求与低级测试脱节问题,提出VNVSpec开源框架,使V&V规范机器可读可执行,能检查需求质量、链接需求与测试结果等,通过自我应用评估并可扩展用于相关测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18057 2026-07-21 cs.SE 新提交 57%

Test Coverage Analysis of Agentic Pull Requests

智能拉取请求的测试覆盖分析

Atish Kumar Dipongkor, Talank Baral, Wing Lam, Kevin Moran

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 研究人工智能编码代理生成的拉取请求的测试覆盖情况,分析4882个相关请求,发现代理包含测试更改比例低,现有测试覆盖不足,代理编写测试仅在少数请求中提升覆盖,错误处理结构测试严重不足,为此提出相关改进措施。

Comments 12 pages, to appear 42nd International Conference on Software Maintenance and Evolution

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16740 2026-07-21 cs.SE 新提交 57%

Agentic Code Review in the Terminal: A Trajectory-Level Analysis of Behavior, Cost, and Human-Alignment

终端中的智能代码审查:行为、成本和人工对齐的轨迹级分析

Wachiraphan Charoenwet, Kla Tantithamthavorn, Patanamon Thongtanunam, Hong Yi Lin, Minwoo Jeong, Ming Wu

专题命中 软件智能体 :repository(abstract);分类 cs.SE

AI总结 研究终端环境中智能代码审查的行为、成本等,基于审查者轨迹分析,发现智能审查者审查精度高但有探索等开销,成功审查与规划等有关,凸显轨迹感知和成本敏感评估对未来此类系统的好处。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16494 2026-07-21 cs.SE 新提交 57%

Personalized Assessments from Personal Artifacts

基于个人工件的个性化评估

Yufan Zhang, Jaromir Savelka, Seth Copen Goldstein, Majd Sakr

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 针对人工智能编码代理发展下学生和从业者对自身代码理解存疑的问题,开发个性化探测谜题($p^3$)方法,经云计算课程测试,该方法能识别理解差距,谜题自动生成、耗时短,后续要关联结果与代码理解并嵌入审查流程。

Comments 6 pages, 3 figures, ECTEL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22455 2026-07-21 cs.LG 版本更新 57%

SkillRouter: Skill Routing for LLM Agents at Scale

SkillRouter:大规模LLM代理中的技能路由

YanZhao Zheng, ZhenTao Zhang, Chao Ma, YuanQiang Yu, JiHuai Zhu, Yong Wu, Tianze Xu, Baohua Dong, Hangcheng Zhu, Ruohui Huang, Gang Yu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 软件智能体 :coding agent(abstract);分类 cs.LG

AI总结 本文提出SkillRouter,通过全文本检索和重排序提升大规模LLM代理的技能路由性能,实验显示隐藏技能体导致路由准确率下降31-44个百分点,SkillRouter在基准测试中达到74.0%的Hit@1性能。

详情

展开后加载摘要…

URL PDF HTML 收藏