arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-05-20 至 2026-05-20 共收录 5 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 5 篇

2605.20049 2026-05-20 cs.SE cs.AI 84%

Does Code Cleanliness Affect Coding Agents? A Controlled Minimal-Pair Study

代码整洁性影响编码代理吗?一项受控的最小对研究

Priyansh Trivedi, Olivier Schmitt

机构 * SonarSource

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE、cs.AI

AI总结 本研究探讨了代码整洁性对编码代理性能的影响,通过构建结构和风格相似但整洁度不同的代码库对,发现整洁性不影响通过率,但显著降低计算成本和文件重复访问。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20086 2026-05-20 cs.NE cs.AI cs.LG 81%

What Do Evolutionary Coding Agents Evolve?

进化编码代理进化什么?

Nico Pelleriti, Sree Harsha Nelaturu, Zhanke Zhou, Zongze Li, Max Zimmer, Bo Han, Sebastian Pokutta

机构 * Zuse Institute Berlin(柏林Zuse研究所) Technical University of Berlin(柏林技术大学) Hong Kong Baptist University(香港 Baptist大学) RIKEN Center for Advanced Intelligence Project(RIKEN高级智能项目中心)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了进化编码代理在数学发现和算法设计中通过任务特定反馈生成、修改和选择代码的过程,通过EvoTrace数据集和EvoReplay方法分析了进化过程中的机制,发现大部分得分提升来自少数几种编辑类型,并发现存在确定性的循环模式。

Comments 28 pages, 12 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18854 2026-05-20 cs.LG 79%

Evaluating Memory Condensation Strategies for Coding Agents in Data-Driven Scientific Discovery

评估用于数据驱动科学发现的编码代理的记忆压缩策略

Renuka Chintalapati, Sid Raskar, Anurag Acharya, Jared Willard, Patrick Emami, Sameera Horawalavithana

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室) National Laboratory of the Rockies(落基山国家实验室)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.LG

AI总结 本文评估了八种记忆压缩策略在数据驱动科学发现任务中的表现,发现没有压缩器显著提升假设质量,但基于LLM的压缩器会增加24-94%的token成本,而屏蔽工具调用输出可实现8.6%的净节省,且最佳压缩器因科学领域和任务长度而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19932 2026-05-20 cs.AI cs.CL cs.LG 67%

PEEK: Context Map as an Orientation Cache for Long-Context LLM Agents

PEEK:上下文地图作为长上下文LLM代理的导向缓存

Zhuohan Gu, Qizheng Zhang, Omar Khattab, Samuel Madden

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Stanford University(斯坦福大学)

专题命中 软件智能体 :coding agent(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出PEEK系统,通过上下文地图缓存和维护导向知识,提升长上下文LLM代理在重复外部上下文中的交互准确性和效率,相比基线方法在推理和上下文学习任务中均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15846 2026-05-20 cs.SE cs.AI 62%

RoadmapBench: Evaluating Long-Horizon Agentic Software Development Across Version Upgrades

RoadmapBench: 评估跨版本升级的长期代理软件开发

Xinbo Xu, Ruihan Yang, Haiyang Shen, Wendong Xu, Bofei Gao, Ruoyu Wu, Kean Shi, Weichu Xie, Xuanzhong Chen, Ming Wu, Jason Zeng, Michael Heinrich, Elvis Zhang, Liang Chen, Kuan Li, Baobao Chang

机构 * UniPat AI Peking University(北京大学) Fudan University(复旦大学) The University of Hong Kong(香港大学) Tsinghua University(清华大学) G Labs(0G实验室) Pipeline Lab(Pipeline实验室)

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文提出RoadmapBench,一个基于真实开源版本升级的115个长期编码任务的基准,旨在评估长期多目标软件开发,发现现有基准无法有效评估此类任务,表明长期软件开发仍是难题。

Comments 30 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏