arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-06-03 至 2026-06-03 共收录 5 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 5 篇

2606.02875 2026-06-03 cs.AI 83%

Handoff Debt: The Rediscovery Cost When Coding Agents Take Over Interrupted Tasks

交接债务:当编码代理接管被中断任务时的重新发现成本

Dipesh KC, Anjila Budathoki

机构 * Independent Researcher(独立研究者) Georgia State University(佐治亚州立大学)

专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.AI

AI总结 本文通过引入“交接债务”概念,研究编码代理在任务中断后从部分状态恢复时的重新发现成本,并提出一种接管协议来量化不同交接视图对后继代理效率的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18552 2026-06-03 cs.SE cs.AI cs.CL cs.LG 83%

Toward Training Superintelligent Software Agents through Self-Play SWE-RL

通过自我对弈SWE-RL训练超级智能软件代理

Yuxiang Wei, Zhiqing Sun, Emily McMilin, Jonas Gehring, David Zhang, Gabriel Synnaeve, Daniel Fried, Lingming Zhang, Sida Wang

机构 * Meta FAIR University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta TBD Lab(Meta TBD 实验室) Carnegie Mellon University(卡内基梅隆大学)

专题命中 软件智能体 :software agent(title,abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 提出自我对弈SWE-RL(SSR)方法,通过强化学习在自对弈环境中训练单一LLM代理,使其在无需人工标注问题或测试的情况下,在真实代码库中迭代注入和修复软件缺陷,在SWE-bench基准上实现显著自我改进并超越人类数据基线。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12925 2026-06-03 cs.SE cs.AI 62%

AgentLens: Revealing The Lucky Pass Problem in SWE-Agent Evaluation

AgentLens: 揭示 SWE-Agent 评估中的幸运通过问题

Priyam Sahoo, Gaurav Mittal, Xiaomin Li, Shengjie Ma, Benjamin Steenhoek, Pingping Lin, Yu Hu

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft(微软)

专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI

AI总结 针对软件工程智能体评估中仅依赖最终补丁是否通过测试的二元信号问题,提出AgentLens框架进行过程级评估,通过构建前缀树接受器参考和上下文敏感意图标注器,识别出10.7%的通过轨迹存在“幸运通过”行为,并基于质量分数将轨迹分为幸运、扎实和理想三个等级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03394 2026-06-03 cs.SE 57%

Human-AI Collaboration and the Transformation of Software Engineering Work

人机协作与软件工程工作的转型

Mamdouh Alenezi

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 本文通过结构化综合分析方法,研究了生成式AI和智能体AI如何将软件工程从以人类编写代码为中心转变为以指导、验证和管理自主及半自主系统为中心,并提出了一个包含技术、认知、社会技术、治理和组织五个维度的未来工程师能力框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02668 2026-06-03 cs.CR cs.HC 50%

What You Approve Is What Executes: Consent Integrity for Black-Box LLM Agents

你批准即执行:黑盒LLM代理的同意完整性

Xiaoqi Weng

专题命中 软件智能体 :coding agent(abstract)

AI总结 针对黑盒LLM代理的批准对话框存在摘要伪造漏洞,本文引入同意完整性概念,通过可信中介确保人类看到的动作与真实执行的动作一致,并分析了该机制的局限性与权衡。

Comments Preprint. IEEE conference format. Proof-of-concept; artifact at https://github.com/zjnbwxq/agentguard-ci

详情

展开后加载摘要…

URL PDF HTML 收藏