Self-Evolving Coding Agents
自进化编码智能体
专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE
AI总结 本综述系统梳理自进化编码智能体领域,明确其与传统智能体的区别,提出分类法,分析该领域的挑战,为设计更优智能系统奠定基础。
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
自进化编码智能体
专题命中 软件智能体 :coding agent(title,abstract);repository(abstract);分类 cs.SE
AI总结 本综述系统梳理自进化编码智能体领域,明确其与传统智能体的区别,提出分类法,分析该领域的挑战,为设计更优智能系统奠定基础。
权限受限:强化环境下编码智能体的策略分级评估
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI
AI总结 该研究针对强化环境下编码智能体的性能评估问题,在 Terminal-Bench 2.1 上评估 12 个智能体,发现策略强化会导致性能损失且模型选择依赖策略,并发布 Boundary-Bench 插件支持相关评估。
MDArena:面向真实分子动力学工作流的编码智能体评估基准
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI
AI总结 MDArena基准评估了6种编码智能体在真实分子动力学任务上的表现,发现其在精细科学工作流细节上存在不足,为追踪其可靠性进展提供了平台。
Comments 17 pages including appendices, 4 figures
MT-Web2Code:面向多轮区域重构与局部修改的编码智能体基准测试
专题命中 软件智能体 :coding agent(title,abstract)
AI总结 MT-Web2Code是首个面向多轮区域重构与局部修改的多模态编码基准,实验发现现有编码智能体存在多轮错误滚雪球等问题,其评估指标或助力相关研究。
从社交编码到智能体编码:开源社区中的生产力与关系重构
专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.AI
AI总结 该研究基于含1084名开发者的GitHub数据模拟发现,编码智能体(CA)可提升开源社区生产力,但采用率低且收益集中于活跃开发者,还会减少人类直接交互、降低公共知识实用性。
快速失败,智能重启:面向软件工程智能体任务的早期失败预测与重启
专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI
AI总结 本文提出FailFast-RestartSmart两阶段控制器,可在5%假阳性率下节省14.6%-20.4%执行token,在25%假阳性率下将Qwen3.6-27B解决率从66.6%提至71.8%。
BulkPR-Bench:针对交互拉取请求的队列级治理基准
专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI
AI总结 该研究推出BulkPR-Bench基准,针对交互PR队列治理,实验显示现有模型在该任务上表现优于顺序基准,但仍存在较大提升空间。
Comments 12 pages, 5 figures. Artifact: https://github.com/Eureka246/BulkPR-Bench-Release ; archived artifact: https://doi.org/10.5281/zenodo.21717780
当策略改变概率时:用于LLM代码审查的模块化决策
专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.AI
AI总结 该研究针对LLM代码审查,测试4种审查界面的策略与概率分离情况,提出模块化流水线可提升概率准确性、降低损失,验证了风险与行动分离评估的必要性。
Comments 20 pages, 6 figures; includes technical appendices. Code and data: https://github.com/rasvik/when-policies-change-probabilities
内化身份基元:公有区块链上自主智能体的密码学个体性
专题命中 软件智能体 :software agent(abstract);分类 cs.AI
AI总结 本文提出将公有区块链上自主智能体的身份密钥-权重绑定信任根转移至密码学假设,在Solana开发网部署了首个身份基元为密码学不变量的链上智能体,完成了2.36天链上运行,实例化了密码学个体性。
Comments 52 pages, 3 figures, 11 tables. Cryptographic key-to-weights binding (W = HKDF(sk) inside Groth16) with an on-chain state-commitment chain on Solana devnet; active-query, homeostatic, and economic-metabolism extensions; 166- and 168-cycle continuous runs. Code, threat model, and per-cycle telemetry: https://github.com/ksk-S/internalising-identity-2026 (tag arxiv-v1)
PRWeaver:针对基于大语言模型的代码审计工具对抗长周期恶意拉取请求的评估
专题命中 软件智能体 :repository(abstract);分类 cs.SE
AI总结 该研究提出PRWeaver基准,评估基于LLM的代码审计工具对长周期恶意PR的可靠性,发现特定评审策略会降低检测率,为优化代码审计工具提供了依据。
对代理生成的拉取请求中图书馆使用情况的研究
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE
AI总结 研究探讨了代理生成的拉取请求中图书馆使用情况,发现代理频繁导入图书馆但很少引入新依赖项,且在引入时遵循严格的版本控制实践。
Comments 5 pages, 3 tables. Accepted at MSR '26 (Challenge Track)
Journal ref 23rd International Conference on Mining Software Repositories: MSR 2026