Towards Adaptive Software Agents for Debugging
机构 * University of Gabes(盖斯大学)
专题命中 软件智能体 :software agent(title,abstract);分类 cs.SE、cs.AI
Comments 5 pages, 3 figures, FSE2025
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
机构 * University of Gabes(盖斯大学)
专题命中 软件智能体 :software agent(title,abstract);分类 cs.SE、cs.AI
Comments 5 pages, 3 figures, FSE2025
专题命中 软件智能体 :repository(title,abstract);分类 cs.SE、cs.CL
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.CL
专题命中 软件智能体 :coding agent(title);code generation(abstract);分类 cs.CL、cs.AI
Comments main paper 7 pages, reference 1 page, it is the version that accepted by AAAI 2025
专题命中 软件智能体 :code model(title,abstract);分类 cs.SE、cs.AI
Comments Accepted to the 33rd ACM International Conference on the Foundations of Software Engineering (FSE 2025)
专题命中 软件智能体 :repository(title,abstract);分类 cs.SE、cs.AI
专题命中 软件智能体 :software agent(title,abstract);分类 cs.SE、cs.AI
Comments Manuscript submitted to Journal of Intelligent Manufacturing, Corresponding dataset: https://doi.org/10.5281/zenodo.8120623 Additional references in Sec. 1, some other minor changes
专题命中 软件智能体 :code model(title,abstract);分类 cs.SE、cs.LG
Journal ref International Journal of Software Engineering and Knowledge Engineering. Vol. 30, No. 05, pp. 649-668 (2020)
原子提交基准测试:编码代理能否从压缩补丁中重建提交历史?
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE
AI总结 研究编码代理从压缩补丁重建提交历史的问题,将任务形式化为有重放要求的块到提交分区,构建基准测试并评估,发现自然重建比重放检查等难,部分方法表现较好,还找出常见失败模式及改进方法。
Comments 21 pages, 6 figures, benchmark paper on coding agents and software engineering; preprint
Harness-IF:评估编码智能体在不同指令层面的指令遵循能力
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI
AI总结 本研究推出Harness-IF评估框架,引入AP-Acc指标区分编码智能体的指令合规与巧合,发现12个前沿模型在对抗先验规则上表现更差,且合并优先级不随提示深度变化。
Comments 26 pages, 7 figures, 8 tables
理解编码智能体的架构:一项使用研究原型的探索性研究
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE
AI总结 本研究通过推出编码智能体Ark及基准ArkBench,探索了编码智能体的架构,用gpt-5.4-mini测试Ark解决10项任务中的8项,还对比了其与先进编码智能体的架构,为相关研究提供基础。
基于双向重构-验证框架的代码智能体独立补丁验证
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE
AI总结 本研究针对代码智能体生成补丁后缺乏独立验证的问题,提出无需训练的RETRACE双向重构-验证框架,在SWE-bench Verified等基准上显著提升了代码补丁的正确性。
Comments 8 pages
DiDPO:用于编码智能体训练的差异内差异策略优化
机构 * University of Science and Technology of China (USTC)(中国科学技术大学) ; Stanford University(斯坦福大学) ; Suzhou Institute for Advanced Research, USTC(中国科学技术大学苏州高等研究院) ; Tongji University(同济大学)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI
AI总结 针对编码智能体训练的细粒度信用分配难题,提出DiDPO方法,在Qwen2.5-7B-Coder上性能超可比方法10%以上,开源了支持多种RL方法的verl-code代码库。
Comments 16 pages, 6 figures, work in progress
面向编码智能体中恶意技能文件的风险评估
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE
AI总结 该研究针对编码智能体技能接口的恶意文件风险,提出对抗性技能合成方法与评估流水线,发现企业级智能体易被恶意技能利用,仅少数运行有明确安全识别,呼吁企业提前评估风险。
Comments 29 pages, 6 figures, 6 tables. Preprint; under review
PolicyGuard:面向LLM编码智能体的可配置提示语义数据防泄漏方案
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE
AI总结 针对LLM编码智能体的PolicyGuard框架,以自然语言策略文件引导LLM分类用户提示,在冻结测试集和隐藏保留集上表现优异,泛化与跨模型能力突出。
Comments This paper is being withdrawn because it was submitted prior to completion of a required institutional review process. The authors intend to resubmit after the review is complete
提示词诱导的大推理模型浪费:一项预注册的双框架编码智能体基准测试
机构 * PointFive
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL
AI总结 该研究通过预注册基准测试发现,提示词措辞和智能体框架会大幅影响大推理编码智能体的成本,部分提示指令可成倍增加推理成本却不提升任务成功率,框架选择的成本差异更显著。
权限受限:强化环境下编码智能体的策略分级评估
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI
AI总结 该研究针对强化环境下编码智能体的性能评估问题,在 Terminal-Bench 2.1 上评估 12 个智能体,发现策略强化会导致性能损失且模型选择依赖策略,并发布 Boundary-Bench 插件支持相关评估。
MDArena:面向真实分子动力学工作流的编码智能体评估基准
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI
AI总结 MDArena基准评估了6种编码智能体在真实分子动力学任务上的表现,发现其在精细科学工作流细节上存在不足,为追踪其可靠性进展提供了平台。
Comments 17 pages including appendices, 4 figures
声明平面:并行编码智能体选择性并发的可靠性提升与局限——确定性预写准入的30对、3种子验证性研究
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE
AI总结 该研究提出声明平面机制,通过30对、3种子的验证性实验,发现其可提升并行编码智能体的可靠性,但静态准入会过度串行化执行,动态准入则存在范围覆盖问题,未实现有效并行加速。
Comments 10 pages, 4 figures, 6 main-text tables. Confirmatory follow-up to arXiv:2607.21909. Code: https://github.com/SkeinRank/claim-plane. Data and artifacts: https://huggingface.co/datasets/skeinrank/claim-plane-confirmatory-30x3
企业编码智能体的共享组织记忆:系统设计与部署快照
机构 * SAP SE(思爱普公司)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI
AI总结 本文设计部署共享组织记忆系统,将经验捕获融入企业编码工作流,收集并整理任务相关经验,管控风险并供智能体检索,目前其效果仍在评估。
通过分层轨迹抽象复用编码智能体的过往修复工作
专题命中 软件智能体 :coding agent(title);repository(abstract);分类 cs.SE
AI总结 本研究提出STAIR框架,通过分层轨迹抽象复用编码智能体过往修复经验,在SWE-bench Verified上显著提升修复智能体的Pass@1指标,且计划可跨智能体泛化。
Comments 10 pages
基于编码智能体生成的验证编译器的自动化测试与修复
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE
AI总结 该研究针对编码智能体生成的验证编译器,提出了基于智能体的自动化测试与修复系统,经评估其在Axon编译器上无奖励黑客攻击问题,可有效开展测试与修复。
CodeRescue:用于编码智能体的预算校准恢复路由
机构 * University of Washington(华盛顿大学) ; New York University(纽约大学) ; ByteDance(字节跳动) ; Amazon(亚马逊)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI
AI总结 研究编码智能体失败后的预算部署问题,核心方法是将其制定为异构动作上的恢复路由并训练监督路由器,添加CRC层实现预算变化下的成本控制,主要贡献是校准前沿在多个方面优于基线,节省恢复成本。
Comments Withdrawn at the request of ByteDance because the manuscript was submitted before completing the company's required internal review and approval process
(非)配对编程:编码智能体提升生产力但损害理解能力
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL
AI总结 该研究通过54名学生的对照实验,发现编码智能体虽提升生产力但损害用户代码理解,低投入交互加剧该问题,用户仍偏好智能体,同时为开发者提出了优化方向。
Comments In-progress Preprint
ClinLens:面向纵向多模态临床数据科学的长周期编码智能体
机构 * Shandong University(山东大学)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI
AI总结 该研究推出CLINLENS基准,包含200项基于5种MIMIC资源的临床可执行任务,实验显示现有编码智能体与生物医学系统在正确临床分析上存在显著差距。
SkillGate:编码代理中经济高效的运行时恶意技能文件检测
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE
AI总结 研究针对编码代理中恶意技能文件检测问题,提出SkillGate安全网关,采用混合正则表达式预过滤器+大语言模型判断管道,在SkillsBench基准测试中,检测效果好、成本低、运行时开销小,相比现有工具性能显著提升。
Comments 10 pages, 5 figures
编码智能体中的支架效应:在编码智能体评估中利用选择作为隐藏变量
机构 * Alibaba(阿里巴巴) ; Agentic AI Foundation(Agentic人工智能基金会) ; OpenCode Contributors(OpenCode贡献者团队) ; Harbor Framework Team(Harbor框架团队)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.AI
AI总结 研究编码智能体评估中工具选择对结果的影响,通过在三个开源工具上评估两个模型,发现工具选择会使解决任务的令牌数有40倍差异,失败指纹有工具级偏差,建议按通过率选工具-模型对并报告相关指标,还发布了相关数据和脚本。
Comments 7 pages, 2 figures, 6 tables. Preliminary work; under review at the 5th DL4C Workshop @ ICML 2026
与AI代码代理的开发者体验:文档门户中的HTTP行为签名
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE
AI总结 本文研究AI代码代理对技术文档访问的影响,发现HTTP行为特征在文档门户中具有可识别性,提出改进开发者文档设计和反馈机制的实践方案。
Comments 9 pages, 2 figures
声明平面:并行编码代理的可执行变更意图和动态范围
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE
AI总结 研究并行编码代理变更问题,提出声明平面架构,工作者声明变更意图,控制平面管理,执行时处理突变,通过CooperBench机制检查展示可行性,为未来模型升级提供基础。
Comments 10 pages, 2 figures. Preprint
输出格式x模型标识:单轮编码代理性能中的交互效应
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE
AI总结 研究输出格式与模型交互对单轮编码代理性能的影响,通过多模型、多格式、多任务实验发现无普遍最优格式,有格式滥用问题,提出特定于模型的输出策略及工具设计原则并开源数据模板。
Comments 16 pages, 7 tables, 3 figures