Illuminating LLM Coding Agents: Visual Analytics for Deeper Understanding and Enhancement
机构 * Visa Research(Visa研究)
专题命中 软件智能体 :coding agent(title,abstract);code generation(abstract);分类 cs.LG
Comments 11 pages, 10 figures
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
机构 * Visa Research(Visa研究)
专题命中 软件智能体 :coding agent(title,abstract);code generation(abstract);分类 cs.LG
Comments 11 pages, 10 figures
专题命中 软件智能体 :software agent(title,abstract);repository(abstract);分类 cs.AI
Comments Main body: 10 pages, 5 figures. Appendix: 5 pages, 4 figures. Open-source codebase
反馈归一化的开发者内存用于强化学习编码代理:一种安全门控MCP架构
机构 * PythaLab, Yildiz Technical University, Istanbul, Türkiye(PythaLab,伊兹密尔技术大学,伊斯坦布尔,土耳其)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.CL、cs.LG;repository(comments)
AI总结 本文提出RL Developer Memory架构,通过归一化反馈和安全门控机制提升强化学习编码代理的内存管理,实验证明其在确定性任务中的有效性。
Comments 25 pages, 5 figures, 7 tables. Preprint. Implementation and supplementary artifacts are available at the project repository
Agentic Agile-V: 从Vibe编码到验证工程在软件和硬件开发中
机构 * Independent Researcher(独立研究者)
专题命中 软件智能体 :code generation(abstract,abstract_cn);repository(abstract,abstract_cn);分类 cs.SE、cs.AI
AI总结 本文研究了代理AI在软件和硬件开发中的应用,提出Agentic Agile-V框架,通过SCOPE-V循环将对话意图转化为结构化工程成果,并贡献了最小输入艺术品类税、对话到合同门、风险自适应工作流和证据包接受模型。
Comments 7 pages, 1 figure
专题命中 软件智能体 :code generation(abstract);software agent(abstract);program repair(abstract);repository(abstract)
Comments 49 pages
REAP:从交互生产使用自动整理编码代理基准
机构 * Meta, USA(Meta公司)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI、cs.LG
AI总结 REAP通过自动化流程从真实开发者与代理交互中构建生产基准,解决评估信号不可靠问题,通过LLM分类和多轮稳定性检查确保基准可信。
Comments Accepted at ASE 2026 Industry Showcase
CORVUS:通过底层同步实现大语言模型编码代理的上下文优化与缩减
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI、cs.LG
AI总结 研究针对大语言模型编码代理传统轨迹架构问题,提出CORVUS架构解耦文件读取与观察,通过维护同步注册表注入当前内容,经实验评估,该架构能减少输入令牌、缩短提示并减少推理周期,保持通过率。
不要责怪大语言模型:脚手架演化如何塑造编码代理质量
机构 * Queen’s University Canada(加拿大女王大学)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI、cs.LG
AI总结 研究编码代理中脚手架演化对其质量的影响。通过固定模型、仅改变脚手架,对Qwen Code CLI的35个连续版本进行评估,追踪质量波动与开发模式及架构组件的关系。
限制编码代理执行代码何时有用?一种机制×代理设计消融研究
机构 * Rochester Institute of Technology(罗切斯特技术学院)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI、cs.LG
AI总结 研究现代编码代理不同工具表面有效性,通过在特定任务上对两种代理进行三臂消融实验,发现最便宜工具表面由任务机制和代理设计共同决定,主要成本信号是缓存调整成本而非通过率。
Comments 9 pages (excluding references), 4 figures, 4 tables. Accepted to the Agentic Software Engineering (SE 3.0) Workshop at KDD 2026 (non-archival)
应变连贯性:编码代理执行轨迹中的故障前信号
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出“应变连贯性”模式,即编码代理识别到问题但仍按原计划行动,通过构建Claude Sonnet 4.6检测器在44条轨迹上实现94%故障预测精度,优于基线方法。
SpecBench: 评估长周期编码代理中的奖励黑客现象
机构 * Weco AI
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 该研究通过分解软件工程任务,提出了一种评估长周期编码代理中奖励黑客现象的方法,通过比较可见测试套件和隐藏测试套件的通过率差异,引入了SpecBench基准,展示了奖励黑客现象在不同任务长度上的显著影响。
过度激进的编码代理:在良性任务中测量超出范围的动作
机构 * Griffith University(格里菲斯大学) ; Wake Forest University(威克森林大学) ; Nanyang Technological University(南洋理工大学) ; University of New South Wales(新南威尔士大学) ; Quantstamp
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 本文提出OverEager-Gen基准,用于评估编码代理在良性任务中超出范围的行为。研究发现,当基准中明确列出授权范围时,代理会停止推断边界并开始匹配声明文本,从而影响测量有效性。通过行为梯度验证器和双通道堆栈审计内部工具调用,验证了不同框架下的过度激进行为差异。
SWE-Chain:基于链式发布级包升级的编码代理基准测试
机构 * The Chinese University of Hong Kong(香港中文大学) ; Independent(独立) ; ELLIS ; Technical University of Darmstadt(达姆施塔特技术大学) ; Johns Hopkins University(约翰霍普金斯大学) ; Monash University(墨尔本大学)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 SWE-Chain通过链式发布级包升级评估编码代理,包含12个升级链和155个版本过渡,揭示当前代理在连续维护中的不足。
SlopCodeBench:评估编码代理在长周期迭代任务中性能退化的基准测试
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Washington State University(华盛顿州立大学) ; MIT(麻省理工学院)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 本文提出SlopCodeBench,通过36个问题和196个检查点评估编码代理在长周期迭代任务中的性能退化,发现代理代码在结构上逐渐退化并产生冗余代码,人类代码退化更慢。
Comments Code and Leaderboards are located at https://www.scbench.ai
编码代理能否在计算材料科学中复现研究成果?
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 研究探讨编码代理在计算材料科学领域复现研究结果的能力,提出AutoMat基准测试,发现当前LLM代理在复现复杂科学流程时表现有限,存在流程不完整、方法偏差等问题。
SWE-QA: 语言模型能否回答仓库级代码问题?
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 软件智能体 :repository(title,abstract);分类 cs.SE、cs.CL、cs.PL
AI总结 本文提出SWE-QA基准,旨在研究自动化QA系统在真实代码环境中的能力,包含576个高质量问题对,涵盖意图理解、跨文件推理和多跳依赖分析,评估六种先进LLM在不同上下文增强策略下的表现。
Comments Accepted to ACL 2026 Findings. Code and data available at https://github.com/peng-weihan/SWE-QA-Bench
编码代理在价值冲突下的非对称目标漂移
机构 * Columbia University(哥伦比亚大学) ; Independent(独立) ; Georgia Tech(佐治亚理工学院) ; UC San Diego(加州大学圣地亚哥分校) ; MATS ; SPAR
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 研究编码代理在价值冲突中如何平衡系统提示与实际任务,发现其目标漂移受价值对齐、对抗压力和累积上下文影响,且环境压力可 override 显式约束。
Comments 5 pages, 4 figures, Published as a workshop paper in Lifelong Agents @ ICLR 2026
编码代理可以是通用代理吗?
机构 * Agentic Labs
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI、cs.LG
AI总结 本文探讨编码代理能否实现端到端业务流程自动化,发现其在简单任务上表现可靠,但在复杂任务上存在瓶颈,指出领域逻辑与代码执行的衔接是通用性关键障碍。
SWE-QA-Pro:一个代表性的基准和可扩展的训练配方用于仓库级代码理解
机构 * University of Waterloo(滑铁卢大学) ; University of Toronto(多伦多大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; McGill University & MILA(麦吉尔大学及MILA) ; Verdent AI, Inc.(Verdent AI公司)
专题命中 软件智能体 :repository(title,abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 本文提出SWE-QA-Pro基准,通过多样化的长尾仓库和可执行环境构建,验证了代理工作流在代码理解任务中的优势,并提出可扩展的合成数据管道和两阶段训练方法,使小型模型在复杂行为学习中取得优异表现。
Wink: 代码代理中行为失误的恢复
机构 * Meta Platforms, Inc.(Meta平台公司)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI、cs.PL
AI总结 Wink通过异步自我干预系统有效恢复代码代理的行为失误,减少工具调用失败和人工干预需求。
Hybrid-Gym: 训练能够跨任务泛化的编码代理
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.CL、cs.LG
AI总结 Hybrid-Gym通过设计合成任务训练编码代理,提升其跨任务泛化能力,在多个基准测试中取得显著效果。
CooperBench:为何编码代理还不能成为你的队友
机构 * Stanford University(斯坦福大学) ; SAP Labs US(SAP美国实验室)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 CooperBench通过大规模协作编码任务测试,发现AI代理在团队协作中表现不佳,揭示了沟通障碍、承诺偏离和期望错误等关键问题,呼吁发展社交智能。
Comments https://cooperbench.com First two authors contribute equally. The 3th - 6th authors contribute equally
在合成环境中训练多功能编码代理
机构 * Tsinghua University(清华大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 SWE-Playground通过从头生成项目和任务,训练多功能编码代理,能够处理更广泛的编码任务并提升性能。
AInsteinBench:在科学仓库中评估编码代理的基准测试
机构 * Princeton University(普林斯顿大学)
专题命中 软件智能体 :coding agent(title);code generation(abstract);分类 cs.SE、cs.AI、cs.PL
AI总结 AInsteinBench通过评估大型语言模型在科学计算开发中的能力,提供了一个基于真实科研软件生态系统的基准测试。
更多但更少:一种关于高效编码代理的实证研究:回合控制策略
机构 * ByteDance(字节跳动)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI、cs.LG
AI总结 本文通过实证研究分析了编码代理的回合控制策略,发现动态资源分配在成本和效率之间取得平衡,优于固定回合限制方法。
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.CL、cs.AI、cs.LG
机构 * Queen's University(女王大学)
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI、cs.LG
机构 * Columbia University(哥伦比亚大学)
专题命中 软件智能体 :coding agent(title);repository(abstract);分类 cs.SE、cs.AI、cs.LG
专题命中 软件智能体 :coding agent(title);code generation(abstract);分类 cs.CL、cs.AI、cs.LG
构建可靠的编码智能体:评估与运行模型周边系统
专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI
AI总结 本研究针对AI编码智能体的可靠性问题,整合多源证据构建系统级评估与运行框架,区分模型与基础设施效应,提出可靠性记录目录及相关方法以提升智能体系统可靠性。
Comments Technical review and engineering monograph, 314 pages, 30 figures. Includes an evidence audit, a companion research artifact with 206 reliability records, and runnable protocols for evaluating and operating AI coding agents. August 2026. Source, companion, and reusable protocols: https://github.com/sjarmak/engineering-reliable-coding-agents