MAGIS: LLM-Based Multi-Agent Framework for GitHub Issue Resolution
专题命中 软件智能体 :code generation(abstract);repository(abstract);分类 cs.SE、cs.AI
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
专题命中 软件智能体 :code generation(abstract);repository(abstract);分类 cs.SE、cs.AI
脚手架比接口更重要:在七种智能体脚手架、五种语言模型和一项软件任务中对MCP与CLI工具使用的对照比较
专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.AI
AI总结 该研究通过对照实验发现,智能体脚手架对AI编码智能体的工具使用成本影响远大于接口,MCP并非必要,且智能体常忽略分配的接口,相关数据已开源。
Comments 29 pages, 4 figures, 8 tables. Companion methodology paper: arXiv:2606.11869. Dataset and measurement harness (open source, GPL-3.0): https://doi.org/10.5281/zenodo.21851992
从社交编码到智能体编码:开源社区中的生产力与关系重构
专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.AI
AI总结 该研究基于含1084名开发者的GitHub数据模拟发现,编码智能体(CA)可提升开源社区生产力,但采用率低且收益集中于活跃开发者,还会减少人类直接交互、降低公共知识实用性。
LLM智能体能够查看代码仓库
专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE
AI总结 研究多模态大语言模型在仓库级问题解决中利用视觉表示的效果,发现纯视觉方案降低精度,而结合视觉结构图可减少26%输入token并保持或提升精度。
Comments Accepted by ASE 2026. Our code and data are available at https://github.com/cslsolow/SeeRepo
TrajAudit:智能体编码系统的自动化故障诊断
专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE
AI总结 针对仓库级编码轨迹中噪声多、上下文长的问题,提出TrajAudit框架,通过模式匹配过滤和测试报告先验知识辅助,实现高效故障诊断,在RootSE基准上定位准确率提升24.4个百分点,令牌消耗降低18%。
SetGo:科学人工智能数据集的元数据就绪性
专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.AI
AI总结 研究针对科学AI数据集元数据就绪性评估工具缺失的问题,提出开源工具SetGo,能从六个维度评估修复元数据,揭示通用工具未发现的缺陷,提升公平性分数,还可集成大语言模型支持自动化工作流程。
Comments 6 pages; accepted at SSDBM 2026
预测人类和智能体拉取请求的接受情况及评审工作量
专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE
AI总结 研究在拉取请求打开时预测其接受情况及评审工作量的可行性,利用AIDev数据集构建预测管道,评估多种机器学习模型,发现接受度预测可行,评审工作量预测较难,早期模型可支持分类和优先级排序,应作咨询工具。
FlowArk:通过上下文感知知识重用提升安卓应用的智能数据流分析
专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE
AI总结 研究安卓应用数据流分析中批量任务重复分析成本高的问题,提出FlowArk系统,通过提炼、打包和注入知识条目降低成本,实验表明其在保持分析质量的同时,能降低API成本并增加任务完成量。
Comments 12 pages, 9 figures, 6 tables
SWE-Review:通过智能代码审查解决问题闭环
专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE
AI总结 研究通过智能代码审查闭合PR生成环的问题,核心方法是SWE-Review框架,由审查代理进行审查并提供反馈。主要贡献是能持续改进PR,在多方面表现优于单轮审查,还能推动AI编码代理从一次性PR生成迈向闭环问题解决。
GitHub上的AI代理拉取请求:频率、结构和合并冲突率
专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE
AI总结 利用AIDev-pop数据集对AI代理编写的拉取请求并发情况进行大规模实证分析,发现特定时间重叠下部分仓库有协同活动的请求对,多数为同一代理,还研究了合并冲突率及冲突类型。
Comments 7 pages, 4 figures, 2 tables. Replication package: https://doi.org/10.5281/zenodo.21186464
Libra: 为智能信息检索训练环境
专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.AI
AI总结 提出Libra框架,通过引入可变目录和LLM驱动优化循环,自动改进代码仓库的索引结构,提升代码定位准确率,并实现跨模型和问题的零样本迁移。
SWE-Perf:语言模型能否优化真实仓库中的代码性能?
专题命中 软件智能体 :code generation(abstract);repository(abstract);分类 cs.SE
AI总结 提出SWE-Perf基准,用于系统评估LLM在真实仓库中的代码性能优化能力,通过140个实例评估发现现有模型与专家水平存在显著差距。
Comments Accepted by ICML 2026
基于知识的拉取请求:一种可信的智能体中介知识协作工作流
专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE
AI总结 提出知识型拉取请求(KPR)工作流,通过分离知识采纳与实现合并,利用智能体蒸馏外部知识并再生代码,以降低跨信任边界的软件协作成本。
MARS:面向异构智能体系统的高效自适应协同调度
机构 * Duke University(杜克大学)
专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.LG
AI总结 提出MARS协同调度系统,通过统一信息流全局协调GPU推理与CPU工具执行,解耦准入与执行防止资源过载,并采用智能体中心调度器最小化端到端延迟,实验显示延迟降低5.94倍。
Comments 14 pages, 13 figures. Preprint
Trace2Skill: 验证器引导的技能进化用于长上下文EDA代理
机构 * NVIDIA
专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.AI
AI总结 本文提出Trace2Skill框架,通过验证器引导的技能进化提升硬件代理在复杂验证问题上的性能,无需RTL专用模型微调,通过密集验证器反馈实现任务通过率的显著提升。
SWE-Cycle:在完整问题解决周期中对齐代码代理的基准测试
专题命中 软件智能体 :software agent(abstract);repository(abstract);分类 cs.SE
AI总结 本文提出SWE-Cycle基准测试,评估代码代理在环境重建、代码实现和测试生成等任务中的能力,揭示了在端到端任务中处理跨阶段依赖和保持代码质量的关键瓶颈。
PARNESS:一种用于端到端自动化科学研究的论文工具,支持动态工作流、全文索引和跨运行知识积累
专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE
AI总结 PARNESS通过动态工作流、全文索引和跨运行知识积累,解决传统科研系统流程僵化、知识累积不足的问题,实现端到端自动化科研。
Comments 31 pages, 13 figures, includes appendix with a verbatim end-to-end-generated paper produced by the framework. Source: https://github.com/gtrhythm/PARNESS
野火修复
专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE
AI总结 研究分析了61000余个仓库中的人工和AI代理生成的热修复,发现其具有紧迫性特征,揭示了人类与AI在修复行为上的差异,为实际应用中的热修复协作提供基础。
为代理编程扩展测试时计算
机构 * Meta Superintelligence Labs(Meta超级智能实验室) ; University of Washington(华盛顿大学) ; New York University(纽约大学) ; Google DeepMind(谷歌DeepMind) ; Carnegie Mellon University(卡内基梅隆大学) ; Princeton University(普林斯顿大学)
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 本文提出基于轨迹紧凑表示的代理编程测试时扩展框架,通过递归竞赛投票和并行-蒸馏-细化方法提升长周期代理性能,实验证明在SWE-Bench和Terminal-Bench上显著提升效果。
Comments 70 pages, 26 figures, 12 tables
MPAC:一种多主代理协调协议用于互操作性多代理协作
机构 * University of Colorado Denver (CU Denver)(科罗拉多大学丹佛分校)
专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.AI
AI总结 本文提出MPAC协议,解决多主代理共享状态协调问题,通过五层结构实现显式协调语义,减少协调开销并提升执行效率。
专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE
Comments 5 pages, 3 figures, Software Architecture Showcase Track, ICSA 2026
孔子代码代理:面向真实世界代码库的可扩展代理构建
机构 * Meta
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 孔子代码代理通过可扩展的代理构建框架,在真实世界软件工程任务中实现高性能,超越现有研究和商业成果。
Comments The latest version
CP-Agent:代理约束编程
机构 * TU Wien(维也纳技术大学)
专题命中 软件智能体 :coding agent(abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 CP-Agent通过代理工作流实现约束编程问题的高效求解,展示了最少指导优于详细指导,并揭示了任务管理工具对建模任务的双重影响。
Live-SWE-agent: 软件工程代理能否在飞行中自我进化?
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 软件智能体 :software agent(abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 Live-SWE-agent是一种能够在运行时自主进化其自身框架的软件代理,通过解决现实软件问题实现了77.4%的解决率,优于现有所有软件代理。
机构 * Kwaipilot Team(Kwaipilot 团队)
专题命中 软件智能体 :code model(abstract);coding agent(abstract);分类 cs.CL
机构 * UC Berkeley(伯克利大学)
专题命中 软件智能体 :repository(abstract);分类 cs.SE、cs.CL、cs.AI
Comments Website: https://gso-bench.github.io/
专题命中 软件智能体 :repository(abstract);coding agent(abstract);分类 cs.SE
专题命中 软件智能体 :software agent(abstract);coding agent(abstract);分类 cs.SE
专题命中 软件智能体 :code generation(abstract);code model(abstract);分类 cs.SE
专题命中 软件智能体 :code generation(abstract);program repair(abstract);分类 cs.SE
Comments Accepted in MSR 2024