Learning Globally Reusable Skills for Coding Agents
为编码智能体学习全局可复用技能
专题命中 软件智能体 :agent(abstract,abstract_cn);分类 cs.AI、cs.SE
AI总结 研究针对编码智能体技能进化的过拟合与泛化问题,提出GSE框架,通过技能关系图、聚类整合与回放验证优化,在多个编码任务与智能体上实现性能提升,效果显著。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
为编码智能体学习全局可复用技能
专题命中 软件智能体 :agent(abstract,abstract_cn);分类 cs.AI、cs.SE
AI总结 研究针对编码智能体技能进化的过拟合与泛化问题,提出GSE框架,通过技能关系图、聚类整合与回放验证优化,在多个编码任务与智能体上实现性能提升,效果显著。
GenOS:AI代码生成中语义鲁棒性的组合式证书
专题命中 软件智能体 :workflow(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 GenOS是针对AI代码生成语义鲁棒性的概率操作语义,通过马尔可夫核与等价关系确保工作流中组件替换的安全性,经实验验证其鲁棒性界与兼容性可测性。
LLM修复智能体中的验证证据:通过的测试究竟在多大程度上能检验缺陷?
专题命中 软件智能体 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.SE
AI总结 本研究以BSG-VA方法分析LLM修复智能体的验证证据,发现近半数阳性测试无缺陷区分信息,缺陷对比反馈可减少证据不足的部署,其效果幅度仍需进一步验证。
软件工程流水线中编码代理的基于执行的安全测试
机构 * Nanjing University(南京大学) ; Nanyang Technological University(南洋理工大学) ; Hainan University(海南大学)
专题命中 软件智能体 :agent(abstract);tool use(abstract);分类 cs.AI、cs.SE
AI总结 研究针对软件工程流水线中编码代理的安全问题,提出基于执行的红队测试框架,利用沙盒证据探测安全边界,将不安全操作嵌入工作负载并借助执行预言机优化,通过实验大幅增加不安全执行验证率,凸显编码代理需更强安全测试。
Comments Preprint. 12 pages, 6 figures
IssueTrojanBench:针对恶意问题请求对人工智能编码代理进行基准测试
机构 * Concordia University(康科德大学)
专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 研究针对恶意问题请求对人工智能编码代理进行基准测试,通过构建包含多种攻击类别和交付向量的新型基准IssueTrojanBench,发现现代编码代理存在关键漏洞,强调需更强安全机制保护。
Comments 10 pages, 4 figures, 4 tables
PerfAgent:用于仓库级代码优化的分析器引导迭代优化
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Rensselaer Polytechnic Institute(罗切斯特理工学院) ; IBM(IBM公司) ; Michigan State University(密歇根州立大学)
专题命中 软件智能体 :agent(abstract);workflow(abstract);分类 cs.AI、cs.SE
AI总结 研究针对仓库级代码优化难题,提出PerfAgent分析器引导迭代优化方法,该方法能让编码代理找到热点并改进,在两个优化基准测试中大幅提升专家匹配补丁率,且以低成本超越基线。
使用编码智能体进行自动研究:古兰经诵读数据上的泛化器和指标最大化器
机构 * Innopolis University(因诺波利斯大学) ; Skolkovo Institute of Science and Technology(斯克尔科沃科学与技术研究所)
专题命中 软件智能体 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.SE
AI总结 研究在古兰经诵读数据任务中智能体自动研究模式,Claude Code和OpenAI Codex从同一起点出发,先发明相同算法后有分歧,添加测试集后情况变化,还提炼出评估自主智能体的五条设计规则,智能体解决方案超越手工管道。
验证者即评判者:来自Ada/SPARK中AI编码代理的经过验证的安全软件
专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.SE
AI总结 研究人工智能编码代理生成安全软件代码的情况,核心方法是在验证器驱动循环下编写验证,主要贡献是通过GNATprove完成大量证明义务,降低监督成本,同时指出其不足及得出代理受反馈强度限制的教训。
ANCHOR:针对现实世界危害的CLI代理自动对齐审计
机构 * Anthropic(Anthropic公司)
专题命中 软件智能体 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL
AI总结 研究自主CLI代理在现实世界危害中的风险,提出ANCHOR自动审计框架,通过基于黑暗人格数据微调的审计代理模拟恶意用户,测试CLI代理,发现当前对齐技术不足,强调针对此类恶意用户进行安全评估的必要。
Comments Accepted at ICML 2026. 19 pages, 14 figures, 5 tables
Journal ref International Conference on Machine Learning, 2026
SCATE:学习监督编码代理以实现经济高效的测试生成
机构 * University of British Columbia(不列颠哥伦比亚大学)
专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 研究针对编码代理惰性生成致代码覆盖不足问题,提出SCATE框架,将监督设为上下文博弈问题,依覆盖和可测试性指标选测试动作,集成不同编码代理,相比基线和其他方法有更高覆盖,能动态优化代理优势。
ProjAgent:用于仓库级代码生成的过程相似性检索
机构 * University of California, Irvine(加州大学伊文斯分校)
专题命中 软件智能体 :workflow(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 研究仓库级代码生成问题,提出ProjAgent系统,将目标函数分解为中间推理步骤,通过代理工作流程检索相似过程行为的函数,结合语义检索构建丰富上下文,并利用静态分析反馈循环修复代码,实验表明该方法有效。
CoACT:用于编码智能体的动作保持观测压缩
专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 研究编码智能体观测压缩问题,提出基于动作保持的CoACT方法,通过检查智能体下一个动作来筛选压缩候选,训练时用两种奖励过滤并选择候选,实验表明该方法能降成本且保持任务解决有效性。
提示覆盖充分性
机构 * SnT, University of Luxembourg(斯蒂尔夫研究所,卢森堡大学) ; University College London(伦敦大学学院) ; University of Luxembourg(卢森堡大学)
专题命中 软件智能体 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.SE
AI总结 提出提示覆盖充分性标准,通过注意力机制衡量测试套件对提示需求的覆盖,相比传统代码覆盖能多检测30%以上缺陷。
Project Auto-World: 迈向神经关系推理器的自动化基准测试
机构 * Cardiff University(卡迪夫大学) ; University of Pennsylvania(宾夕法尼亚大学)
专题命中 软件智能体 :autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.LG
AI总结 利用大语言模型自动化生成基准测试实例,通过进化搜索和自主代理搜索发现困难样本,提升Edge Transformer的泛化能力,并应用于新世界以推动神经关系推理的自主研究。
Comments Submitted to NeurIPS 2026 E&D track. Code is available at https://github.com/autoworldrules/auto-world-rules
代码代理的仓库指导的探测与精炼调优
机构 * Williams College(威廉姆斯学院)
专题命中 软件智能体 :agent(abstract);tool use(abstract);分类 cs.LG、cs.SE
AI总结 提出探测与精炼调优方法,通过合成bug修复探测迭代诊断和修补仓库指导文件,在SWE-bench Verified上以Qwen3.5-35B-A3B模型达到33.0%解决率,优于静态知识库的28.3%和无指导基线的25.5%。
通过假设树精炼迈向通用自主研究
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) ; Microsoft Research(微软研究院)
专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL
AI总结 提出Arbor框架,通过假设树精炼(HTR)实现长期自主研究循环,在六项真实任务中平均相对保留增益超过Codex和Claude Code的2.5倍。
社会科学中的AI编码智能体:方法多样,经验一致,解释脆弱
机构 * University of Oxford(牛津大学) ; University of Zurich(苏黎世大学) ; Technical University of Munich(慕尼黑工业大学)
专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL
AI总结 研究LLM智能体在科学分析中的方法多样性与解释脆弱性,通过20次独立实验发现智能体在设计层匹配或超越人类多样性,但在裁决层易受提示影响,偏差源于解释而非估计。
FASE: 用于代码质量的快速自适应语义熵
机构 * University of Waterloo(滑铁卢大学)
专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE
AI总结 提出快速自适应语义熵(FASE),通过最小生成树近似功能正确性,在HumanEval和BigCodeBench上相比现有语义熵方法在Spearman相关性和ROCAUC上分别提升25%和19%,且计算开销仅为传统方法的0.3%。
将遗留科学代码系统性地LLM翻译为可微分框架:以陆面模型为例
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; NASA Goddard Space Flight Center(国家航空航天局戈达德空间飞行中心)
专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.SE
AI总结 提出基于LLM的五阶段流水线,将遗留Fortran代码自动翻译为JAX可微分框架,在CLM-ml-v2模型上实现完整雅可比矩阵计算和24倍加速。
SWE-Explore: 基准测试编码智能体如何探索代码仓库
机构 * Shanghai Jiao Tong University(上海交通大学) ; Xinjiang University(新疆大学) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Independent Researcher(独立研究者) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.CL、cs.SE
AI总结 提出SWE-Explore基准,通过评估编码智能体在给定代码仓库和问题下返回相关代码区域排名列表的能力,衡量其仓库探索性能,覆盖10种编程语言和203个仓库的848个问题。
Comments 20 pages, 5 figures
PRAXIS:面向领域代码生成的基于图的默会知识
专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.SE
AI总结 PRAXIS框架通过模拟人类开发工作流提取代码依赖图上的默会知识,提升智能体领域代码生成性能,优于现有方法且可适配多种智能体框架与大语言模型
比较 vibe 编码工具生成代码的质量
专题命中 软件智能体 :agent(abstract_cn);AI agent(abstract);分类 cs.SE
AI总结 本研究对比 Lovable、v0、Replit 三种 vibe 编码工具生成代码的结构质量,发现三者存在不同质量特征,选择工具需考量结构层面的权衡。
理解编码智能体的架构:一项使用研究原型的探索性研究
专题命中 软件智能体 :agent(abstract,abstract_cn);分类 cs.SE
AI总结 本研究通过推出编码智能体Ark及基准ArkBench,探索了编码智能体的架构,用gpt-5.4-mini测试Ark解决10项任务中的8项,还对比了其与先进编码智能体的架构,为相关研究提供基础。
编码智能体能通过渲染代码解决仓库级问题吗?一项关于视觉表示的探索性研究
专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 本研究探索将渲染代码作为编码智能体的操作上下文,基于 SWE-bench Verified 实验发现其可降低提示 token 成本但受模型架构限制,仅在原始代码读取为瓶颈时有用,是可行但有条件的压缩机制。
Comments 8 pages of main content
SkillSentry:基于运行时保障的大语言模型智能体可靠技能执行方案
专题命中 软件智能体 :agent(abstract);tool use(abstract);分类 cs.AI
AI总结 SkillSentry是基于DSL的技能运行时保障框架,通过初始化、监控引导与迭代优化提升LLM智能体技能执行可靠性,在15项技能上平均提升任务成功率24.1%且降低变异性。
基于双向重构-验证框架的代码智能体独立补丁验证
专题命中 软件智能体 :agent(abstract,abstract_cn);分类 cs.SE
AI总结 本研究针对代码智能体生成补丁后缺乏独立验证的问题,提出无需训练的RETRACE双向重构-验证框架,在SWE-bench Verified等基准上显著提升了代码补丁的正确性。
Comments 8 pages
FailForge:从持续失败中提取过程能力到代码智能体
专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI
AI总结 FailForge 框架将代码智能体的失败案例转化为训练信号,以边际成本恢复超26%失败实例,使 Qwen3.5-4B 在 SWE-bench Verified 上的解决率提升6.6个百分点,增益集中于最难问题。
通过分层轨迹抽象复用编码智能体的过往修复工作
专题命中 软件智能体 :agent(abstract,abstract_cn);分类 cs.SE
AI总结 本研究提出STAIR框架,通过分层轨迹抽象复用编码智能体过往修复经验,在SWE-bench Verified上显著提升修复智能体的Pass@1指标,且计划可跨智能体泛化。
Comments 10 pages
通过异构编辑重组克服大语言模型驱动的程序优化中的最弱链效应
专题命中 软件智能体 :planning(abstract);agentic(abstract);分类 cs.LG
AI总结 本研究针对LLM程序优化的最弱链效应,提出HERO异构编辑重组优化器,可生成多样非重叠原子编辑并结合评估器分数组合改进,在多领域实现更高分数、更快收敛与更少token消耗。
ClinLens:面向纵向多模态临床数据科学的长周期编码智能体
机构 * Shandong University(山东大学)
专题命中 软件智能体 :agent(abstract);workflow(abstract);分类 cs.AI
AI总结 该研究推出CLINLENS基准,包含200项基于5种MIMIC资源的临床可执行任务,实验显示现有编码智能体与生物医学系统在正确临床分析上存在显著差距。