arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-22 至 2026-05-22 共收录 7 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 7 篇

2605.22534 2026-05-22 cs.SE 87%

Why Are Agentic Pull Requests Merged or Rejected? An Empirical Study

为什么代理拉请求数被合并或拒绝?一项实证研究

Sien Reeve O. Peralta, Fumika Hoshi, Hironori Washizaki, Naoyasu Ubayashi, Inase Kondo, Yoshiki Higo, Hiroki Mukai, Norihiro Yoshida, Kazuki Kusama, Hidetake Tanaka, Youmei Fan

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);workflow(abstract);分类 cs.SE

AI总结 本研究通过实证分析探讨代理拉请求数被合并或拒绝的原因,发现仅依赖合并或拒绝结果无法准确反映代理能力,需考虑审查互动过程。

Comments Accepted for publication in 23rd international conference on Mining Software Repositories (MSR 2026) : 5 pages, 3 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15606 2026-05-22 cs.AR 78%

Spec2Cov: An Agentic Framework for Code Coverage Closure of Digital Hardware Designs

Spec2Cov: 一种用于数字硬件设计代码覆盖率闭合的代理框架

Sean Lowe, Elias Hilaneh, Alma Babbit, Nakul Gopalan, Vidya Chhabria, Aman Arora

专题命中 软件智能体 :agentic(title,abstract)

AI总结 本文提出了一种基于代理框架的代码覆盖率闭合方法,利用大型语言模型和硬件仿真器的协同工作,自动迭代生成测试刺激以加速覆盖率闭合,并在不同复杂度的设计上实现了高达49%的覆盖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22526 2026-05-22 cs.SE 70%

"Refactoring Runaway": Understanding and Mitigating Tangled Refactorings in Coding Agents for Issue Resolution

重构失控:理解并缓解编码代理中交织的重构

Zhao Tian, Zifan Zhang, Tao Xiao, Dong Wang, Masanari Kondo, Junjie Chen, Yasutaka Kamei

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.SE

AI总结 本文研究了编码代理在问题解决中交织重构的现象,通过实证分析发现代理重构的频率和强度低于人类开发者,提出了一种重构感知的精炼方法以提高编译性并解决未解决的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22175 2026-05-22 cs.SE cs.AI 62%

SWE-Mutation: Can LLMs Generate Reliable Test Suites in Software Engineering?

SWE-Mutation:LLMs能否在软件工程中生成可靠的测试套件?

Yuxuan Sun, Yuze Zhao, Yufeng Wang, Yao Du, Zhiyuan Ma, Jinbo Wang, Mengdi Zhang, Kai Zhang, Zhenya Huang

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学) Beihang University(北航) School of Mathematical Sciences, Peking University(北京大学数学科学学院) NeoShell AI Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文提出SWE-Mutation基准,用于评估LLM生成的测试套件质量,通过系统性地变异解决方案来测试测试套件的可靠性,并发现当前LLM在生成可靠且具有判别力的测试套件方面存在不足。

Comments 24 pages, 8 figures

Journal ref ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10085 2026-05-22 cs.AI 57%

CODE-SHARP: Continuous Open-ended Discovery and Evolution of Skills as Hierarchical Reward Programs

CODE-SHARP: 连续开放发现和演化的技能作为层次奖励程序

Richard Bornemann, Pierluigi Vito Amadori, Antoine Cully

机构 * Imperial College London(帝国理工学院伦敦分校) Sony Interactive Entertainment(索尼互动娱乐)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 该研究提出CODE-SHARP框架,通过基础模型自主发现和演化技能作为层次奖励程序,实现通用智能体政策的从零开始强化学习,无需预定义奖励,有效学习长周期技能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21810 2026-05-22 cs.AI cs.MA 57%

Trace2Skill: Verifier-Guided Skill Evolution for Long-Context EDA Agents

Trace2Skill: 验证器引导的技能进化用于长上下文EDA代理

Zijian Du, Nathaniel Pinckney

机构 * NVIDIA

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出Trace2Skill框架,通过验证器引导的技能进化提升硬件代理在复杂验证问题上的性能,无需RTL专用模型微调,通过密集验证器反馈实现任务通过率的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21497 2026-05-22 cs.CR cs.AI 57%

Autonomous LLM Agents & CTFs: A Second Look

自主大语言模型代理与CTF:再看一次

Youness Bouchari, Matteo Boffa, Marco Mellia, Idilio Drago, Thanh Minh Bui, Dario Rossi

机构 * Politecnico di Torino(托尔托纳理工大学) Università di Torino(托尔托纳大学) Huawei Technologies France(华为法国技术)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文重新审视了大语言模型代理在自动化进攻性安全任务中的表现,通过在30个基于网络的CTF挑战中测试不同架构的代理,发现通用代理在性能上与定制架构相当,并揭示了当前代理在某些类别中的持续障碍。

Comments Accepted at DeMeSSAI Workshop @ IEEE EuroS&P 2026

详情

展开后加载摘要…

URL PDF HTML 收藏