arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-12 至 2026-05-12 共收录 22 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 22 篇

2603.22868 2026-05-12 cs.CR cs.AI 91%

Agent-Sentry: Bounding LLM Agents via Execution Provenance

Agent-Sentry: 通过执行溯源界定了LLM代理

Rohan Sequeira, Stavros Damianakis, Umar Iqbal, Konstantinos Psounis

机构 * University of Southern California(南加州大学) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 软件智能体 :agent(title,title_cn);agentic(abstract);分类 cs.AI

AI总结 本文提出Agent Sentry,通过学习代理良性执行的边界来检测恶意行为,有效阻止注入攻击,同时允许良性执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14655 2026-05-12 cs.AI cs.LG 90%

AgentGA: Evolving Code Solutions in Agent-Seed Space

AgentGA:在Agent-Seed空间中进化代码解决方案

David Y. Y. Tan, Kellie Chin, Jingxian Zhang

机构 * Diagnostics Development Hub (DxD Hub)(诊断开发中心(DxD中心)) Agency for Science, Technology and Research (A*STAR)(科学、技术和研究局(A*STAR))

专题命中 软件智能体 :agent(title,title_cn);分类 cs.AI、cs.LG

AI总结 AgentGA通过优化Agent-Seed提升自主代码生成性能,其在16场比赛中平均超越人类71.90%,胜率高达51.9%。

Comments 30 pages total (9-page main text + references + appendix), 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09283 2026-05-12 cs.AI cs.CL 84%

A Prompt-Aware Structuring Framework for Reliable Reuse of AI-Generated Content in the Agentic Web

面向可靠重用的AI生成内容结构化框架

Shusaku Egami, Masahiro Hamasaki

机构 * National Institute of Advanced Industrial Sciencen

专题命中 软件智能体 :agentic(title,abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一种结构化框架,通过在生成时自动附加元数据,提升AI生成内容的可追溯性和可靠性,以支持其安全重用。

Comments 5 pages, 2 figures, Accepted at FAAW@WWW2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09573 2026-05-12 cs.SE 83%

ConCovUp: Effective Agent-Based Test Driver Generation for Concurrency Testing

ConCovUp:面向并发测试的有效代理基于测试驱动生成

Yuandao Cai, Shuhao Fu, Wensheng Tang, Cheng Wen, Shengchao Qin, Charles Zhang

专题命中 软件智能体 :agent(title,abstract);multi-agent(abstract);分类 cs.SE

AI总结 本文提出ConCovUp框架,结合LLM与程序分析,通过静态分析提取共享内存访问及调用上下文,利用LLM驱动的逆向追踪方法生成有效并发测试,提升SMAP覆盖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08112 2026-05-12 cs.SE cs.AI cs.CE cs.LG cs.LO 82%

Context-Augmented Code Generation: How Product Context Improves AI Coding Agent Decision Compliance by 49%

上下文增强的代码生成:产品上下文如何通过49%提高AI编码代理的决策合规性

Drew Dillon, Kasyap Varanasi

机构 * Brief(简述)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 本文提出一个衡量决策合规性的基准,通过产品上下文检索系统提升AI编码代理的决策合规性,实验结果显示合规率从46%提升至95%。

Comments 16 pages, 3 figures, 16 tables. Benchmark repository: https://github.com/brief-hq/dcbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08956 2026-05-12 cs.AI 79%

Agentic AI Scientists Are Not Built For Autonomous Scientific Discovery

代理式AI科学家并非为自主科学发现而建

Harshit Bisht, Vinay Kumar, Kevin Maik Jablonka, Mausam, N. M. Anoop Krishnan

机构 * Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(印度理工学院德里人工智能学院) Department of Computer Science and Engineering, Indian Institute of Technology Delhi(印度理工学院德里计算机科学与工程系) Department of Civil and Environmental Engineering, Indian Institute of Technology Delhi(印度理工学院德里土木与环境工程系) Laboratory of Organic and Macromolecular Chemistry (IOMC), Friedrich Schiller University Jena(耶拿弗里德里希·席勒大学有机与大分子化学实验室) Center for Energy and Environmental Chemistry Jena, Friedrich Schiller University Jena(耶拿弗里德里希·席勒大学能源与环境化学中心) Helmholtz Institute for Polymers in Energy Applications Jena (HIPOLE Jena)(耶拿海德堡聚合物能源应用研究所(HIPOLE耶拿))

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI

AI总结 本文指出,尽管代理式AI科学家能作为合作者,但其设计并非为自主科学发现。挑战包括问题选择偏差、实验室知识缺失、输出多样性压缩及缺乏实验反馈,需重新审视基础设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08435 2026-05-12 cs.SE 79%

A Dataset of Agentic AI Coding Tool Configurations

一种代理AI编码工具配置数据集

Matthias Galster, Seyedmoein Mohsenimofidi, Levi Böhme, Jai Lal Lulla, Muhammad Auwal Abubakar, Christoph Treude, Sebastian Baltes

专题命中 软件智能体 :agentic(title,abstract);分类 cs.SE

AI总结 本文提出一个包含40585个开源仓库的AI编码工具配置数据集,涵盖5种工具和8种配置机制,用于研究上下文工程、AI工具采用模式和人机协作。

Comments 9 pages, 8 figures, 2 tables, Proceedings of the 3rd ACM/IEEE International Conference on AI-powered Software (AIware 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09594 2026-05-12 cs.CR 78%

Trust Me, Import This: Dependency Steering Attacks via Malicious Agent Skills

相信我,导入这个:通过恶意代理技能进行依赖引导攻击

Yiyong Liu, Chia-Yi Hsu, Chun-Ying Huang, Michael Backes, Rui Wen, Chia-Mu Yu

专题命中 软件智能体 :agent(title,abstract)

AI总结 研究提出依赖引导攻击,通过恶意技能引导编码代理生成恶意包,无需修改模型或数据,展示出软件供应链中的新攻击面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08927 2026-05-12 cs.PL 78%

Quantitative Comparison of Credible Compilation and Verification In Coding Agent Compiler Development

代码代理编译器开发中可信编译与验证的定量比较

Martin Rinard

专题命中 软件智能体 :agent(title,abstract)

AI总结 本文通过首个由人类监督的验证编译器,比较了可信编译与验证两种编译验证方法的效率,发现验证需要更多开发工作量,且验证优化选择更不高效的算法,证书检查时间占主导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18270 2026-05-12 cs.SE 77%

Can Old Tests Do New Tricks for Resolving SWE Issues?

旧测试能否为解决软件工程问题带来新用途?

Yang Chen, Toufique Ahmed, Reyhaneh Jabbarvand, Martin Hirzel

专题命中 软件智能体 :agent(abstract,abstract_cn);agentic(abstract);分类 cs.SE

AI总结 本文提出TestPrune,通过重用回归测试自动最小化测试套件,提升问题复现和修复效率,实验证明在多个基准测试中显著提高复现和修复率。

Comments Accepted to the main technical track of the Symposium on the Foundations of Software Engineering (FSE), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06464 2026-05-12 cs.SE 74%

To What Extent Does Agent-generated Code Require Maintenance? An Empirical Study

代理生成的代码需要多少维护?一项实证研究

Shota Sawada, Tatsuya Shirai, Yutaro Kashiwa, Ken'ichi Yamaguchi, Hiroshi Iwata, Hajimu Iida

专题命中 软件智能体 :agent(title);分类 cs.SE

AI总结 研究通过分析AI生成与人工编写代码的维护情况,发现AI代码维护频率较低,主要修改类型为功能扩展,而人工代码则以修复bug为主,人类开发者主导了大部分维护工作。

Comments 6 pages, 2 figures, 2 tables. Accepted at the 30th International Conference on Evaluation and Assessment in Software Engineering (EASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09863 2026-05-12 cs.CR cs.AI cs.CL cs.IR cs.LG 67%

Nautilus Compass: Black-box Persona Drift Detection for Production LLM Agents

Nautilus Compass:生产LLM代理的黑盒人格漂移检测

Chunxiao Wang

机构 * Yiluo Technology Co., Ltd.(亿洛科技有限公司)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 Nautilus Compass通过提示文本层的余弦相似度检测生产编码代理的人格漂移,无需调用LLM提取事实,实现高效且低成本的代理记忆层。

Comments 19 pages, 6 figures. MIT-licensed code + reproduction scripts at github.com/chunxiaoxx/nautilus-compass

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10597 2026-05-12 cs.SE cs.AI 62%

CrackMeBench: Binary Reverse Engineering for Agents

CrackMeBench:用于代理的二进制逆向工程

Isaac David, Arthur Gervais

机构 * University College London(伦敦大学学院)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 CrackMeBench旨在评估语言模型代理在教育类CrackMe逆向工程任务中的能力,通过确定性二进制验证问题,结合公开校准CrackMe和生成任务,测试代理在无网络LinuxDocker沙箱中的表现,提供可重复的测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16349 2026-05-12 cs.IR cs.AI cs.CL 62%

Benchmarking Real-Time Question Answering via Executable Code Workflows

通过可执行代码工作流基准测试实时问答

Wenjie Zhou, Yuan Gao, Xin Zhou, Hao Fu, Zhongjian Miao, Wei Chen, Bo Chen, Xiaobing Zhao

机构 * Li Auto Inc(利亚 Auto 公司) Minzu University of China(民族大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出RT-QA框架,通过可执行代码工作流实现动态评估,发现现有模型在实时适应性上存在显著不足,主要问题包括懒惰检索和时间混淆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07833 2026-05-12 cs.LG cs.AI 62%

MURPHY: Feedback-Aware GRPO with Retrospective Credit Assignment for Multi-Turn Code Generation

MURPHY:具有回顾性信用分配的反馈感知GRPO用于多轮代码生成

Chanakya Ekbote, Vijay Lingam, Sujay Sanghavi, Jun Huan, Behrooz Omidvar-Tehrani, Anoop Deoras, Stefano Soatto

机构 * Massachusetts Institute of Technology(麻省理工学院) AWS AI(AWS人工智能)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 MURPHY通过构建反馈条件化的rollout树,实现多轮自修正代码生成,采用最大奖励和平均奖励策略,并引入post-rollout剪枝机制,提升多轮优化效率。

Comments 21 pages, 2 figures, 8 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02184 2026-05-12 cs.AI cs.DC cs.PL cs.SE 62%

Leveraging LLMs to Automate Energy-Aware Refactoring of Parallel Scientific Codes

利用LLM自动化能源感知的并行科学代码重构

Matthew T. Dearing, Yiheng Tao, Xingfu Wu, Zhiling Lan, Valerie Taylor

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文研究LLM能否在经验执行反馈指导下生成能源高效的并行科学代码,提出LASSI-EE框架,通过多阶段迭代方法结合运行时功耗分析、能源感知提示、自纠正反馈循环和LLM作为裁判代理,实现代码重构。

Comments 12 pages, 5 figures, version under review at a peer-reviewed conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08366 2026-05-12 cs.LG cs.SE 62%

SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution

SWE Atlas:超越问题解决的编码代理基准测试

Mohit Raghavendra, Soham Dan, Miguel Romero Calvo, Yannis Yiming He, Johannes Baptist Mols, Gautam Anand, Cole McCollum, Edgar Arakelyan, Vijay Bharadwaj, Andrew Park, Jeff Da, MohammadHossein Rezaei, Bing Liu, Brad Kenstler, Yunzhong He

专题命中 软件智能体 :agentic(abstract);分类 cs.LG、cs.SE

AI总结 SWE Atlas通过涵盖代码库问答、测试编写和重构三个软件工程流程,提供了一种新的基准测试套件,评估编码代理的正确性和工程质量。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10500 2026-05-12 cs.AI 57%

SkillEvolver: Skill Learning as a Meta-Skill

SkillEvolver: 技能学习作为元技能

Genrui Zhang, Erle Zhu, Jinfeng Zhou, Caiyan Jia, Hongning Wang

机构 * Tsinghua University(清华大学) Beijing Jiaotong University(北京交通大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 SkillEvolver通过元技能迭代生成、部署和优化领域特定技能,无需重新训练即可直接应用于任何智能体,其学习目标是技能的文本和代码而非模型权重,通过元技能自身作为技能加载,提升技能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07237 2026-05-12 cs.CL 57%

Teaching Language Models to Think in Code

教语言模型用代码思考

Hyeon Hwang, Jiwoo Lee, Jaewoo Kang

机构 * Korea University(韩国大学) AIGEN Sciences(AIGEN科技)

专题命中 软件智能体 :planning(abstract);分类 cs.CL

AI总结 本文提出ThinC框架,通过代码自身进行推理而非依赖自然语言,提升了数学问题解决能力,其在多个基准测试中表现优异。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08621 2026-05-12 cs.SE 57%

EvidenT: An Evidence-Preserving Framework for Iterative System-Level Package Repair

EvidenT: 一个证据保留的系统级包修复框架

Chenyu Zhao, Minghua Ma, Shenglin Zhang, Zeshun Huang, Yongqian Sun, Chetan Bansal, Saravan Rajmohan, Dan Pei

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 本文提出EvidenT框架,通过证据管理与工具执行解耦,解决系统级包修复中的依赖和环境配置问题,实验显示其在RISC-V包修复中表现优异,且在不同架构上具有良好的通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02175 2026-05-12 cs.AI 57%

Intervention Complexity as a Canonical Reward and a Measure of Intelligence

干预复杂性作为规范奖励和智能的度量

Brendan McCane

机构 * School of Computing University of Otago(计算学院奥塔哥大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出干预复杂性作为智能的规范度量,具有环境衍生性、普遍性、最小性、敏感性和成就偏好等性质,通过资源函数定义通用奖励,并探讨智能的双维度表征及计算可性。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08382 2026-05-12 cs.CR cs.CL cs.CY 57%

SecureForge: Finding and Preventing Vulnerabilities in LLM-Generated Code via Prompt Optimization

SecureForge:通过提示优化发现并防止LLM生成代码中的漏洞

Houjun Liu, Lisa Einstein, John Yang, Joachim Baumann, Duncan Eddy, Christopher D. Manning, Mykel Kochenderfer, Diyi Yang

机构 * Stanford University(斯坦福大学)

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 本文提出SecureForge框架,通过自动化流程发现并减少LLM生成代码中的安全漏洞,提升代码安全性的同时保持单元测试性能,实验显示漏洞减少达48%。

详情

展开后加载摘要…

URL PDF HTML 收藏