arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 3188 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 3188 篇

2606.06752 2026-07-21 cs.SE 版本更新 83%

Pomona: Continuous Code Quality Improvement via Small, Agentic Pull Requests at Bloomberg

Pomona:通过小型自动化变更实现彭博社的持续代码质量改进

David Williams, Angelos Evripiotis, Serkan Kirbas, Harry Morgan, Sergey Magidovich, Peter Wainwright, Federica Sarro

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.SE

AI总结 提出Pomona轻量级代理工具,通过扫描和修复技能自动发现并修复代码问题,生成约10行差异的小型PR,经一个月团队部署和10名高级工程师问卷评估,17个PR中15个成功合并,中位关闭时间低于2小时,8/10工程师愿意采用。

Comments 6 pages, 2 figures, 1 table, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15948 2026-07-20 cs.SE 新提交 83%

TARS: A Theory-of-Mind Agent for Personalized In-IDE Code Comprehension

TARS:用于个性化IDE内代码理解的心理理论智能体

Leopoldo Todisco, Antonio Della Porta, Stefano Lambiase, Fabio Palomba

专题命中 软件智能体 :agent(title,abstract);workflow(abstract);分类 cs.SE

AI总结 研究针对代码理解中LLM助手的不足,提出TARS智能体,基于心理理论范式,剖析开发者特点并调整解释,通过检索增强生成联系项目文档。实验表明它能提升效率、降低认知负荷,解释更适配开发者。

Comments Accepted at ICSME 2026, Tool Demonstration and Data Showcase Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14570 2026-07-17 cs.AI cs.CR 新提交 83%

Democratizing Agent Deployment Safety: A Structural Monitoring Approach

使智能体部署安全民主化:一种结构监测方法

Preeti Ravindra, Rahul Tiwari, Vincent Wolowski

专题命中 软件智能体 :agent(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 研究人工智能智能体部署安全问题,引入信息流图(IFG)监测器,通过控制流、数据流图及原始代码差异分析结构安全回归。实验表明,IFG监测器能降低攻击错过率,还可同步作为部署前保障,为组织实现部署安全民主化提供实用途径。

Comments Accepted in ICML 2026 Workshops: AI4GOOD and AIWILD

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12057 2026-07-15 cs.SE 新提交 83%

Predicting Acceptance and Review Effort in Human and Agent Pull Requests

预测人类和智能体拉取请求的接受情况及评审工作量

Kartik Ghanshyambhai Pansuriya, Ehsan Ghorbani, Deepak Singh, Eman Abdullah AlOmar

专题命中 软件智能体 :agent(title,abstract);workflow(abstract);分类 cs.SE

AI总结 研究在拉取请求打开时预测其接受情况及评审工作量的可行性,利用AIDev数据集构建预测管道,评估多种机器学习模型,发现接受度预测可行,评审工作量预测较难,早期模型可支持分类和优先级排序,应作咨询工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11698 2026-07-14 cs.CR cs.AI 新提交 83%

Agent Hacks Agent: Autoresearch for Production-Agent Red-Teaming

智能体攻击智能体:用于生产智能体红队测试的自动研究

Xutao Mao, Xiang Zheng, Cong Wang

机构 * City University of Hong Kong(香港城市大学)

专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 研究生产型语言模型智能体的自动化红队测试,提出AHA可证伪发现循环,通过该循环构建漏洞概念图。在Claude Code和Codex上测试,发现跨模型和智能体的可重复使用漏洞核心,生成的VCG为安全团队提供可审计工件,提升测试性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09217 2026-07-13 cs.AI cs.MS 新提交 83%

OpenProver: Agentic and Interactive Theorem Proving with Lean 4

OpenProver:使用Lean 4进行智能且交互式的定理证明

Matěj Kripner, Milan Straka

机构 * Charles University, Faculty of Mathematics and Physics(查尔斯大学数学与物理系)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 介绍用于大语言模型驱动的自动化定理证明的开源系统OpenProver,它集成特定架构,完全开源,能自动验证证明,提供交互式界面,通过在ProofNet上评估展示自动验证在定量消融实验中的潜力。

Comments 7 pages, 2 figures. Accepted at the 19th Conference on Intelligent Computer Mathematics (CICM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09123 2026-07-13 cs.SE 新提交 83%

ReProAgent: Tool-Augmented Multi-Stage Agentic Generation of Bug Reproduction Tests from Issue Reports

ReProAgent:从问题报告中通过工具增强的多阶段代理生成错误重现测试

Quanjun Zhang, Yi Zheng, Ye Shang, Weifeng Sun, Haichuan Hu, Chunrong Fang, Zhenyu Chen, Liang Xiao

专题命中 软件智能体 :agentic(title);agent(abstract);planning(abstract);分类 cs.SE

AI总结 研究提出ReProAgent多阶段代理框架,从问题报告生成错误重现测试,将任务分解为四个阶段,集成多种工具支持各阶段,实验表明其能成功重现较多问题,优于基线,还可跨模型泛化并提升下游问题解决性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01480 2026-07-13 cs.AI physics.comp-ph 版本更新 83%

A Self-Evolving Agentic Framework for Metasurface Inverse Design

一种自演化代理框架用于超材料逆向设计

Yi Huang, Bowen Zheng, Yunxi Dong, Hong Tang, Huan Zhao, S. M. Rakibul Hasan Shawon, Hualiang Zhang

机构 * University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出一种自演化代理框架,通过上下文级技能进化解决超材料逆向设计中工作流构建的难题,提升任务成功率并减少尝试次数,实现可重用的求解器专业知识积累。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20064 2026-07-13 cs.PL cs.AI cs.CR 版本更新 83%

The LLMbda Calculus: AI Agents, Conversations, and Information Flow

LLMlambda 计算:人工智能代理、对话与信息流

Zac Garby, Andrew D. Gordon, David Sands

机构 * University of Nottingham, UK(诺丁汉大学) University of Edinburgh, UK(爱丁堡大学) Chalmers University of Technology(查尔姆斯理工大学) The University of Gothenburg, Sweden(哥德堡大学)

专题命中 软件智能体 :AI agent(title);agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出了一种无类型的lambda计算模型,用于形式化描述和验证人工智能代理中对话和信息流的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06065 2026-07-08 cs.SE 新提交 83%

SWE-Review: Closing the Loop on Issue Resolution with Agentic Code Review

SWE-Review:通过智能代码审查解决问题闭环

Ruoyu Wang, Jierun Chen, Shaowei Wang, Chaofan Tao, Sidi Yang, Yuxin Jiang, Kim-Hui Yap, Lifeng Shang, Xiaohui Li, Haoli Bai

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.SE

AI总结 研究通过智能代码审查闭合PR生成环的问题,核心方法是SWE-Review框架,由审查代理进行审查并提供反馈。主要贡献是能持续改进PR,在多方面表现优于单轮审查,还能推动AI编码代理从一次性PR生成迈向闭环问题解决。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03766 2026-07-07 cs.SE 新提交 83%

Semantic-aware and Self-improving Program Reduction via Agentic Large Language Models

通过智能大语言模型实现语义感知和自我改进的程序简化

Xintong Zhou, Hongxu Xu, Chunhao Liao, Puzhuo Liu, Yongqiang Tian, Chengnian Sun

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.SE

AI总结 研究将程序简化作为由智能大语言模型驱动的自主推理任务,方法是让模型分析语义、提出假设并迭代改进,还能提炼经验,PROJ框架实现该方法,实验表明其优于现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01929 2026-07-03 cs.SE 新提交 83%

Beyond Textual Repository Exploration: Dual-Modal Structural Reasoning for Agentic Issue Resolution

超越文本仓库探索:面向智能体问题解决的双模态结构推理

Jiayi Zhang, Kai Huang, Yang Liu, Chunyang Chen

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.SE

AI总结 提出DUALVIEW框架,通过模块耦合图、函数调用图、类层次图和程序依赖图四种图视图,结合视觉与文本响应,使智能体在仓库探索中直接推理代码依赖结构,提升长时域问题解决性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00016 2026-07-02 cs.IR cs.AI 新提交 83%

Libra: Training the Environment for Agentic Information Retrieval

Libra: 为智能信息检索训练环境

Xuan Zhao, Andy Chiu, Gengyu Wang

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 提出Libra框架,通过引入可变目录和LLM驱动优化循环,自动改进代码仓库的索引结构,提升代码定位准确率,并实现跨模型和问题的零样本迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28279 2026-06-29 cs.AR cs.AI 新提交 83%

Agentic Hardware Design as Repository-Level Code Evolution

代理硬件设计作为仓库级代码演化

Cunxi Yu, Chenhui Deng, Nathaniel Pinckney, Brucek Khailany

机构 * NVIDIA Research(NVIDIA研究)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 提出HORIZON自演化代理框架,将硬件设计视为仓库级代码演化,通过Markdown编译项目包和免手代理循环实现全自动基准测试,在多个基准上达到100%完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26289 2026-06-26 cs.SE 新提交 83%

Augmentation with Dilution: A Large-Scale Empirical Study of Human Contributor Ecosystems After AI Coding Agent Adoption

稀释式增强:AI编码代理采纳后人类贡献者生态系统的大规模实证研究

Weixing Zhang, Bowen Jiang, Anne Koziolek

专题命中 软件智能体 :agent(title,abstract);AI agent(abstract);分类 cs.SE

AI总结 通过双重差分法分析11,097个GitHub仓库,发现AI编码代理采纳不改变人类贡献者绝对数量,但显著降低其密度,并减少新人参与份额,同时增加审查深度,揭示“稀释式增强”模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19419 2026-06-19 cs.RO cs.AI 新提交 83%

Playful Agentic Robot Learning

趣味性具身机器人学习

Junyi Zhang, Jiaxin Ge, Hanjun Yoo, Letian Fu, Zihan Yang, Yaowei Liu, Raj Saravanan, Shaofeng Yin, Justin Yu, Dantong Niu, Zirui Wang, Roei Herzig, Ken Goldberg, Yutong Bai, David M. Chan, Ion Stoica, Angjoo Kanazawa, Jiahui Lei, Haiwen Feng, Trevor Darrell

机构 * University of California, Berkeley(加州大学伯克利分校) Impossible Research

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 提出RATs框架,让机器人通过自主探索学习可复用技能,在LIBERO-PRO和MolmoSpaces上分别提升20.6和17.0个百分点。

Comments Project page: https://playful-rats.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07314 2026-06-08 cs.SE cs.ET quant-ph 新提交 83%

QBugLM: An Agentic Benchmarking Framework for LLM-based Quantum Software Debugging

QBugLM:基于LLM的量子软件调试的智能基准测试框架

An B. B. Pham, Hoa T. Nguyen, Muhammad Usman

专题命中 软件智能体 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.SE

AI总结 提出QBugLM多智能体框架,自动化量子软件调试流程,通过案例研究评估LLM调试能力,发现迭代反馈显著提升修复成功率。

Comments This paper was accepted at IEEE QSW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
1701.01487 2026-06-04 cs.AI cs.SY eess.SY 83%

Designing a Safe Autonomous Artificial Intelligence Agent based on Human Self-Regulation

基于人类自我调节设计安全的自主人工智能代理

Mark Muraven

专题命中 软件智能体 :agent(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出通过研究人类自我调节机制,设计安全的人工智能代理,以避免复杂系统中因目标不明确导致的有害后果。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28588 2026-05-28 cs.CR cs.AI 83%

Technical Report: Exploring the Emerging Threats of the Agent Skill Ecosystem

技术报告:探索智能体技能生态系统的新兴威胁

Luca Beurer-Kellner, Aleksei Kudrinskii, Marco Milanta, Kristian Bonde Nielsen, Hemang Sarkar, Liran Tal

机构 * Snyk

专题命中 软件智能体 :agent(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 本研究通过分析3984个AI智能体技能,发现76个恶意载荷,揭示了技能生态系统中的安全威胁,并提出了威胁分类和攻击模式。

Comments 10 pages, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16265 2026-05-19 cs.AI cs.CR 83%

AgentWall: A Runtime Safety Layer for Local AI Agents

AgentWall:本地AI代理的运行时安全层

Ashwin Aravind

专题命中 软件智能体 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出AgentWall,一种用于本地AI代理的运行时安全与可观测性层,通过拦截代理操作、评估政策、要求人类批准和记录执行轨迹,实现92.9%的政策执行准确率。

Comments 16 pages, 2 figures, open-source implementation at https://github.com/agentwall/Agentwall

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13625 2026-05-14 cs.AI 83%

How to Interpret Agent Behavior

如何解释智能体行为

Jie Gao, Kaiser Sun, Jen-tse Huang, Katherine Van Koevering, Sijie Ji, Heyuan Huang, Weiyan Shi, Zhuoran Lu, Ziang Xiao, Daniel Khashabi, Mark Dredze

机构 * Johns Hopkins University(约翰霍普金斯大学) California Institute of Technology(加州理工学院) Northeastern University(东北大学) Purdue University(普渡大学)

专题命中 软件智能体 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文提出ACT*ONOMY框架,通过构建行为分类体系和开放仓库,帮助研究人员更一致地解读智能体行为,提升监控与控制能力。

Comments 34 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12863 2026-05-14 cs.PL cs.AI cs.CR 83%

Language-Based Agent Control

基于语言的代理控制

Timothy Zhou, Loris D'Antoni, Nadia Polikarpova

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出语言基于代理控制(LBAC),一种新的代理应用编程模型,结合编程语言和语言基础安全技术,确保代理控制的正确性。LBAC通过要求代理生成在周围框架代码上下文中类型正确的程序,从而在执行前拒绝不安全程序,实现统一的策略应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09573 2026-05-12 cs.SE 83%

ConCovUp: Effective Agent-Based Test Driver Generation for Concurrency Testing

ConCovUp:面向并发测试的有效代理基于测试驱动生成

Yuandao Cai, Shuhao Fu, Wensheng Tang, Cheng Wen, Shengchao Qin, Charles Zhang

专题命中 软件智能体 :agent(title,abstract);multi-agent(abstract);分类 cs.SE

AI总结 本文提出ConCovUp框架,结合LLM与程序分析,通过静态分析提取共享内存访问及调用上下文,利用LLM驱动的逆向追踪方法生成有效并发测试,提升SMAP覆盖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06713 2026-05-11 cs.CR cs.AI cs.HC 83%

Agentic AI and the Industrialization of Cyber Offense: Forecast, Consequences, and Defensive Priorities for Enterprises and the Mittelstand

代理AI与网络攻击的工业化:预测、后果及企业与中产阶层的防御优先事项

Christopher Koch

机构 * Independent Researcher(独立研究者)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文探讨代理AI对网络攻击生命周期的影响,提出三通道代理网络风险模型和攻击压缩模型,通过2026年Linux内核复制失败事件案例,预测2026-2028年企业及德国中产防御需求,强调身份验证、补丁速度等防御优先级。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11535 2026-05-08 cs.AI 83%

Problem Reductions at Scale: Agentic Integration of Computationally Hard Problems

大规模问题规约:代理集成计算难题

Xi-Wei Pan, Shi-Wen An, Jin-Guo Liu

机构 * HKUST (GZ)(香港科技大学(广州)) Institute of Science Tokyo(东京科学研究所) RIKEN AIP(理化学研究所AIP)

专题命中 软件智能体 :agentic(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出通过代理工程实现大规模问题规约库,利用无代码贡献路线、多层验证栈和自动化流程,快速构建包含100多种问题类型和200多种规约规则的工具,实现问题与求解器的高效连接。

Comments The source code is available at https://github.com/CodingThrust/problem-reductions

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05584 2026-05-08 cs.SE cs.CY 83%

Operationalizing Ethics for AI Agents: How Developers Encode Values into Repository Context Files

将伦理应用于AI代理:开发者如何将价值观编码到仓库上下文文件中

Christoph Treude, Sebastian Baltes, Marc Cheong

专题命中 软件智能体 :AI agent(title,abstract);agent(abstract);分类 cs.SE

AI总结 本文探讨开发者如何通过仓库上下文文件将伦理原则转化为AI代理的行为指令,分析价值观编码的多样性及治理动态,为AI治理提供软件工程实践基础。

Comments 3rd ACM International Conference on AI-powered Software (AIware 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28138 2026-05-01 cs.OS cs.AI 83%

Crab: A Semantics-Aware Checkpoint/Restore Runtime for Agent Sandboxes

Crab:一种语义感知的检查点/恢复运行时用于智能体沙盒

Tianyuan Wu, Chaokun Chang, Lunxi Cao, Wei Gao, Wei Wang

机构 * HKUST(香港科技大学)

专题命中 软件智能体 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 Crab通过桥接智能体与操作系统间的语义鸿沟,提升检查点恢复的准确性,减少检查点流量,提高执行效率。

Comments 15 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19606 2026-05-01 cs.AI cs.MA 83%

AblateCell: A Reproduce-then-Ablate Agent for Virtual Cell Repositories

AblateCell: 一个用于虚拟细胞库的可重现后消去代理

Xue Xia, Chengkai Yao, Mingyu Tsoi, Xinjie Mao, Wenxuan Huang, Jiaqi Wei, Hao Wu, Cheng Tan, Lang Yu, Yuejin Yang, Mengdi Liu, Siqi Sun, Zhangyang Gao

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of California San Diego(加州大学圣地亚哥分校) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 软件智能体 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 AblateCell通过可重现后消去方法解决AI虚拟细胞性能归因问题,实现高准确度的代码库验证与属性归因。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22040 2026-04-29 cs.CR cs.SE 83%

"Your AI, My Shell": Demystifying Prompt Injection Attacks on Agentic AI Coding Editors

你的AI,我的Shell:解密面向代理AI编码编辑器的提示注入攻击

Yue Liu, Yanjie Zhao, Yunbo Lyu, Ting Zhang, Haoyu Wang, David Lo

专题命中 软件智能体 :agentic(title,abstract);AI agent(abstract);分类 cs.SE

AI总结 研究分析了高权限代理AI编码编辑器的提示注入攻击,通过AIShellJack框架测试,发现攻击成功率高达84%,可实现从初始访问到数据外泄的多种攻击目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23080 2026-04-28 cs.MA cs.AI cs.DC 83%

Usable Agent Discovery for Decentralized AI Systems

用于去中心化人工智能系统的可用代理发现

Patrizio Dazzi, Emanuele Carlini, Matteo Mordacchini, Saul Urso

机构 * Department of Computer Science(计算机科学系) University of Pisa(比萨大学) Institute of Information Science and Technologies(信息科学与技术研究所) National Research Council of Italy(意大利国家研究理事会) Institute of Informatics and Telematics(信息学与电信研究所)

专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 本文研究了在双层 churn 情况下去中心化代理发现,比较了不同机制在路由效率、鲁棒性和服务准备度方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏