arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-27 至 2026-05-27 共收录 13 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 13 篇

2601.18381 2026-05-27 cs.AI cs.SE 95%

AI Agent for Reverse-Engineering Legacy Finite-Difference Code and Translating to Devito

AI Agent 用于逆向工程遗留有限差分代码并转换为 Devito

Yinghan Hou, Zongyou Yang

机构 * Department of Earth Science and Engineering(地球科学与工程系) Imperial College London(帝国理工学院伦敦分校) Department of Computer Science(计算机科学系) University College London(伦敦大学学院)

专题命中 软件智能体 :agent(title,title_cn);AI agent(title,title_cn);workflow(abstract);分类 cs.AI、cs.SE

AI总结 本研究提出一个集成 AI Agent 框架,结合检索增强生成(RAG)和开源大语言模型,通过多阶段迭代工作流将遗留有限差分代码转换为 Devito 环境,并引入强化学习反馈机制实现动态自适应代码翻译。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26298 2026-05-27 cs.CR cs.OS 86%

Sandlock: Confining AI Agent Code with Unprivileged Linux Primitives

Sandlock: 使用非特权Linux原语限制AI代理代码

Cong Wang, Yusheng Zheng

专题命中 软件智能体 :AI agent(title,abstract);agent(title)

AI总结 提出Sandlock,一种轻量级Linux进程沙箱,通过静态策略编译和窄监督器分离实现无root、无cgroups、无镜像的进程隔离,支持动态网络决策和可逆文件系统效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26329 2026-05-27 cs.AI 85%

JobBench: Aligning Agent Work With Human Will

JobBench:使智能体工作符合人类意愿

Yuetai Li, Yichen Feng, Zhangchen Xu, Zixian Ma, Kaiyuan Zheng, Fengqing Jiang, Xinghua Sun, Rulin Shao, Zichen Chen, Yue Huang, Xinyang Han, Brian Lee, Kayla Xu, Shenglai Zeng, Hang Hua, Xiangliang Zhang, Basel Alomair, Ranjay Krishna, Luke Zettlemoyer, Pang Wei Koh, Bhaskar Ramasubramanian, Luyao Niu, Xiang Yue, Radha Poovendran

机构 * University of Washington(华盛顿大学) University of California, Santa Barbara(加州大学圣芭芭拉分校) Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学) Northwestern University(西北大学) University of Notre Dame(圣母大学) University of California, Berkeley(加州大学伯克利分校) Michigan State University(密歇根州立大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Bake AI King Abdulaziz City for Science and Technology(国王阿卜杜勒阿齐兹科技城) Western Washington University(西雅图华盛顿大学) University of Chicago(芝加哥大学)

专题命中 软件智能体 :agent(title,abstract);AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出JobBench基准,通过专家识别的高优先级工作流程评估AI智能体,以人类需求为中心而非经济价值,覆盖35个职业的130个任务,使用事实锚定的评分链评估,最强模型仅达45.9%,旨在推动从替代到增强的劳动力市场影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01327 2026-05-27 cs.SE cs.CL cs.LG 85%

SWE-Adept: An LLM-Based Agentic Framework for Deep Codebase Analysis and Structured Issue Resolution

SWE-Adept:基于LLM的深度代码库分析与结构化问题解决代理框架

Kang He, Kaushik Roy

机构 * Electrical and Computer Engineering, Purdue University(电子工程与计算机工程系,普渡大学)

专题命中 软件智能体 :agentic(title);agent(abstract);planning(abstract);分类 cs.CL、cs.LG、cs.SE

AI总结 提出SWE-Adept双代理框架,通过代理引导的深度优先搜索进行代码定位,结合自适应规划和结构化问题解决,在SWE-Bench上提升端到端解决率最多4.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26102 2026-05-27 cs.SE cs.CL 84%

SWE-Edit: Rethinking Code Editing for Efficient SWE-Agent

SWE-Edit:重新思考高效SWE智能体的代码编辑

Yikai Zhang, Jiaxin Pei, Kenan Li, Qirui Jin, Maoquan Wang, Jin Pan, Yu Kang, Shengyu Fu, Elsie Nallipogu, Junjie Hu, Yufan Huang, Zijian Jin

机构 * Microsoft(微软) Department of Computer Sciences, University of Wisconsin–Madison(威斯康星大学麦迪逊分校计算机科学系) Stanford Institute for Human-Centered Artificial Intelligence (HAI), Stanford University(斯坦福大学人机交互研究所)

专题命中 软件智能体 :agent(title,abstract);planning(abstract);分类 cs.CL、cs.SE

AI总结 提出SWE-Edit框架,通过将代码编辑分解为查看器和编辑器两个子智能体,解决上下文耦合问题,在SWE-Bench Verified上提升解决率2.1个百分点并降低推理成本17.9%,且通过GRPO训练小模型实现高效编辑格式选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20690 2026-05-27 cs.AI 84%

Declarative Data Services: Structured Agentic Discovery for Composing Data Systems

声明式数据服务:用于组合数据系统的结构化智能体发现

Shanshan Ye, Duo Lu

机构 * Northeastern University(东北大学) Brown University(布朗大学)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI;AI agent(comments)

AI总结 提出声明式数据服务(DDS)架构,通过分层类型契约将全局搜索分解为有界子搜索,解决无界智能体发现无法稳定收敛的问题,并在交易后端工作负载上验证其有效性。

Comments Accepted at AI Agents for Discovery in the Wild (AID-Wild), Workshop at ACM CAIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03194 2026-05-27 cs.CL cs.SE 81%

BeyondSWE: Can Current Code Agent Survive Beyond Single-Repo Bug Fixing?

BeyondSWE:当前代码代理能否超越单仓库错误修复?

Guoxin Chen, Fanzhe Meng, Jiale Zhao, Minghao Li, Daixuan Cheng, Huatong Song, Jie Chen, Yuzhi Lin, Hui Chen, Xin Zhao, Ruihua Song, Chang Liu, Cheng Chen, Kai Jia, Ji-Rong Wen

专题命中 软件智能体 :agent(title,abstract);分类 cs.CL、cs.SE

AI总结 提出BeyondSWE基准测试,评估代码代理在跨仓库、领域特定、依赖迁移和文档生成等复杂软件工程任务上的表现,发现现有代理在利用外部信息进行精确代码修改方面仍存在显著不足。

Comments Benchmark: https://huggingface.co/datasets/AweAI-Team/BeyondSWE. Repo: https://github.com/AweAI-Team/BeyondSWE. Scaffold: https://github.com/AweAI-Team/AweAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26508 2026-05-27 q-fin.RM cs.AI 80%

Foundations of a Time-Consistent Counterfactual Actuarial Runtime for Autonomous AI Agents

自主AI智能体时间一致性反事实精算运行时的基础

Hao-Hsuan Chen

机构 * Department of Risk Management and Insurance(风险管理与保险系)

专题命中 软件智能体 :AI agent(title,abstract);分类 cs.AI

AI总结 本文提出一种精算运行时层,通过为每个动作分配时间一致的反事实风险费用,并建立边界内无套利和预算保证,为自主AI智能体提供基础数学框架。

Comments 10 pages. Foundational paper of a multi-paper program on actuarial runtime for autonomous AI agents; previously posted on SSRN (id 6761960). Empirical companion: arXiv:2605.25632. Proof companions included as ancillary files

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27360 2026-05-27 cs.NI cs.AI 79%

GENESIS: Harnessing AI Agents for Autonomous 6G RAN Synthesis, Research, and Testing

GENESIS: 利用AI智能体实现自主6G RAN合成、研究与测试

Tamerlan Aghayev, Maxime Elkael, Michele Polese, Minh Dat Nguyen, Gabriele Gemmi, Andrea Lacava, Ali Saeizadeh, Reshma Prasad, Paolo Testolina, Angelo Feraudo, Soumendra Nanda, Pedram Johari, Salvatore D'Oro, Tommaso Melodia

机构 * Institute for Intelligent Networked Systems(智能网络系统研究所)

专题命中 软件智能体 :AI agent(title);agentic(abstract);分类 cs.AI

AI总结 提出GENESIS框架,通过智能体、技能和钩子三种可组合原语及知识层SYNAPSE,将意图转化为经空口实验验证的解决方案,以加速6G无线接入网研发。

Comments 18 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27238 2026-05-27 cs.SE 79%

EviACT: An Evidence-to-Action Framework for Agentic Program Repair

EviACT:一种面向智能体程序修复的证据到行动框架

Qianru Meng, Xiao Zhang, Zhaochun Ren, Joost Visser

专题命中 软件智能体 :agentic(title,abstract);分类 cs.SE

AI总结 提出EviACT框架,通过协调三个证据驱动的防护栏(检索支架、编译门、测试驱动门)来提升智能体程序修复的定位、生成和验证效率,在多个基准上修复率提升1.6-6.0个百分点,API成本降低70.1-88.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26177 2026-05-27 cs.SE cs.AI 62%

RepoMirage: Probing Repository Context Reasoning in Code Agents with Perturbations

RepoMirage: 通过扰动探测代码智能体的仓库上下文推理

Hanyu Li, Yichi Zhang, Speed Zhu, Hang Su, Jun Zhu, Yinpeng Dong

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Tencent(腾讯)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 提出RepoMirage评估套件,通过语义保持的仓库级扰动和扩展任务,揭示代码智能体在仓库上下文推理中的显著缺陷,并基于结构优先的原型工作流RepoAnchor展示改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20957 2026-05-27 cs.SE cs.AI 62%

One Tool Is Enough: Reinforcement Learning for Repository-Level LLM Agents

一个工具就够了:面向仓库级LLM智能体的强化学习

Zhaoxi Zhang, Yitong Duan, Yanzhi Zhang, Yiming Xu, Zhixiang Wang, Kun Liang, Weikang Li, Jiahui Liang, Deguo Xia, Jizhou Huang, Jiyan He, Yunfang Wu

机构 * National Key Laboratory for Multimedia Information Processing, Peking University(信息处理国家级重点实验室,北京大学) School of Computer Science, Peking University(北京大学计算机科学学院) Zhongguancun Institute of Artificial Intelligence (ZGCI)(中关村人工智能研究院(ZGCI)) Baidu Inc(百度公司)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出RepoNavigator,一个仅配备单一执行感知工具(跳转到调用符号定义)的LLM智能体,通过强化学习端到端训练,在仓库级问题定位中达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27289 2026-05-27 cs.AI 57%

Mechanized Foundations of Structural Governance: Machine-Checked Proofs for Governed Intelligence

结构治理的机械化基础:受治理智能的机器验证证明

Alan L. McCann

机构 * Mashin, Inc.(Mashin公司)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI

AI总结 本文通过Coq机械化证明和纸上证明,建立了认知工作流系统中结构治理的理论基础,包括共归纳安全谓词、治理不变性定理、充分性定理、交替范式、必要性定理,并通过属性测试验证了BEAM运行时与规范的一致性。

Comments 27 pages, 4 figures, 1 table. Code and proofs: https://github.com/mashin-live/governance-proofs. Project: https://mashin.live. v2: corrected cross-reference identifiers for companion papers. Updated license

详情

展开后加载摘要…

URL PDF HTML 收藏