arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 3200 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 3200 篇

2602.06310 2026-06-04 cs.SE 77%

Trustworthy AI Software Engineers

可信赖的AI软件工程师

Aldeida Aleti, Baishakhi Ray, Rashina Hoda, Simin Chen

专题命中 软件智能体 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.SE

AI总结 本文探讨AI代理作为软件工程师的信任问题,提出以证据为中心的检查方法,从技术质量、透明度、认知谦逊和社会伦理等维度定义可信赖性。

Comments The first three authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03394 2026-06-03 cs.SE 77%

Human-AI Collaboration and the Transformation of Software Engineering Work

人机协作与软件工程工作的转型

Mamdouh Alenezi

专题命中 软件智能体 :agentic(abstract,abstract_cn);agent(abstract);分类 cs.SE

AI总结 本文通过结构化综合分析方法,研究了生成式AI和智能体AI如何将软件工程从以人类编写代码为中心转变为以指导、验证和管理自主及半自主系统为中心,并提出了一个包含技术、认知、社会技术、治理和组织五个维度的未来工程师能力框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18552 2026-06-03 cs.SE cs.AI cs.CL cs.LG 77%

Toward Training Superintelligent Software Agents through Self-Play SWE-RL

通过自我对弈SWE-RL训练超级智能软件代理

Yuxiang Wei, Zhiqing Sun, Emily McMilin, Jonas Gehring, David Zhang, Gabriel Synnaeve, Daniel Fried, Lingming Zhang, Sida Wang

机构 * Meta FAIR University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta TBD Lab(Meta TBD 实验室) Carnegie Mellon University(卡内基梅隆大学)

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出自我对弈SWE-RL(SSR)方法,通过强化学习在自对弈环境中训练单一LLM代理,使其在无需人工标注问题或测试的情况下,在真实代码库中迭代注入和修复软件缺陷,在SWE-bench基准上实现显著自我改进并超越人类数据基线。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28617 2026-05-28 cs.AI cs.PL 77%

LACUNA: Safe Agents as Recursive Program Holes

LACUNA: 作为递归程序空洞的安全智能体

Yaoyu Zhao, Yichen Xu, Oliver Bračevac, Cao Nguyen Pham, Frank Zhengqing Wu, Martin Odersky

机构 * EPFL(苏黎世联邦理工学院)

专题命中 软件智能体 :agent(abstract,abstract_cn);planning(abstract);分类 cs.AI

AI总结 提出LACUNA编程模型,通过类型化调用和编译时检查,让LLM智能体以递归程序空洞的方式安全地编写代码,实现表达性与安全性的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20160 2026-05-26 cs.SE 77%

How do Agents Refactor: An Empirical Study

智能体如何重构:一项实证研究

Lukas Ottenhof, Daniel Penner, Abram Hindle, Thibaud Lutellier

专题命中 软件智能体 :agent(abstract,abstract_cn);agentic(abstract);分类 cs.SE

AI总结 通过对比86个Java项目中智能体与开发者的重构拉取请求,发现智能体重构以注释修改为主,而Cursor是唯一显著增加代码味道的模型。

Comments Accepted for publication in 23rd International Mining Software Repositories Conference (MSR 2026) : 5 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24812 2026-05-26 cs.AI 77%

CoRe-Code: Collaborative Reinforcement Learning for Code Generation

CoRe-Code:面向代码生成的协作式强化学习

Zhihao Dou, Qinjian Zhao, Zhongwei Wan, Xiaoyu Xia, Sumon Biswas

机构 * The Ohio State University(俄亥俄州立大学) Royal Melbourne Institute of Technology(皇家墨尔本理工学院)

专题命中 软件智能体 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI

AI总结 提出CoRe-Code框架,通过规划器-编码器范式和基于GRPO的协作感知强化学习,增强多智能体间的协调与专业化,提升代码生成的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24659 2026-05-26 cs.LG 77%

IterInject: Indirect Prompt Injection Against LLM Agents via Feedback-Guided Iterative Optimization

IterInject: 通过反馈引导的迭代优化实现对LLM智能体的间接提示注入

Zixuan Chen, Jiaxiang Chen, Li Luo, Ke Xu, Xiaoxiang Huang, Tanfeng Sun, Xinghao Jiang

机构 * Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学)

专题命中 软件智能体 :agent(abstract);tool use(abstract);planning(abstract);分类 cs.LG

AI总结 提出IterInject框架,通过规则诊断器和LLM优化器迭代优化对抗载荷,实现对LLM智能体的间接提示注入攻击,在多个基准和实际系统中显著优于现有方法,并揭示了注意力介导的阈值机制。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18270 2026-05-12 cs.SE 77%

Can Old Tests Do New Tricks for Resolving SWE Issues?

旧测试能否为解决软件工程问题带来新用途?

Yang Chen, Toufique Ahmed, Reyhaneh Jabbarvand, Martin Hirzel

专题命中 软件智能体 :agent(abstract,abstract_cn);agentic(abstract);分类 cs.SE

AI总结 本文提出TestPrune,通过重用回归测试自动最小化测试套件,提升问题复现和修复效率,实验证明在多个基准测试中显著提高复现和修复率。

Comments Accepted to the main technical track of the Symposium on the Foundations of Software Engineering (FSE), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08013 2026-05-11 cs.AI 77%

Learning CLI Agents with Structured Action Credit under Selective Observation

基于选择性观察的结构化行动信用学习CLI代理

Haoyang Su, Ying Wen

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学)

专题命中 软件智能体 :agent(abstract,abstract_cn);agentic(abstract);分类 cs.AI

AI总结 本文研究了CLI代理在选择性观察和行动信用分配中的瓶颈,提出σ-Reveal和A³方法,构建ShellOps数据集以评估CLI任务学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23674 2026-04-28 cs.AI 77%

Vibe Medicine: Redefining Biomedical Research Through Human-AI Co-Work

Vibe Medicine:通过人机协作重新定义生物医学研究

Zihao Wu, Steven Xu, Bowen Chen, Shaowen Wan, Yiwei Li, Wei Ruan, Yanjun Lyu, Siyuan Li, Dajiang Zhu, Tianming Liu, Lin Zhao

机构 * School of Computing, University of Georgia(佐治亚大学计算学院) Department of Biomedical Engineering, New Jersey Institute of Technology(新泽西理工学院生物医学工程系) Department of Computer Science and Engineering, University of Texas at Arlington(德克萨斯大学阿灵顿分校计算机科学与工程系)

专题命中 软件智能体 :agent(abstract,abstract_cn);AI agent(abstract);分类 cs.AI

AI总结 本文提出Vibe Medicine,通过自然语言指导AI代理执行复杂生物医学流程,解决多领域数据整合与分析难题,提升研究效率与公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28653 2026-04-14 cs.NE cs.SE 77%

BACE: LLM-based Code Generation through Bayesian Anchored Co-Evolution of Code and Test Populations

BACE:基于大语言模型的代码生成:通过贝叶斯锚定的代码与测试种群共演化

Kaushitha Silva, Srinath Perera

专题命中 软件智能体 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.SE

AI总结 BACE通过贝叶斯锚定的共演化方法,改进代码生成中的测试反馈机制,提升代码与测试种群的协同进化性能。

Comments 10 Pages, 3 Figures. To appear in Proceedings of the 2026 Genetic and Evolutionary Computation Conference (GECCO '26), July 13-17, 2026, San Jose, Costa Rica

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17192 2026-03-02 cs.CL 77%

Paper2Code: Automating Code Generation from Scientific Papers in Machine Learning

Paper2Code: 从科学论文自动生成机器学习代码

Minju Seo, Jinheon Baek, Seongyun Lee, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) LG AI Research(LG人工智能研究所)

专题命中 软件智能体 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.CL

AI总结 Paper2Code通过多代理LLM框架自动生成机器学习论文的高质量代码实现,有效提升代码生成效率和准确性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04847 2026-02-24 cs.LG 77%

Test-Time Adaptation for LLM Agents via Environment Interaction

通过环境交互实现LLM代理的测试时适应

Arthur Chen, Zuxin Liu, Jianguo Zhang, Akshara Prabhakar, Zhiwei Liu, Shelby Heinecke, Silvio Savarese, Victor Zhong, Caiming Xiong

机构 * University of Waterloo(滑铁卢大学) Salesforce AI Research(Salesforce AI研究)

专题命中 软件智能体 :agent(abstract);function calling(abstract);agentic(abstract);分类 cs.LG

AI总结 通过环境交互实现LLM代理的测试时适应,利用语法对齐和动态接地策略提升代理在复杂环境中的泛化能力。

Comments Our code is available here: https://github.com/r2llab/GTTA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03219 2026-02-10 cs.AI 77%

Beyond Quantity: Trajectory Diversity Scaling for Code Agents

超越数量:代码代理的轨迹多样性扩展

Guhong Chen, Chenghao Sun, Cheng Fu, Qiyao Wang, Zhihong Huang, Chaopeng Wei, Guangxu Chen, Feiteng Fang, Ahmadreza Argha, Bing Zhao, Xander Xu, Qi Han, Hamid Alinejad-Rokny, Qiang Qu, Binhua Li, Shiwen Ni, Min Yang, Hu Wei, Yongbin Li

机构 * SIAT, CAS(中国科学院软件研究所) Alibaba Group(阿里巴巴集团) UNSW Sydney(新南威尔士大学悉尼分校) SUAT(上海大学)

专题命中 软件智能体 :agent(abstract);tool-use(abstract);multi-agent(abstract);分类 cs.AI

AI总结 TDScaling通过提升轨迹多样性而非单纯增加数据量,优化代码代理训练的性能-成本平衡,提升工具使用泛化和编码能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19942 2026-02-10 cs.SE 77%

Prometheus: Towards Long-Horizon Codebase Navigation for Repository-Level Problem Solving

Prometheus:面向仓库级问题解决的长周期代码库导航

Yue Pan, Zimin Chen, Siyu Lu, Zhaoyang Chu, Xiang Li, Han Li, Yang Feng, Claire Le Goues, Federica Sarro, Martin Monperrus, He Ye

专题命中 软件智能体 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.SE

AI总结 Prometheus通过统一知识图谱和增强内存引擎,实现长周期代码库导航,提升仓库级问题解决的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20106 2026-01-29 cs.SE 77%

Are We All Using Agents the Same Way? An Empirical Study of Core and Peripheral Developers Use of Coding Agents

我们是否都在以相同的方式使用代理?核心和边缘开发者对编码代理使用的一次实证研究

Shamse Tasnim Cynthia, Joy Krishan Das, Banani Roy

专题命中 软件智能体 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.SE

AI总结 本文通过实证研究发现,核心和边缘开发者在使用编码代理时存在差异,核心开发者更关注文档和测试,而边缘开发者更频繁使用代理进行任务分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16839 2026-01-26 cs.SE 77%

AI builds, We Analyze: An Empirical Study of AI-Generated Build Code Quality

AI构建,我们分析:对AI生成构建代码质量的实证研究

Anwar Ghammam, Mohamed Almukhtar

专题命中 软件智能体 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.SE

AI总结 本研究通过分析AI生成的构建代码质量,探讨其在构建系统中的影响,并发现AI生成代码既可能引入质量问题,也部分消除了现有问题,同时大部分代理提交被开发者接受。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14914 2026-01-22 cs.CL 77%

CodeDelegator: Mitigating Context Pollution via Role Separation in Code-as-Action Agents

CodeDelegator: 通过角色分离缓解上下文污染在代码作为行动代理中

Tianxiang Fei, Cheng Chen, Yue Pan, Mao Zheng, Mingyang Song

机构 * Large Language Model Department, Tencent(腾讯大语言模型部门)

专题命中 软件智能体 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.CL

AI总结 CodeDelegator通过角色分离缓解上下文污染,利用多代理框架实现战略规划与实现的分离,提升代码作为行动代理的长期性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16709 2025-11-24 cs.CR cs.AI 77%

AutoBackdoor: Automating Backdoor Attacks via LLM Agents

AutoBackdoor: 通过LLM代理自动化后门攻击

Yige Li, Zhe Li, Wei Zhao, Nay Myat Min, Hanxun Huang, Xingjun Ma, Jun Sun

机构 * Singapore Management University(新加坡管理大学) The University of Melbourne(墨尔本大学) Fudan University(复旦大学)

专题命中 软件智能体 :agent(abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 AutoBackdoor通过LLM代理自动化后门攻击,实现高效触发器生成和毒化数据构建,验证了对抗防御的脆弱性。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03588 2025-10-07 cs.SE cs.MA 77%

REFINE: Enhancing Program Repair Agents through Context-Aware Patch Refinement

Anvith Pabba, Simin Chen, Alex Mathai, Anindya Chakraborty, Baishakhi Ray

专题命中 软件智能体 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.SE

Comments We also open source our code at https://anonymous.4open.science/r/SemAgent-7B2F/README.md

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25370 2025-10-01 cs.AI 77%

Where LLM Agents Fail and How They can Learn From Failures

Kunlun Zhu, Zijia Liu, Bingxuan Li, Muxin Tian, Yingxuan Yang, Jiaxun Zhang, Pengrui Han, Qipeng Xie, Fuyang Cui, Weijia Zhang, Xiaoteng Ma, Xiaodong Yu, Gowtham Ramesh, Jialian Wu, Zicheng Liu, Pan Lu, James Zou, Jiaxuan You

专题命中 软件智能体 :agent(abstract);tool-use(abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07832 2025-03-12 cs.AI cs.CL cs.LG cs.SE 77%

RefactorBench: Evaluating Stateful Reasoning in Language Agents Through Code

Dhruv Gautam, Spandan Garg, Jinu Jang, Neel Sundaresan, Roshanak Zilouchian Moghaddam

专题命中 软件智能体 :agent(abstract);function calling(abstract);分类 cs.AI、cs.CL、cs.LG

Comments ICLR 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04485 2024-12-09 cs.AR cs.AI 77%

EDA-Aware RTL Generation with Large Language Models

Mubashir ul Islam, Humza Sami, Pierre-Emmanuel Gaillardon, Valerio Tenace

专题命中 软件智能体 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17025 2024-06-06 cs.CL cs.AI cs.LG cs.SE 77%

Experiential Co-Learning of Software-Developing Agents

Chen Qian, Yufan Dang, Jiahao Li, Wei Liu, Zihao Xie, Yifei Wang, Weize Chen, Cheng Yang, Xin Cong, Xiaoyin Che, Zhiyuan Liu, Maosong Sun

专题命中 软件智能体 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.CL、cs.LG

Comments Accepted to ACL 2024, https://github.com/OpenBMB/ChatDev

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.06775 2023-11-02 cs.HC cs.AI 77%

Conceptual Framework for Autonomous Cognitive Entities

David Shapiro, Wangfan Li, Manuel Delaflor, Carlos Toxtli

专题命中 软件智能体 :agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI

Comments 34 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13927 2026-04-16 cs.PL 76%

AI Coding Agents Need Better Compiler Remarks

AI 编程代理需要更好的编译器注释

Akash Deo, Simone Campanoni, Tommy McMichen

专题命中 软件智能体 :agent(abstract);AI agent(abstract);workflow(abstract);agentic(comments)

AI总结 本文研究了编译器注释对AI代理优化程序的影响,发现精确注释能显著提升性能,而模糊注释会导致语义错误,结论是未来编译器需提供结构化反馈以支持自主性能工程。

Comments 3 pages, 1 figure, 2 tables, Presented at Workshop on Co-Design for Agentic and Multimodal AI (CoDAIM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06471 2026-08-10 cs.CR cs.AI cs.SE 新提交 76%

CyberForge: Verified Vulnerability Injection at Repository Level for Cybersecurity Agent Training

CyberForge:用于网络安全智能体训练的、基于代码仓库级别的经验证漏洞注入框架

Amine Lbath, Manan Suri, Aurelien Delaitre, Vadim Okun, Massih-Reza Amini, Ram D. Sriram, Dinesh Manocha

专题命中 软件智能体 :agent(title);分类 cs.AI、cs.SE

AI总结 本研究提出CyberForge框架,通过向真实C/C++项目注入漏洞生成经验证的代码仓库级安全训练数据,微调后可提升智能体在SEC-bench和PatchEval上的漏洞修复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24604 2026-07-28 cs.CL cs.AI 新提交 76%

Looping Is Not Reliability: State-Bound Evidence and Typed Revision Contracts for Agentic Code Repair

循环并非可靠性保障:智能代码修复的状态约束证据与类型化修订契约

Xueping Gao, Jianwei Yang, Qiang Yang

机构 * Alibaba Cloud(阿里云)

专题命中 软件智能体 :agentic(title);分类 cs.AI、cs.CL

AI总结 研究编码智能体中生成-测试-修订循环的可靠性问题,通过实验揭示相关差距及问题,提出证据约束的类型化循环契约并实例化其可机械执行子集,实现规范与工件,非证明修复能力提升等。

Comments 11 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01057 2026-06-02 cs.CV cs.AI cs.GR cs.LG 76%

3DCodeBench: Benchmarking Agentic Procedural 3D Modeling Via Code

3DCodeBench:通过代码进行智能体程序化3D建模的基准测试

Yipeng Gao, Lei Shu, Genzhi Ye, Xi Xiong, Ameesh Makadia, Meiqi Guo, Laurent Itti, Jindong Chen

机构 * Google DeepMind(谷歌DeepMind) University of Southern California(南加州大学) Google Research(谷歌研究)

专题命中 软件智能体 :agentic(title);分类 cs.AI、cs.LG

AI总结 提出3DCodeBench基准,评估12种视觉语言模型将文本和图像参考转换为程序化3D建模代码的能力,并构建基于人类偏好的3DCodeArena排名平台。

Comments Project Page: https://www.3dcodebench.com/; 11 pages (main), with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14150 2026-05-29 cs.AI cs.LG cs.NE 76%

CodeEvolve: an open source evolutionary coding agent for algorithmic discovery and optimization

CodeEvolve:用于算法发现和优化的开源进化编码智能体

Henrique Assumpção, Diego Ferreira, Leandro Campos, Fabricio Murai

机构 * Inter Science - Inter&Co Federal University of Minas Gerais(联邦大学伯南迪斯) Worcester Polytechnic Institute(沃思彻斯特理工大学)

专题命中 软件智能体 :agent(title);分类 cs.AI、cs.LG

AI总结 提出CodeEvolve开源框架,结合大语言模型与岛屿进化搜索,通过灵感交叉、元提示和深度细化,在AlphaEvolve基准上匹配或超越5/9问题,并在匹配条件下优于OpenEvolve和ShinkaEvolve,以更低成本超越前沿闭源集成。

Comments 21 pages, 16 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏