arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 3188 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 3188 篇

2604.09572 2026-04-14 cs.HC cs.AI cs.CL 81%

ACE-TA: An Agentic Teaching Assistant for Grounded Q&A, Quiz Generation, and Code Tutoring

ACE-TA:一种基于代理的教学助手用于 grounded Q&A、测验生成和代码辅导

Himanshu Tripathi, Charlottee Crowell, Kaley Newlin, Subash Neupane, Shahram Rahimi, Jason Keith

机构 * University of Alabama(阿拉巴马大学) Brown University(布朗大学) Meharry Medical College(梅哈里医学院) Iowa State University of Science and Technology(爱荷华州立科技大学)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 ACE-TA利用预训练大语言模型,通过三个协调模块实现概念性问题的路由,提供精确解释、生成自适应测验并指导学生逐步学习代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07900 2026-04-10 cs.SE cs.AI 81%

Rethinking the Value of Agent-Generated Tests for LLM-Based Software Engineering Agents

重新思考基于LLM的软件工程代理生成测试的价值

Zhi Chen, Zhensu Sun, Yuling Shi, Chao Peng, Xiaodong Gu, David Lo, Lingxiao Jiang

机构 * Singapore Management University(新加坡管理大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 研究探讨了LLM软件工程代理生成测试的有效性,发现测试主要作为反馈渠道,而非提升问题解决效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07502 2026-04-10 cs.SE cs.AI 81%

Beyond Human-Readable: Rethinking Software Engineering Conventions for the Agentic Development Era

超越人类可读性:为代理开发时代重新思考软件工程惯例

Dmytro Ustynov

机构 * Military Institute of Telecommunications and Information Technologies (MITIT)(军事电信与信息技术研究所)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.SE

AI总结 本文探讨代理开发时代软件工程惯例的变革,提出语义密度优化原则,通过实验验证压缩对开发成本的影响,并提出程序骨架概念和语义意图与可读性分离的主张。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16206 2026-04-09 cs.CL cs.AI 81%

Computer Environments Elicit General Agentic Intelligence in LLMs

计算机环境在大语言模型中激发通用代理智能

Daixuan Cheng, Shaohan Huang, Yuxian Gu, Huatong Song, Guoxin Chen, Li Dong, Wayne Xin Zhao, Ji-Rong Wen, Furu Wei

机构 * GSAI, Renmin University of China(中国人民大学高瓴人工智能学院) Microsoft Research(微软研究院) Tsinghua University(清华大学)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 本文研究了计算机环境如何通过虚拟沙盒激发大语言模型的通用能力,展示了环境对任务解决的提升效果及训练方法。

Comments Project Page: https://llm-in-sandbox.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03081 2026-04-06 cs.CR cs.AI cs.CL 81%

Supply-Chain Poisoning Attacks Against LLM Coding Agent Skill Ecosystems

针对LLM编码代理技能生态系统的供应链污染攻击

Yubin Qu, Yi Liu, Tongcheng Geng, Gelei Deng, Yuekang Li, Leo Yu Zhang, Ying Zhang, Lei Ma

机构 * Griffith University(格里菲斯大学) The State Information Center(国家信息中心) Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学) Wake Forest University(维克森林大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文研究了LLM编码代理技能生态系统中供应链攻击对行动空间的影响,提出DDIPE方法通过嵌入恶意逻辑到技能文档中实现隐式payload执行,实验显示其在强防御下可绕过11.6%-33.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27850 2026-03-31 cs.SE cs.CL 81%

EffiSkill: Agent Skill Based Automated Code Efficiency Optimization

EffiSkill:基于代理技能的自动代码效率优化

Zimu Wang, Yuling Shi, Mengfan Li, Zijun Liu, Jie M. Zhang, Chengcheng Wan, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) University of California, Berkeley(加州大学伯克利分校) Columbia University(哥伦比亚大学) King's College London(伦敦国王学院) East China Normal University(华东师范大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 软件智能体 :agent(title,abstract);分类 cs.CL、cs.SE

AI总结 EffiSkill通过构建可移植的优化工具箱,利用代码效率优化机制,实现无运行反馈的代码优化,提升了优化成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17150 2026-03-19 cs.SE cs.AI cs.PL 81%

Intent Formalization: A Grand Challenge for Reliable Coding in the Age of AI Agents

意图形式化:在AI代理时代可靠编码的重大挑战

Shuvendu K. Lahiri

机构 * Microsoft Research(微软研究院)

专题命中 软件智能体 :AI agent(title);agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文探讨意图形式化作为解决AI生成代码与用户意图间差距的关键挑战,提出通过形式化规范提升软件可靠性的方法,并指出验证规范的瓶颈及未来研究方向。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11356 2026-03-13 cs.SE cs.AI cs.MA 81%

Resolving Java Code Repository Issues with iSWE Agent

用iSWE代理解决Java代码仓库问题

Jatin Ganhotra, Sami Serhan, Antonio Abu Nassar, Avraham Shinnar, Ziv Nevo, Martin Hirzel

机构 * IBM

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出iSWE代理,专注于Java问题解决,结合基于规则和模型的技术,提升企业软件开发效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08993 2026-03-11 cs.SE cs.AI cs.CR cs.PL 81%

Arbiter: Detecting Interference in LLM Agent System Prompts

Arbiter:检测LLM代理系统提示中的干扰

Tony Mason

机构 * the University of British Columbia(不列颠哥伦比亚大学) the Georgia Institute of Technology(佐治亚理工学院)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 Arbiter通过结合形式评估规则和多模型LLM扫描,检测LLM代理系统提示中的干扰模式,发现152个问题并揭示漏洞类别差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05941 2026-03-09 cs.SE cs.AI 81%

XAI for Coding Agent Failures: Transforming Raw Execution Traces into Actionable Insights

代码代理故障的可解释性AI:将原始执行轨迹转化为可操作的见解

Arun Joshi

机构 * Independent Researcher(独立研究者) Islington College(伊斯林顿学院)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出了一种基于XAI的方法,通过结构化解释和可视化技术,帮助开发者更高效地理解和修复代码代理的故障问题。

Comments 17 Pages, 3 Figures, 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04915 2026-03-06 cs.LG cs.AI cs.CR 81%

EVMbench: Evaluating AI Agents on Smart Contract Security

EVMbench:在智能合约安全上评估AI代理

Justin Wang, Andreas Bigger, Xiaohai Xu, Justin W. Lin, Andy Applebaum, Tejal Patwardhan, Alpin Yukseloglu, Olivia Watkins

机构 * OpenAI Paradigm OtterSec

专题命中 软件智能体 :AI agent(title,abstract);分类 cs.AI、cs.LG

AI总结 EVMbench通过评估AI代理在智能合约安全领域的检测、修补和利用能力,揭示了AI在区块链安全评估中的潜力与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21251 2026-02-26 cs.SE cs.AI cs.MA cs.PL 81%

AgenticTyper: Automated Typing of Legacy Software Projects Using Agentic AI

AgenticTyper: 使用代理AI自动类型化遗留软件项目

Clemens Pohle

机构 * Darmstadt University of Applied Sciences(达姆斯塔德应用技术大学) MaibornWolff GmbH(马本沃尔夫公司)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.SE

AI总结 AgenticTyper利用代理AI自动类型化遗留软件项目,通过迭代错误纠正和行为保留技术,高效解决类型错误问题。

Comments Accepted at ICSE 2026 Student Research Competition (SRC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19441 2026-02-24 cs.SE cs.AI 81%

When AI Teammates Meet Code Review: Collaboration Signals Shaping the Integration of Agent-Authored Pull Requests

当AI队友遇见代码审查:协作信号塑造代理编写的拉取请求整合

Costain Nachuma, Minhaz Zibran

机构 * Idaho State University USA(爱达荷州立大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 研究探讨了AI代理提交的拉取请求在代码审查中的整合效果,发现审查员参与和协作信号对整合成功至关重要。

Comments 5 pages, 2 figures, 1 table. Accepted at the 23rd International Conference on Mining Software Repositories (MSR 2026), Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03262 2026-02-18 cs.SE cs.CL 81%

Is Vibe Coding Safe? Benchmarking Vulnerability of Agent-Generated Code in Real-World Tasks

Vibe 编程是否安全?在现实任务中对代理生成代码的漏洞基准测试

Songwen Zhao, Danqing Wang, Kexun Zhang, Jiaxuan Luo, Zhuo Li, Lei Li

机构 * Carnegie Mellon University Language Technologies Institute(卡内基梅隆大学语言技术研究所) Columbia University(哥伦比亚大学) Johns Hopkins University(约翰霍普金斯大学) HydroX AI

专题命中 软件智能体 :agent(title,abstract);分类 cs.CL、cs.SE

AI总结 本文通过基准测试发现,Vibe 编程在现实任务中生成的代码安全性不足,尽管功能正确但存在安全漏洞,警示其在安全敏感领域应用的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12500 2026-02-16 cs.SE cs.AI cs.CR 81%

Favia: Forensic Agent for Vulnerability-fix Identification and Analysis

Favia:漏洞修复识别与分析的取证代理

André Storhaug, Jiamou Sun, Jingyue Li

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 Favia通过结合可扩展的候选排名与深入语义推理,有效识别漏洞修复,优于传统和LLM基方法。

Comments 44 pages, 12 figures, 5 tables, 3 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20882 2026-01-30 cs.SE cs.AI cs.CR 81%

DevOps-Gym: Benchmarking AI Agents in Software DevOps Cycle

DevOps-Gym: 在软件DevOps周期中评估AI代理的基准测试

Yuheng Tang, Kaijie Zhu, Bonan Ruan, Chuqi Zhang, Michael Yang, Hongwei Li, Suyue Guo, Tianneng Shi, Zekun Li, Christopher Kruegel, Giovanni Vigna, Dawn Song, William Yang Wang, Lun Wang, Yangruibo Ding, Zhenkai Liang, Wenbo Guo

机构 * UC Santa Barbara(加州大学圣巴巴拉分校) National University of Singapore(新加坡国立大学) UC Berkeley(加州大学伯克利分校) Google(谷歌) UC Los Angeles(加州大学洛杉矶分校)

专题命中 软件智能体 :AI agent(title,abstract);分类 cs.AI、cs.SE

AI总结 DevOps-Gym通过700+真实任务评估AI代理在完整DevOps周期中的能力,揭示其在问题解决和测试生成方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03217 2026-01-30 cs.SE cs.AI 81%

Abstain and Validate: A Dual-LLM Policy for Reducing Noise in Agentic Program Repair

回避与验证:一种双LLM策略用于减少代理程序修复中的噪声

José Cambronero, Michele Tufano, Sherry Shi, Renyao Wei, Grant Uy, Runxiang Cheng, Chin-Jung Liu, Shiying Pan, Satish Chandra, Pat Rondon

机构 * Google, USA(谷歌公司) Meta, USA(Meta公司)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出双LLM策略,通过bug回避和补丁验证减少代理程序修复中的噪声,提升修复成功率和可靠性。

Comments Accepted to the 2026 IEEE/ACM 48th International Conference on Software Engineering: Software Engineering in Practice (ICSE-SEIP '26)

Journal ref 2026 IEEE/ACM 48th International Conference on Software Engineering (ICSE-SEIP '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10343 2026-01-19 cs.CL cs.AI 81%

OctoBench: Benchmarking Scaffold-Aware Instruction Following in Repository-Grounded Agentic Coding

OctoBench:面向仓库基础代理编程的支架意识指令遵循基准测试

Deming Ding, Shichun Liu, Enhui Yang, Jiahang Lin, Ziying Chen, Shihan Dou, Honglin Guo, Weiyu Cheng, Pengyu Zhao, Chengjun Xiao, Qunhong Zeng, Qi Zhang, Xuanjing Huang, Qidi Xu, Tao Gui

机构 * Fudan University(复旦大学) MiniMax Peking University(北京大学)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 OctoBench通过评估仓库基础代理编程中的支架意识指令遵循能力,揭示了任务解决与合规性之间的差距,推动更高效的编码代理发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08829 2026-01-14 cs.CL cs.AI 81%

Modeling LLM Agent Reviewer Dynamics in Elo-Ranked Review System

在Elo排名评审系统中建模LLM代理评审动态

Hsiang-Wei Huang, Junbin Lu, Kuang-Ming Chen, Jenq-Neng Hwang

机构 * University of Washington(华盛顿大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文研究了在Elo排名评审系统中,通过整合Elo评分和评审者记忆提升领域主席决策准确性的LLM代理评审动态。

Comments In submission. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10420 2026-01-13 cs.AI cs.DC cs.ET cs.LG 81%

Multi-dimensional Autoscaling of Processing Services: A Comparison of Agent-based Methods

多维处理服务自动扩展:基于代理的方法比较

Boris Sedlak, Alireza Furutanpey, Zihang Wang, Víctor Casamayor Pujol, Schahram Dustdar

机构 * Distributed Systems Group, TU Wien(维也纳技术大学分布式系统组) DISL, ICREA | Universitat Pompeu Fabra(庞培法布拉大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种多维基于代理的自动扩展框架,比较了四种代理方法在边缘计算中的性能,验证了多维自动扩展的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00254 2026-01-05 cs.SE cs.AI 81%

An Empirical Evaluation of LLM-Based Approaches for Code Vulnerability Detection: RAG, SFT, and Dual-Agent Systems

基于大型语言模型的代码漏洞检测方法实证评估:RAG、SFT和双智能体系统

Md Hasan Saju, Maher Muhtadi, Akramul Azim

机构 * Department of Electrical, Computer, and Software Engineering(电气、计算机与软件工程系) Ontario Tech University(安大略技术大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文通过实证评估,比较了RAG、SFT和双智能体系统在代码漏洞检测中的有效性,发现RAG在准确率和F1分数上表现最佳,SFT和双智能体系统也展示了良好的性能,证明了领域专业知识对LLM在实际漏洞检测中的重要性。

Journal ref https://conf.researchr.org/home/cascon-2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02976 2025-12-30 cs.CR cs.LG cs.SE 81%

How Safe Are AI-Generated Patches? A Large-scale Study on Security Risks in LLM and Agentic Automated Program Repair on SWE-bench

AI生成的补丁有多安全?一项针对LLM和代理自动程序修复在SWE-bench上的大规模安全风险研究

Amirali Sajadi, Kostadin Damevski, Preetha Chatterjee

机构 * Drexel University(德雷塞尔大学) Virginia Commonwealth University(弗吉尼亚共同wealth大学)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.LG、cs.SE

AI总结 本研究评估了LLM和代理框架生成补丁的安全性,发现LLM引入新漏洞,代理工作流在自主权高时也产生漏洞,需考虑上下文因素进行风险评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06902 2025-12-09 cs.SE cs.AI 81%

BabelCoder: Agentic Code Translation with Specification Alignment

BabelCoder: 基于规范对齐的代理代码翻译

Fazle Rabbi, Soumit Kanti Saha, Tri Minh Triet Pham, Song Wang, Jinqiu Yang

机构 * Concordia University(康科迪亚大学) York University(约克大学)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.SE

AI总结 BabelCoder通过代理协作框架提升代码翻译准确性,实现94.16%的平均准确率。

Comments 21 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14683 2025-12-09 cs.SE cs.AI 81%

Unified Software Engineering Agent as AI Software Engineer

统一软件工程代理作为AI软件工程师

Leonhard Applis, Yuntong Zhang, Shanchao Liang, Nan Jiang, Lin Tan, Abhik Roychoudhury

机构 * National University of Singapore(新加坡国立大学) Purdue University(普渡大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出统一软件工程代理USEagent,旨在通过协调多种能力提升软件开发效率,通过USEbench验证其效果,发现其在复杂任务中表现优于现有代理。

Comments Leonhard Applis and Yuntong Zhang contributed equally to this work. To appear in ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16395 2025-11-21 cs.AI cs.PL cs.SE cs.SY eess.SY 81%

CorrectHDL: Agentic HDL Design with LLMs Leveraging High-Level Synthesis as Reference

CorrectHDL: 基于LLM的代理HDL设计利用高层次综合作为参考

Kangwei Xu, Grace Li Zhang, Ulf Schlichtmann, Bing Li

机构 * Technical University of Munich (TUM)(慕尼黑技术大学) Technical University of Darmstadt(达姆施塔特技术大学) Technical University of Ilmenau(伊尔梅恩艾大学)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.SE

AI总结 CorrectHDL利用LLM和HLS结合,通过参考设计纠正生成错误,提升HDL设计的面积和功率效率,接近人工设计水平。

Comments 7 pages, 15 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03934 2025-11-07 cs.SE cs.AI 81%

PEFA-AI: Advancing Open-source LLMs for RTL generation using Progressive Error Feedback Agentic-AI

Athma Narayanan, Mahesh Subedar, Omesh Tickoo

机构 * Intel Corporation USA(英特尔公司)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.SE

Comments Appeared in the Design Automation Conference (DAC) 2025, Workshop Poster on June 22, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17612 2025-11-06 cs.CL cs.AI 81%

Distilling LLM Agent into Small Models with Retrieval and Code Tools

Minki Kang, Jongwon Jeong, Seanie Lee, Jaewoong Cho, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) KRAFTON(KRAFTON公司)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.CL

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00197 2025-11-04 cs.SE cs.AI 81%

Understanding Code Agent Behaviour: An Empirical Study of Success and Failure Trajectories

Oorja Majgaonkar, Zhiwei Fei, Xiang Li, Federica Sarro, He Ye

机构 * University College London(伦敦大学学院) Nanjing University(南京大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20434 2025-10-28 cs.SE cs.AI 81%

ARCS: Agentic Retrieval-Augmented Code Synthesis with Iterative Refinement

Manish Bhattarai, Miguel Cordova, Minh Vu, Javier Santos, Ismael Boureima, Dan O'Malley

机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20749 2025-10-27 cs.AI cs.SE 81%

Can Agents Fix Agent Issues?

Alfin Wijaya Rahardja, Junwei Liu, Weitong Chen, Zhenpeng Chen, Yiling Lou

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

Comments Accepted by the 39th Annual Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏