arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 3188 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 3188 篇

2607.03451 2026-07-07 cs.SE cs.AI cs.LG 新提交 85%

SkillOpt-Lite: Better and Faster Agent Self-evolution via One Line of Vibe

SkillOpt-Lite:通过一行代码实现更好更快的智能体自我进化

Yifei Shen, Bo Li, Xinjie Zhang

机构 * LMMs-Lab(LMMs实验室) NTU MMLab(国立台湾大学MMLab) Microsoft(微软公司)

专题命中 软件智能体 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 研究智能体技能优化,通过零阶优化形式化,基于相关理念和学习建立收敛与泛化原则,提出SkillOpt-Lite加速收敛且性能优,还集成到生产编码智能体,最小管道可推广到完整 harness 优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16534 2026-06-17 cs.DC 新提交 85%

Generated, Parallel, Scalable? A Study of Agentic AI-Generated Julia Code on Supercomputers

生成、并行、可扩展?超级计算机上智能体AI生成的Julia代码研究

Linus Bantel, Anna-Lena Roth, Jonas Posner, Dirk Pflüger

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);tool use(abstract)

AI总结 研究智能体AI生成并行Julia代码的能力,发现小规模输入可靠但大规模扩展时出现死锁等问题,商业模型优于开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16458 2026-06-16 cs.RO 新提交 85%

RHO: Your Coding Agent is Secretly a Roboticist

RHO:你的编码代理其实是个机器人专家

Karim Elmaaroufi, Justin Svegliato, Sarunas Kalade, Graham Schelle, Sanjit A. Seshia, Matei Zaharia

机构 * University of California, Berkeley(加州大学伯克利分校) AMD

专题命中 软件智能体 :agent(title,abstract);planning(abstract);agentic(abstract)

AI总结 提出RHO范式,通过训练时搜索神经符号化多文件策略库,实现机器人任务的高效零样本泛化,在LIBERO-PRO和Robosuite上分别达到45%和70%的成功率,显著优于现有方法。

Comments 46 pages, 9 figures, 15 tables. Project page: https://rho-robotics.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14154 2026-06-15 cs.CR 新提交 85%

SkillMutator: Benchmarking and Defending Language-and-Code Cross-modal Attacks on LLM Agent Skills

SkillMutator: 基准测试与防御针对LLM代理技能的语言与代码跨模态攻击

Youngduk Kim, Minkyoo Song, Seungwon Shin

专题命中 软件智能体 :agent(title,abstract);workflow(abstract)

AI总结 提出SkillMutator基准,模拟13类跨模态攻击,并设计四阶段推理轨迹蒸馏框架,将检测率从17.1%提升至88.2%,超越GPT-4o-mini。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30248 2026-06-01 cs.CV 85%

GenClaw: Code-Driven Agentic Image Generation

GenClaw: 代码驱动的智能体图像生成

Junyan Ye, Jun He, Zilong Huang, Dongzhi Jiang, Xuan Yang, Rui Chen, Weijia Li

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);workflow(abstract)

AI总结 提出GenClaw,一种代码驱动的智能体图像生成范式,通过概念构思、代码草图绘制和纹理补充三个阶段,将黑盒图像生成转变为可控、可解释的分阶段过程。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01327 2026-05-27 cs.SE cs.CL cs.LG 85%

SWE-Adept: An LLM-Based Agentic Framework for Deep Codebase Analysis and Structured Issue Resolution

SWE-Adept:基于LLM的深度代码库分析与结构化问题解决代理框架

Kang He, Kaushik Roy

机构 * Electrical and Computer Engineering, Purdue University(电子工程与计算机工程系,普渡大学)

专题命中 软件智能体 :agentic(title);agent(abstract);planning(abstract);分类 cs.CL、cs.LG、cs.SE

AI总结 提出SWE-Adept双代理框架,通过代理引导的深度优先搜索进行代码定位,结合自适应规划和结构化问题解决,在SWE-Bench上提升端到端解决率最多4.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13282 2026-04-16 physics.med-ph 85%

Agentic MR sequence development: leveraging LLMs with MR skills for automatic physics-informed sequence development

代理MR序列开发:利用LLM与MR技能进行自动物理引导的序列开发

Moritz Zaiss, Amr Aly, Jonathan Endres, Tobias Dornstetter, Simon Weinmüller, Andreas Maier

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);autonomous agent(abstract)

AI总结 本文提出Agent4MR框架,利用LLM和物理验证报告自动生成并优化PyPulseq序列,减少交互次数,实现高效序列开发。

Comments Word count abstract/body: 223 / 4303

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12522 2026-02-17 cs.SE cs.AI cs.IR cs.LG cs.MA 85%

Improved Bug Localization with AI Agents Leveraging Hypothesis and Dynamic Cognition

改进的AI代理在利用假设和动态认知进行Bug定位中的应用

Asif Mohammed Samir, Mohammad Masudur Rahman

机构 * Dalhousie University(达尔豪西大学)

专题命中 软件智能体 :AI agent(title,abstract);agentic(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 本文提出CogniGent技术,利用AI代理进行因果推理和动态认知调试,提升bug定位的准确性和效率。

Comments 13 pages, 7 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17208 2026-02-06 cs.SE cs.AI cs.CL 85%

Dissecting the SWE-Bench Leaderboards: Profiling Submitters and Architectures of LLM- and Agent-Based Repair Systems

解析SWE-Bench排行榜:LLM和基于代理的修复系统的提交者与架构分析

Matias Martinez, Xavier Franch

专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 本文分析了SWE-Bench排行榜上的提交者和架构,揭示了专有LLM的主导地位及不同设计类型。

Comments Part of this work (RQ1) has been published at the 2026 IEEE/ACM 48th International Conference on Software Engineering (ICSE-SEIP 2026), DOI: 10.1145/3786583.3786904. The published version is also available on arXiv at arXiv:2602.04449

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16238 2026-01-26 cs.SE cs.AI cs.LG 85%

VibeTensor: System Software for Deep Learning, Fully Generated by AI Agents

VibeTensor:由AI代理完全生成的深度学习系统软件

Bing Xu, Terry Chen, Fengzhe Zhou, Tianqi Chen, Yangqing Jia, Vinod Grover, Haicheng Wu, Wei Liu, Craig Wittenbrink, Wen-mei Hwu, Roger Bringmann, Ming-Yu Liu, Luis Ceze, Michael Lightstone, Humphrey Shi

机构 * NVIDIA

专题命中 软件智能体 :AI agent(title);agent(abstract);workflow(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 VibeTensor是首个由AI代理完全生成的深度学习系统软件,实现了PyTorch风格的张量库及CUDA内存管理,展示了AI辅助软件工程的里程碑进展。

Comments Open-source: https://github.com/NVLabs/vibetensor

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10338 2026-01-16 cs.CR cs.AI cs.CL cs.SE 85%

Agent Skills in the Wild: An Empirical Study of Security Vulnerabilities at Scale

真实世界中的智能体技能:大规模安全漏洞实证研究

Yi Liu, Weizhe Wang, Ruitao Feng, Yao Zhang, Guangquan Xu, Gelei Deng, Yuekang Li, Leo Zhang

机构 * Tianjin University(天津大学) Southern Cross University(南方十字大学) School of Cybersecurity, Tianjin University(安全学院,天津大学) Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学) Griffith University(格里菲斯大学)

专题命中 软件智能体 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 研究揭示了智能体技能中普遍存在的安全漏洞,提出了一种多阶段检测框架,并展示了技能捆绑执行脚本与漏洞之间的显著关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26887 2025-11-03 cs.AI cs.CL cs.LG cs.MA 85%

The Denario project: Deep knowledge AI agents for scientific discovery

Francisco Villaescusa-Navarro, Boris Bolliet, Pablo Villanueva-Domingo, Adrian E. Bayer, Aidan Acquah, Chetana Amancharla, Almog Barzilay-Siegal, Pablo Bermejo, Camille Bilodeau, Pablo Cárdenas Ramírez, Miles Cranmer, Urbano L. França, ChangHoon Hahn, Yan-Fei Jiang, Raul Jimenez, Jun-Young Lee, Antonio Lerario, Osman Mamun, Thomas Meier, Anupam A. Ojha, Pavlos Protopapas, Shimanto Roy, David N. Spergel, Pedro Tarancón-Álvarez, Ujjwal Tiwari, Matteo Viel, Digvijay Wadekar, Chi Wang, Bonny Y. Wang, Licong Xu, Yossi Yovel, Shuwen Yue, Wen-Han Zhou, Qiyao Zhu, Jiajun Zou, Íñigo Zubeldia

专题命中 软件智能体 :AI agent(title);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL、cs.LG

Comments 272 pages. Examples of 11 AI-generated paper drafts from different scientific disciplines. Code publicly available at https://github.com/AstroPilot-AI/Denario

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06917 2025-10-17 cs.AI cs.CL cs.LG 85%

Paper2Agent: Reimagining Research Papers As Interactive and Reliable AI Agents

Jiacheng Miao, Joe R. Davis, Yaohui Zhang, Jonathan K. Pritchard, James Zou

机构 * Department of Genetics, Stanford University(遗传学系,斯坦福大学) Department of Biomedical Data Science, Stanford University(生物医学数据科学系,斯坦福大学) Department of Electrical Engineering, Stanford University(电气工程系,斯坦福大学) Department of Biology, Stanford University(生物学系,斯坦福大学) Department of Computer Science, Stanford University(计算机科学系,斯坦福大学)

专题命中 软件智能体 :AI agent(title,abstract);agent(abstract);分类 cs.AI、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00979 2025-07-02 cs.AI cs.CL cs.LG 85%

Enhancing LLM Agent Safety via Causal Influence Prompting

Dongyoon Hahm, Woogyeol Jin, June Suk Choi, Sungsoo Ahn, Kimin Lee

专题命中 软件智能体 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI、cs.CL、cs.LG

Comments Accepted at ACL 2025 Findings, Source code: https://github.com/HahmDY/causal_influence_prompting.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21909 2025-06-27 cs.CL cs.LG cs.SE 85%

SceneGenAgent: Precise Industrial Scene Generation with Coding Agent

Xiao Xia, Dan Zhang, Zibo Liao, Zhenyu Hou, Tianrui Sun, Jing Li, Ling Fu, Yuxiao Dong

专题命中 软件智能体 :agent(title,abstract);planning(abstract);分类 cs.CL、cs.LG、cs.SE

Comments Accepted to ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07313 2025-06-10 cs.CR 85%

SCGAgent: Recreating the Benefits of Reasoning Models for Secure Code Generation with Agentic Workflows

Rebecca Saul, Hao Wang, Koushik Sen, David Wagner

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);workflow(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.01248 2024-03-05 cs.CV cs.AI cs.CL cs.LG 85%

SceneCraft: An LLM Agent for Synthesizing 3D Scene as Blender Code

Ziniu Hu, Ahmet Iscen, Aashi Jain, Thomas Kipf, Yisong Yue, David A. Ross, Cordelia Schmid, Alireza Fathi

专题命中 软件智能体 :agent(title,abstract);planning(abstract);分类 cs.AI、cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08043 2026-07-10 cs.SE cs.AI 新提交 84%

Aleena: Alignment Agent for Research Software Engineering Collaborations

Aleena:用于研究软件工程协作的对齐代理

Kshitij Dani, Cordero Core, Landung Setiawan, Carlos Garcia Jurado Suarez, Anshul Tambay, Vani Mandava, Anant Mittal

机构 * eScience Institute(eScience研究院) University of Washington(华盛顿大学)

专题命中 软件智能体 :agent(title,abstract);agentic(abstract,comments);分类 cs.AI、cs.SE

AI总结 研究软件协作中决策易失依据致相关人员心智模型不同,提出智能AI可支持对齐与跟踪。介绍开源的Aleena,以GitHub为协作平台,转化交互为结构化记录,揭示风险等,还阐述其动机、设计、原型及场景。

Comments 8 pages, 5 figures. AgenticSE @ KDD '26: Agentic Software Engineering (SE 3.0): The Rise of AI Teammates, KDD 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15425 2026-05-18 cs.SE cs.AI 84%

Runtime-Structured Task Decomposition for Agentic Coding Systems

运行时结构化任务分解用于代理编码系统

Shubhi Asthana, Bing Zhang, Chad DeLuca, Hima Patel, Ruchi Mahindru

机构 * IBM Research(IBM研究院)

专题命中 软件智能体 :agentic(title,abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 本文提出运行时结构化任务分解方法,通过可执行控制逻辑管理任务分解与执行流程,降低重试成本,提升代理编码系统的效率和可靠性。

Comments Paper presented at ACM Conference on AI and Agentic Systems 2026 at the Agentic Software Engineering workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10522 2026-07-14 cs.CV cs.AI 新提交 84%

Towards Autonomous and Auditable Medical Imaging Model Development

迈向自主且可审计的医学成像模型开发

Shengyuan Liu, Jia-Xuan Jiang, Boyun Zheng, Cheng Wang, Zipei Wang, Wentao Pan, Hongtao Wu, Houwen Peng, Yu Gu, Lichao Sun, Yixuan Yuan

机构 * The Chinese University of Hong Kong(香港中文大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Microsoft Research(微软研究院) Lehigh University(里海大学)

专题命中 软件智能体 :agent(abstract);planning(abstract);workflow(abstract);agentic(abstract)

AI总结 研究针对医学成像模型开发困难的问题,提出AMID自主多代理框架。该框架含数据条件方法规划和验证引导两阶段优化,经20个医学成像任务验证,其性能优于通用MLE系统,能将特定任务模型开发转变为高效可审计的代理工作流程。

Comments 18 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23822 2026-06-30 cs.SE 84%

KISS Sorcar: A Stupidly-Simple General-Purpose and Software Engineering AI Assistant

KISS Sorcar:一个简单通用且软件工程友好的AI助手

Koushik Sen

专题命中 软件智能体 :agent(summary_cn,abstract);AI agent(abstract);分类 cs.SE

AI总结 KISS Sorcar基于KISS Agent Framework构建,通过五层代理架构解决传统AI助手的缺陷,实现高质量代码生成与多任务处理,测试显示其在Terminal Bench 2.0上的通过率较高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04903 2026-06-04 cs.LO cs.AI cs.MA cs.PL 84%

Provably Auditable and Safe LLM Agents from Human-Authored Ontologies

基于人类编写本体的可审计且安全的LLM智能体

Aaron Sterling

机构 * Thistleseeds

专题命中 软件智能体 :agentic(summary_cn,abstract);agent(abstract);分类 cs.AI

AI总结 提出Agentic Redux架构,通过类型化λ演算证明其在适当领域上的执行语义正确且决策可审计,并引入本体优先的智能体设计方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07122 2026-05-21 cs.SE 84%

RepoZero: Can LLMs Generate a Code Repository from Scratch?

RepoZero: LLMs能否从零开始生成代码仓库?

Zhaoxi Zhang, Yiming Xu, Jiahui Liang, Weikang Li, Xiaoshuai Chen, Liwei Qian, Xin Pei, Jizhou Huang, Run Sun, Yunfang Wu

专题命中 软件智能体 :agentic(summary_cn,abstract);agent(abstract);分类 cs.SE

AI总结 本文提出RepoZero基准测试,通过自动化执行验证实现从零开始生成代码仓库的严格评估,展示了Agentic Code-Test Evolution框架在多模型上的实验结果,揭示了当前LLM在代码生成能力与实际需求之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06898 2026-05-11 cs.AI 84%

Self-Programmed Execution for Language-Model Agents

语言模型代理的自编程执行

Luke J. O'Connor

机构 * Harvard Medical School(哈佛医学院)

专题命中 软件智能体 :agentic(summary_cn,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出自编程执行(SPE)架构,使语言模型自身成为调度器,无需固定策略。通过agentic machines概念,实现无固定轮次策略的状态转移,并引入Spell语言处理程序自我编辑与重评估,实验表明前沿模型可完成复杂代理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24212 2026-04-28 cs.SE 84%

Empowering Autonomous Debugging Agents with Efficient Dynamic Analysis

通过高效动态分析赋能自主调试代理

Jiahong Xiang, Xiaoyang Xu, Xiaopan Chu, Hongliang Tian, Yuqun Zhang

专题命中 软件智能体 :agent(summary_cn,abstract);autonomous agent(abstract);分类 cs.SE

AI总结 本文提出Agent-centric Debugging Interface,通过函数级交互和Frame Lifetime Trace提升自主调试代理效率,在SWE-bench验证集上实现63.8%的任务解决率,成本仅为1.28美元/任务。

Comments Accepted to the ACM International Conference on the Foundations of Software Engineering (FSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02943 2026-03-27 cs.SE 84%

Hallucination to Consensus: Multi-Agent LLMs for End-to-End JUnit Test Generation

幻觉到共识:多智能体LLM用于端到端JUnit测试生成

Qinghua Xu, Guancheng Wang, Lionel Briand, Kui Liu

专题命中 软件智能体 :agent(title);multi-agent(title);分类 cs.SE

AI总结 本文提出CANDOR框架,通过多智能体协作生成Java单元测试,利用共识策略减少幻觉并提升Oracle准确性,实验表明其在代码覆盖率和突变得分上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14053 2025-10-10 cs.AR cs.AI cs.MA 84%

MAHL: Multi-Agent LLM-Guided Hierarchical Chiplet Design with Adaptive Debugging

Jinwei Tang, Jiayin Qin, Nuo Xu, Pragnya Sudershan Nalla, Yu Cao, Yang, Zhao, Caiwen Ding

机构 * University of Minnesota - Twin Cities(明尼苏达大学-双城分校)

专题命中 软件智能体 :agent(title);multi-agent(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18553 2025-02-13 cs.AI 84%

FAIIR: Building Toward A Conversational AI Agent Assistant for Youth Mental Health Service Provision

Stephen Obadinma, Alia Lachana, Maia Norman, Jocelyn Rankin, Joanna Yu, Xiaodan Zhu, Darren Mastropaolo, Deval Pandya, Roxana Sultan, Elham Dolatabadi

专题命中 软件智能体 :agent(title);AI agent(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09072 2026-08-11 cs.SE cs.AI 新提交 84%

A Unified Issue Resolution Benchmark for Requirement Clarification, Planning, and Code Generation for Coding Agents

面向编码智能体的需求澄清、规划与代码生成的统一问题解决基准

Xin Zhou, Chun Yong Chong, Kisub Kim, Yun Peng, Rui Shu, Zihan Wu, Xu Han, Guowen Yuan, Zeyang Zhuang, Jounghoon Kim, Jeongjin Ju, Seongmin Ju, Taein Yoon, David Lo

专题命中 软件智能体 :planning(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究推出SWE-RPG编码智能体基准,评估发现主流编码智能体在该基准上平均解决率仅31.5%,隐性需求恢复是主要瓶颈,为改进编码智能体提供了方向。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02391 2026-08-04 cs.AI cs.LG 新提交 84%

Cooperative Coevolution for Resource-Constrained Agentic LLM Post-Training

资源受限智能体大语言模型后训练的协同协同进化方法

Zhiyuan Wang, Shengcai Liu, Jiahao Wu, Ning Lu, Hui Ouyang, Shaofeng Zhang, Haoze Lv, Ke Tang

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG

AI总结 针对资源受限智能体LLM后训练的高内存、长耗时问题,提出CoPES方法,在GPU小时预算下,其验证准确率恢复率、内存效率均优于标准ES和LoRA-GRPO,在多任务基准上表现更优。

Comments 14 pages,9 figures, submit to AAAI 2027

详情

展开后加载摘要…

URL PDF HTML 收藏