arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 462 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 462 篇

2607.24762 2026-07-29 cs.AI cs.PF 新提交 79%

Kernel Forge: An Agent Harness for LLM-based Generation and Optimization of CUDA Kernels

Kernel Forge:用于基于大语言模型的CUDA内核生成与优化的代理框架

Joshua Brodsky, Dhravid Kumar, Savini Kashmira, Jayanaka Danatanarayana, Jason Mars, Krisztian Flautner, Lingjia Tang

机构 * University of Michigan(密歇根大学)

专题命中 软件智能体 :agent(title);agentic(abstract);分类 cs.AI

AI总结 研究针对机器学习模型中计算内核优化需专家手写代码的问题,提出开源端到端代理框架Kernel Forge,它支持多种工作负载,用蒙特卡洛树搜索优化路径,经实验评估,优化后的内核性能优于PyTorch即时模式。

Comments The code is available at: https://github.com/TheJoshBrod/KernelForge

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24051 2026-07-28 astro-ph.IM cs.AI cs.RO 新提交 79%

HELIOS: An LLM-Driven Autonomous Indirect Trajectory Optimization Agent

HELIOS:一个由大语言模型驱动的自主间接轨迹优化智能体

An-yi Huang

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI

AI总结 研究低推力轨迹优化面临的问题,提出基于大语言模型的HELIOS智能体,能自主进行PMP符号推导等。其创新包括约束自适应推导框架等,实验表明可解决多种轨迹优化问题,验证了模型无关架构及模型规模与推导能力的正相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21674 2026-07-27 cs.SE 新提交 79%

Output Format x Model Identity: Interaction Effects in Single-Round Coding Agent Performance

输出格式x模型标识:单轮编码代理性能中的交互效应

Yang Yang

专题命中 软件智能体 :agent(title,abstract);分类 cs.SE

AI总结 研究输出格式与模型交互对单轮编码代理性能的影响,通过多模型、多格式、多任务实验发现无普遍最优格式,有格式滥用问题,提出特定于模型的输出策略及工具设计原则并开源数据模板。

Comments 16 pages, 7 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19267 2026-07-22 cs.CR cs.AI cs.MA 新提交 79%

They'll Verify. They Just Won't Act. How Authority Framing and Laundered Code Turn a Trusted Agentic CI/CD Pipeline Into an Attack Surface

他们会验证。但他们不会采取行动。权威框架和清洗后的代码如何将一个可信的代理式CI/CD管道变成攻击面

Yohann Sidot

机构 * Senthex Research(Senthex研究机构) RELAY Lab(RELAY实验室)

专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.AI

AI总结 研究五代理CI/CD管道在面对恶意输入时的安全性,通过AxB(xC)析因设计实验发现权威框架注入会使下游验证者放行恶意代码,基于内容的控制会失效,只有来源感知控制可防攻击,揭示了现有保护机制的不足。

Comments 9 pages. Dataset and reproduction code: https://github.com/senthex-security/senthex-research

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17722 2026-07-21 cs.SE 新提交 79%

KernelDiag: Agent-Based Root Cause Diagnosis for Kernel Crashes

KernelDiag:基于代理的内核崩溃根本原因诊断

Weijing Wang, Zan Wang, Dong Wang, Haichi Wang, Junjie Chen

专题命中 软件智能体 :agent(title,abstract);分类 cs.SE

AI总结 针对Linux内核崩溃根本原因诊断难的问题,提出KernelDiag框架,通过日志到代码映射及专门代理进行结构化因果推理,在KGYM基准测试中表现出色,优于现有方法,为自动内核根本原因诊断奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15769 2026-07-20 cs.SE cs.CY 新提交 79%

Making Agent-Mediated Contributions Governable: A Project-Level Governance Manifest for Open-Source AI Collaboration

使代理介导的贡献具有可治理性:开源人工智能协作的项目级治理宣言

Jinjin Gao, Luyang Li, Shufen Guo, Ligang He, Xiaoning Sun

专题命中 软件智能体 :agent(title,abstract);分类 cs.SE

AI总结 研究开源人工智能协作中代理介导贡献的治理问题,开发代理治理宣言(AGM)作为双向治理合同,通过实验验证其有效性,构建三层框架,推进合规数字创新治理并保留维护者决策权。

Comments Preprint. Under journal review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15684 2026-07-20 cs.SE 新提交 79%

Understanding Agent-Reactive Bugs at the Model-Harness Boundary: An Empirical Study of LLM Agent Issue Reports

理解模型-框架边界处的代理反应性错误:对大型语言模型代理问题报告的实证研究

Jingyi Chen, Songqiang Chen, Hengcheng Zhu, Jialun Cao, Jiasi Shen, Shing-Chi Cheung

专题命中 软件智能体 :agent(title,abstract);分类 cs.SE

AI总结 研究聚焦大型语言模型代理在模型-框架边界处的反应性错误,通过分析255份错误报告构建分类法,发现此类错误多为无明确测试预言的静默错误,检测和重现困难,还揭示了用户与开发者对错误归因及修复的不匹配,推动相关技术设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11390 2026-07-14 cs.SE 新提交 79%

TerraRepair: A Tool-Grounded LLM Agent for Infrastructure-as-Code Repair

TerraRepair:一种用于基础设施即代码修复的工具接地大语言模型代理

Minase Mekete Mengistu, Juri Di Rocco, Phuong T. Nguyen, Davide Di Ruscio

专题命中 软件智能体 :agent(title,abstract);分类 cs.SE

AI总结 研究探讨工具接地能否改进基于LLM的Terraform修复及何时升级问题。提出TerraRepair工具接地LLM代理,通过检索上下文等操作进行修复。实验表明其能显著提高扫描器验证修复率,凸显工具接地改进修复效果,同时指出特定部署上下文是自主修复的主要限制。

Comments The paper has been peer reviewed and accepted for publication in the proceedings of the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11046 2026-07-14 cs.SE 新提交 79%

Retrieval-Oriented Code Representations in Agentic Bug Localization

面向检索的智能体漏洞定位中的代码表示

Genevieve Caumartin, Tse-Hsun, Chen, Diego Elias Costa

专题命中 软件智能体 :agentic(title,abstract);分类 cs.SE

AI总结 研究文件级漏洞定位中代码表示的作用,在LCA和SWE数据集上比较五种代码表示,通过实验发现角色感知摘要性价比最佳,结合互补结果和LLM排序可进一步提升效果,案例研究验证技术有效性,强调代码表示应是智能体定位管道的重要设计选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09072 2026-07-13 cs.SE 新提交 79%

Agentic Proof and Property-Based Testing via Property-Templates in Data-Intensive Computing

通过数据密集型计算中的属性模板进行智能体证明和基于属性的测试

Seongmin Lee, Yaoxuan Wu, Miryung Kim

专题命中 软件智能体 :agentic(title,abstract);分类 cs.SE

AI总结 研究软件工程中意图规范和验证问题,提出用属性模板解决验证候选属性和实施PBT的子问题,设计智能体双轨验证框架,经评估该框架能提高证明成功率、减少幻觉、降低成本并提升代码覆盖,还能发现模型与实现差距。

Comments 12 pages, 7 figures, 4 tables; supplementary material included as ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06413 2026-07-08 stat.ME cs.AI 新提交 79%

An Experimental Design Approach to Evaluating Agentic AI's Autonomous Model Discovery

一种评估智能体人工智能自主模型发现的实验设计方法

Hao He, Xueying Liu, Chris J. Kuhlman, Xinwei Deng

机构 * Department of Statistics, Virginia Tech(统计学系,弗吉尼亚理工学院) Department of Statistical Science, Baylor University(统计科学系,贝勒大学) Advanced Research Computing, Virginia Tech(高级研究计算,弗吉尼亚理工学院)

专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.AI

AI总结 研究大型语言模型编码智能体自主模型发现行为,提出实验设计与分析框架,将智能体视为随机模型发现算子,在多种受控因素下研究Codex和Claude Code两个算子,进行回归模型和推理,开发规范分解,通过网络造词游戏测试平台得出相关深刻发现。

Comments 39 pages, 11 figures, 6 tables. Data and code available at the GitHub repository listed in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02846 2026-07-07 cs.AI 新提交 79%

Object-Centric Environment Modeling for Agentic Tasks

用于智能任务的以对象为中心的环境建模

Yiyang Li, Tianyi Ma, Zehong Wang, Yijun Ma, Yanfang Ye

机构 * University of Notre Dame(圣母大学)

专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.AI

AI总结 研究大语言模型智能体经验维护难题,提出以对象为中心的环境建模(OCM),将经验组织成可执行模型,含对象知识与过程知识,在线更新并验证,实验表明其能提升智能体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02357 2026-07-03 cs.CR cs.SE 新提交 79%

Cloak and Detonate: Scanner Evasion and Dynamic Detection of Agent Skill Malware

伪装与引爆:技能型恶意软件的扫描规避与动态检测

Zimo Ji, Congying Xu, Zongjie Li, Yudong Gao, Xin Wei, Shuai Wang, Shing-Chi Cheung

专题命中 软件智能体 :agent(title,abstract);分类 cs.SE

AI总结 针对LLM编码代理技能市场中的恶意技能,提出两种规避静态扫描的方法(结构混淆和自提取技能打包),并设计基于沙箱运行时行为审计的检测系统SkillDetonate,实现97%检测率与2%误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01760 2026-07-03 cs.SE 新提交 79%

Refploit: Facilitating Exploit Construction via Code-Agent Trajectory Repair

Refploit: 通过代码代理轨迹修复促进漏洞利用构建

Zirui Chen, Zhipeng Xue, Jiayuan Zhou, Xing Hu, Xin Xia, Xiaohu Yang

专题命中 软件智能体 :agent(title,abstract);分类 cs.SE

AI总结 提出Refploit框架,利用大语言模型修复代码代理生成的失败轨迹,通过差分执行验证和约束引导恢复,在Java漏洞数据集上实现80.2%的复现率,相对初始轨迹提升64.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00038 2026-07-02 cs.SE 新提交 79%

Stop Hand-Holding Your Coding Agent: Engineering the Loops that Replace Step-by-Step Prompting

停止手把手指导你的编码智能体:设计替代逐步提示的循环机制

Sandeco Macedo

专题命中 软件智能体 :agent(title,abstract);分类 cs.SE

AI总结 本文提出循环规范作为替代逐步提示的编码智能体新范式,定义其结构、分类与设计原则,并通过真实语料分析验证其成熟度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00035 2026-07-02 cs.AI 新提交 79%

Making Failure Safe: A Constrained, Verifiable Agent Framework for Open-Web Data Collection

确保失败安全:一个用于开放网络数据收集的受约束、可验证的智能体框架

Bo Chen

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI

AI总结 提出一个受约束、可验证的智能体框架,通过将LLM输出从自由形式代码转换为类型化JSON收集器配置,结合六类型收集器分类、模板和效用函数约束、静态Airflow DAG执行、基于规则的质量检查和结构化反馈纠正,实现了零执行阶段LLM令牌消耗和最低平均挂钟时间。

Comments 15 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32007 2026-07-01 cs.AI 新提交 79%

AxDafny: Agentic Verified Code Generation in Dafny

AxDafny: Dafny中的智能验证代码生成

Benjamin Breen, Austin Letson, Borja Requena Pozo, Leopoldo Sarra

机构 * Axiomatic AI, Boston, MA, USA(Axiomatic AI,波士顿,马萨诸塞州,美国)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI

AI总结 提出AxDafny框架,通过验证器引导的修复迭代生成Dafny代码和证明,在LCB-Pro-Dafny和DafnyBench上显著提升验证成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21071 2026-06-23 cs.CR cs.AI 新提交 79%

Local LLM Agents as Vulnerable Runtimes:A Source-Code Audit of the Agent Runtime Layer

本地LLM智能体作为易受攻击的运行时:智能体运行时层的源代码审计

Zhengsong Zhang, Zongze Li, Jiawei Guo, Haipeng Cai

机构 * Department of Computer Science and Engineering(计算机科学与工程系) University at Buffalo, SUNY(布法罗大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI

AI总结 提出CLAWAUDIT静态审计框架,通过STRIDE导出的五类漏洞分类法和自定义静态分析规则,评估本地LLM智能体运行时的安全弱点,在OpenClaw基准上显著提升召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15549 2026-06-23 cs.CR cs.AI 新提交 79%

One Goal, Many Commands: Characterizing Denylist Fragility in AI Agents

CmdNeedle: 衡量AI智能体命令黑名单的不完备性

Chuyang Chen, Zhiqiang Lin

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 软件智能体 :AI agent(title,abstract);分类 cs.AI

AI总结 针对终端AI智能体命令黑名单的脆弱性问题,提出LLM驱动的检测流水线CmdNeedle,发现69.0-98.6%的黑名单存在可绕过漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17076 2026-06-17 physics.ao-ph cs.AI 新提交 79%

CMIP-Forge: An Agentic System that Retrieves, Computes, and Self-Reviews Climate Science

CMIP-Forge:一个检索、计算和自我审查气候科学的智能体系统

Dmitrii Pantiukhin, Boris Shapkin, Ivan Kuznetsov, Thomas Jung, Nikolay Koldunov

机构 * Alfred Wegener Institute, Helmholtz Centre for Polar and Marine Research(阿尔弗雷德·韦格ener研究所,极地与海洋研究中心)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI

AI总结 提出CMIP-Forge系统,结合检索增强生成与自主分析,通过多层级防御架构和独立审查机制,实现从文献到实时气候数据的端到端自主研究。

Comments 28 pages, 9 figures. Code available at https://github.com/CliDyn/cmip6_gpt

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16523 2026-06-16 cs.CL 新提交 79%

SkillWiki: A Living Knowledge Infrastructure for Agent Skills

SkillWiki: 一个用于智能体技能的活知识基础设施

Dingcheng Huang, Yuda Ding, Bingshuo Liu, Qingbin Liu, Xi Chen, Jiang Bian, Hongliang Sun, Zhiying Tu, Dianhui Chu, Xiaoyan Yu, Dianbo Sui

机构 * Harbin Institute of Technology(哈尔滨工业大学) Tencent(腾讯) Nanyang Technological University(南洋理工大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.CL

AI总结 提出SkillWiki,一个支持智能体技能组织、落地和持续演化的活知识基础设施,通过将异构知识转化为可复用技能资产并关联原始证据,实现从知识摄入到技能生产、溯源探索、治理和执行驱动演化的完整生命周期。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15283 2026-06-16 cs.SE 新提交 79%

AI-driven Software Development: A Pragmatic Path to Agentic Development Processes

AI驱动的软件开发:迈向智能开发过程的务实路径

Peter Mandl, Paul Mandl

专题命中 软件智能体 :agentic(title,abstract);分类 cs.SE

AI总结 本文提出一个务实框架,指导从辅助性AI使用到可控智能开发过程的过渡,聚焦技术、组织和质量保障机制,并通过中型软件公司案例验证其可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13763 2026-06-15 cs.SE 新提交 79%

Do programming languages still matter to your AI coding agent teammate? Evidence at scale from chess engines

编程语言对你的AI编码队友还重要吗?来自国际象棋引擎的大规模证据

Mathieu Acher, Jean-Marc Jézéquel

专题命中 软件智能体 :agent(title,abstract);分类 cs.SE

AI总结 通过让前沿AI代理用17种编程语言开发国际象棋引擎,发现AI能生成任何语言的可用系统,但语言选择仍影响性能、成本和功能,主流编译语言才能达到强棋力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11671 2026-06-11 cs.CR cs.AI 新提交 79%

Runtime Skill Audit: Targeted Runtime Probing for Agent Skill Security

运行时技能审计:针对智能体技能安全的目标运行时探测

Tu Lan, Chaowei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI

AI总结 提出运行时技能审计(RSA)动态分析方法,通过目标运行时条件探测技能行为,在100个技能上达到90.0%准确率,优于静态基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10702 2026-06-10 cs.SE 新提交 79%

Watts and Debts of Agentic Frameworks: An Empirical Study (Registered Report)

智能体框架的能耗与债务:一项实证研究(注册报告)

Aneetta Sara Shany, Chandrasekar S, Karthik Vaidhyanathan

专题命中 软件智能体 :agentic(title,abstract);分类 cs.SE

AI总结 通过实证研究关联智能体框架中的自我承认技术债务与运行时能耗,探讨代码质量能否指导节能设计。

Comments Accepted at the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026), Registered Reports Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08135 2026-06-09 cs.SE 新提交 79%

TICoder: A Repository-Level Code Generation Framework with Test-Driven Planning and Implementation-Aware Reuse

TICoder: 一种具有测试驱动规划和实现感知复用的仓库级代码生成框架

Siyu Nan, Yaling Luo, Jian Wang, Neng Zhang, Bing Li

专题命中 软件智能体 :planning(title,abstract);分类 cs.SE

AI总结 提出TICoder框架,通过测试驱动迭代规划机制和实现感知代码复用策略,解决仓库级代码生成中的依赖和上下文限制问题,在多个基准上平均提升11.52%。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07433 2026-07-09 cs.CR 新提交 79%

Beware of Agentic Botnets: Scalable Untargeted Promptware Attacks via Universal and Transferable Adversarial HalluSquatting

警惕智能体僵尸网络:通过通用且可转移的对抗性幻觉蹲点进行可扩展的无目标提示软件攻击

Aya Spira, Stav Cohen, Elad Feldman, Ron Bitton, Avishai Wool, Ben Nassi

专题命中 软件智能体 :agentic(title,abstract)

AI总结 研究针对实际威胁模型中无直接渠道时攻击者能否利用LLM应用的问题,提出对抗性幻觉蹲点技术,通过识别热门资源计算幻觉分布抢先注册对抗性提示,利用幻觉特性扩大无目标提示软件攻击范围并建立僵尸网络,实验证明该技术可行性及幻觉可转移性。

Comments Website: https://sites.google.com/view/agentic-botnets/home

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05471 2026-07-08 cs.SE cs.AI 新提交 79%

KAT-Coder-V2.5 Technical Report

KAT-Coder-V2.5技术报告

Bo Huang, Fengxiang Li, Hao Xu, Haoyang Huang, Hongyi Fu, Jinhua Hao, Kun Yuan, Minglei Zhang, Pengcheng Xu, Shiyang Liu, Wenhao Zhuang, Yuze Shi, Zongxian Feng, Chao Wang, Cheng He, Chongling Rao, Deyu Cao, Fan Yang, Gang Xiong, Haochen Liu, Jiabao Li, Jian Liang, Jinghui Jia, Jingwen Chang, Jun Du, Junyu Shi, Min Li, Mingqi Wu, Qiang Gao, Shangpeng Yan, Shaotong Qi, Shu Xu, Shuo Zhou, Tiankuo Xu, Tong Zheng, Weilun Zhao, Xiancheng Meng, Xianda Sun, Xiaoyu Jiang, Xunhao Jia, Yao Xia, Yimeng Xu, Yinghan Cui, Yingpeng Chen, Yiwen Ning, Yong Wang, Yuxuan Sun, Zhongsheng Liu, Ming Sun, Cheng Luo, Chen Yang, Han Li, Kun Gai

机构 * KwaiKAT Team(快手KwaiKAT团队)

专题命中 软件智能体 :agent(abstract);tool-use(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 介绍KAT-Coder-V2.5这一专注编码的智能模型,针对其受环境等因素限制的问题,通过端到端框架及多种技术手段解决,经多方法扩展强化学习并统一专家知识,在多个基准测试中取得优异成绩。

Comments 24 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19725 2026-06-23 cs.SE cs.AI cs.MA 新提交 79%

Library-Aware Doubles and Iterative Repair for Large Language Model-Generated Unit Tests in OpenSIL Firmware

面向OpenSIL固件中大语言模型生成的单元测试的库感知双打与迭代修复

Ma Toan Bach, Yuchi Zheng, Haingo Razafindranto, Tanvir Alam, Aric Leather, Ranveer Sandhu, Jitesh Arora

机构 * School of Software Design and Data Science(软件设计与数据科学学院) Seneca Polytechnic(森纳学院) Advanced Micro Devices Canada(加拿大先进微器件公司)

专题命中 软件智能体 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 针对OpenSIL固件单元测试因构建约束易失败的问题,提出LLM引导的多智能体自动化测试生成与迭代修复流程,在76个函数中73个生成可编译测试,行覆盖率达98.8%。

Comments 20 pages, 10 figures, 1 Table. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14093 2026-08-17 cs.HC 新提交 78%

AppLooper: An Agentic Application Engineering Loop for Accountable Release with Virtual-User Feedback

AppLooper:用于负责任发布的智能体应用工程闭环,结合虚拟用户反馈

Zihong He, Chen Liang, Hai-Ning Liang

专题命中 软件智能体 :agentic(title);agent(abstract)

AI总结 本文提出AppLooper,一种结合虚拟用户反馈的人-编码智能体-虚拟用户应用工程闭环,将开发各环节绑定至特定版本,实现可追踪的负责任发布,人类保留最终发布权。

详情

展开后加载摘要…

URL PDF HTML 收藏