arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-23 至 2026-06-23 共收录 29 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 29 篇

2606.15874 2026-06-23 cs.AI cs.SE 新提交 93%

LLM-as-Code: Agentic Programming for Agent Harness

LLM即代码:面向Agent框架的编程范式

Junjia Qi, Zichuan Fu, Jingtong Gao, Wenlin Zhang, Hanyu Yan, Xian Wu, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Tencent Jarvis Lab(腾讯贾维斯实验室)

专题命中 软件智能体 :agentic(title,summary_cn);agent(title,title_cn);分类 cs.AI、cs.SE

AI总结 针对LLM作为编排器导致控制流幻觉和不可靠执行的问题,提出Agentic Programming范式,由程序控制所有流程,LLM仅作为代码组件在需要推理或生成时被调用,显著提升长序列操作的稳定性。

Comments Accepted at the KDD 2026 Workshop on Agentic Software Engineering (AgenticSE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22110 2026-06-23 cs.SE cs.AI cs.HC 新提交 88%

TraceView: Interactive Visualization of Agentic Program Repair Trajectories

TraceView: 智能体程序修复轨迹的交互式可视化

Amirali Sajadi, Tu Nguyen, Kimmie Huynh, Esteban Parra, Preetha Chatterjee

机构 * Belmont University(贝尔蒙特大学)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);tool use(abstract);workflow(abstract)

AI总结 提出TraceView工具,通过交互式可视化和语义关系标注,帮助开发者诊断LLM-based自动程序修复代理的失败原因,支持轨迹扫描与理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22711 2026-06-23 cs.SE cs.AI 新提交 87%

Beyond Simpson's Paradox: A Cascade of Confounders in AI Agent Pull-Request Co-Authorship

超越辛普森悖论:AI 智能体拉取请求合著中的级联混杂因素

Haoran Yu, Xiaochong Jiang, Lifei Liu, Su Wang, Pin Qian, Yihang Chen

机构 * Independent Researcher(独立研究者) Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 软件智能体 :agent(title,abstract);AI agent(title);分类 cs.AI、cs.SE;agentic(comments)

AI总结 本研究通过分层分析和多级控制,揭示了AI编码智能体拉取请求合著与合并率之间的关联主要由智能体组成、仓库选择和PR结构等混杂因素驱动,而非因果关系。

Comments 5 pages. Accepted at the KDD 2026 Workshop on Agentic Software Engineering (SE 3.0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22721 2026-06-23 cs.SE 新提交 87%

Habituation at the Gate: Rising Approval and Declining Scrutiny in Human Review of AI Agent Code

门前的习惯化:人类对AI智能体代码审查中批准率上升与审查力度下降

Haoran Yu, Lifei Liu, Xiaochong Jiang, Yuwen Jia, Su Wang, Pin Qian, Yihang Chen

专题命中 软件智能体 :agent(title,abstract);AI agent(title);分类 cs.SE;agentic(comments)

AI总结 通过分析400名重复审查者在七个月内对AI生成代码的审查行为,发现批准率从30.1%上升至36.8%,审查评论量下降22%,而等待时间增加3.5倍,表明审查者因工作负荷增加而出现习惯化反应。

Comments 5 pages, 2 figures, 2 tables. Accepted at the KDD 2026 Workshop on Agentic Software Engineering (SE 3.0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22417 2026-06-23 cs.AI 新提交 85%

Code Isn't Memory: A Structural Codebase Index Inside a Coding Agent

代码不是内存:编码代理中的结构化代码库索引

Ishaan Bhola, Adithyan Krishnan, Sravanth Kurmala, Mukunda NS

机构 * TransformerOptimus

专题命中 软件智能体 :agent(title,abstract);agentic(abstract,abstract_cn);分类 cs.AI

AI总结 通过消融实验和跨框架对比,研究在固定编码代理框架中增加结构化代码库索引对成本与解决率的影响,发现索引能显著提升定位和解决率且不增加成本。

Comments Code and data: https://github.com/TransformerOptimus/supercoder-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22647 2026-06-23 cs.CR cs.LG cs.SE 新提交 84%

RAVEN: Agentic RAG for Automated Vulnerability Repair

RAVEN:用于自动化漏洞修复的智能体检索增强生成框架

Varun Gadey, Zijie Liu, Alexandra Dmitrienko

机构 * University of Duisburg-Essen(杜伊斯堡- Essen大学)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.LG、cs.SE

AI总结 提出RAVEN框架,集成智能体RAG管道与可控迭代修复,利用开源LLM实现跨类型、跨语言的自动化漏洞修复,在160个真实CVE上达到83.13%修复成功率。

Comments 17 Pages, 4 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22484 2026-06-23 cs.HC 新提交 82%

Governed AI-Assisted Engineering: Graduated Human Oversight for Agentic Code Generation in Regulated Domains

受治理的AI辅助工程:受监管领域中代理代码生成的渐进式人工监督

Richard Kang

专题命中 软件智能体 :agentic(title,abstract);autonomous agent(abstract)

AI总结 针对受监管行业中代理AI编码系统的治理挑战,提出GAIE框架,通过三级渐进式人工监督模型(人机协同、人机监控、自动监控)平衡编码速度与合规性,在保留91%编码速度的同时确保监管证据覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21804 2026-06-23 cs.SE cs.AI cs.CL 新提交 82%

Is Agent Code Less Maintainable Than Human Code?

智能体代码比人类代码更不易维护吗?

Shaswat Patel, Betty Li Hou, Arun Purohit, Kai Xu, Jane Pan, He He, Valerie Chen

机构 * New York University(纽约大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 研究通过CodeThread框架对比智能体与人类代码在维护场景下的表现,发现基于智能体代码解决任务的成功率下降高达13.1%,传统可维护性指标无法解释差异,而输入验证、错误处理等行为差异是关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06530 2026-06-23 cs.AR 新提交 82%

RTLScout: Joint Agentic Code and Synthesis Optimization for Efficient Digital Circuits

RTLScout:面向高效数字电路的联合智能体代码与综合优化

Felix Arnold, Ryan Amaudruz, Dimitrios Tsaras, Renzo Andri, Lukas Cavigelli

专题命中 软件智能体 :agentic(title,abstract);agent(abstract)

AI总结 提出RTLScout系统,结合LLM驱动智能体设计与电路级综合优化及算术架构扫描,通过多轮精英池框架迭代优化RTL设计,在浮点乘法器上实现面积减少35%、延迟减少45%。

Comments Updated Appendix Table 4: corrected three Verilog baseline values. Conclusions unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22673 2026-06-23 cs.AI cs.SE 新提交 81%

AgentLens: Interpretable Safety Steering via Mechanistic Subspaces for Multi-Turn Coding Agent

AgentLens: 通过机制子空间实现多轮编码代理的可解释安全引导

Weidi Luo, Qiming Zhang, Yihao Quan, Mingyu Jin, Jie Cai, Chaowei Xiao, Jingcheng Niu, Zhen Xiang

机构 * University of Georgia(佐治亚大学) University of South Florida(南佛罗里达大学) Rutgers University(罗格斯大学) University of Southern California(南加州大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 提出AgentLens框架,从内部表示层检测和缓解多轮编码代理的安全风险,通过单层10维子空间干预实现运行时安全控制,并在MAS基准上验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22263 2026-06-23 cs.CR cs.AI cs.MA cs.SE 新提交 81%

Revelio: Cost-Efficient Agentic Memory Safety Vulnerability Detection For Repository-Scale Codebases

Revelio: 面向仓库级代码库的高性价比智能体内存安全漏洞检测

Yiwei Hou, Hao Wang, Muxi Lyu, Marius Momeu, Eric Nguyen, Taige Yang, Koushik Sen, Dawn Song, David Wagner

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.SE

AI总结 提出Revelio框架,通过生成可执行漏洞证明并用确定性消毒器验证,结合低成本LLM和轻量静态分析,在仓库级代码库中高效发现内存安全漏洞,7个项目中19个新漏洞,成本约300美元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21071 2026-06-23 cs.CR cs.AI 新提交 79%

Local LLM Agents as Vulnerable Runtimes:A Source-Code Audit of the Agent Runtime Layer

本地LLM智能体作为易受攻击的运行时:智能体运行时层的源代码审计

Zhengsong Zhang, Zongze Li, Jiawei Guo, Haipeng Cai

机构 * Department of Computer Science and Engineering(计算机科学与工程系) University at Buffalo, SUNY(布法罗大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI

AI总结 提出CLAWAUDIT静态审计框架,通过STRIDE导出的五类漏洞分类法和自定义静态分析规则,评估本地LLM智能体运行时的安全弱点,在OpenClaw基准上显著提升召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15549 2026-06-23 cs.CR cs.AI 新提交 79%

One Goal, Many Commands: Characterizing Denylist Fragility in AI Agents

CmdNeedle: 衡量AI智能体命令黑名单的不完备性

Chuyang Chen, Zhiqiang Lin

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 软件智能体 :AI agent(title,abstract);分类 cs.AI

AI总结 针对终端AI智能体命令黑名单的脆弱性问题,提出LLM驱动的检测流水线CmdNeedle,发现69.0-98.6%的黑名单存在可绕过漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19725 2026-06-23 cs.SE cs.AI cs.MA 新提交 79%

Library-Aware Doubles and Iterative Repair for Large Language Model-Generated Unit Tests in OpenSIL Firmware

面向OpenSIL固件中大语言模型生成的单元测试的库感知双打与迭代修复

Ma Toan Bach, Yuchi Zheng, Haingo Razafindranto, Tanvir Alam, Aric Leather, Ranveer Sandhu, Jitesh Arora

机构 * School of Software Design and Data Science(软件设计与数据科学学院) Seneca Polytechnic(森纳学院) Advanced Micro Devices Canada(加拿大先进微器件公司)

专题命中 软件智能体 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 针对OpenSIL固件单元测试因构建约束易失败的问题,提出LLM引导的多智能体自动化测试生成与迭代修复流程,在76个函数中73个生成可编译测试,行覆盖率达98.8%。

Comments 20 pages, 10 figures, 1 Table. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20512 2026-06-23 cs.SE cs.LG 新提交 73%

Probe-and-Refine Tuning of Repository Guidance for Coding Agents

代码代理的仓库指导的探测与精炼调优

Asa Shepard, Jeannie Albrecht

机构 * Williams College(威廉姆斯学院)

专题命中 软件智能体 :agent(abstract);tool use(abstract);分类 cs.LG、cs.SE

AI总结 提出探测与精炼调优方法,通过合成bug修复探测迭代诊断和修补仓库指导文件,在SWE-bench Verified上以Qwen3.5-35B-A3B模型达到33.0%解决率,优于静态知识库的28.3%和无指导基线的25.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13864 2026-06-23 cs.CR cs.AI 版本更新 70%

HardSecBench: Benchmarking the Security Awareness of LLMs for Hardware Code Generation

HardSecBench: 对大型语言模型在硬件代码生成中的安全意识的基准测试

Qirui Chen, Jingxian Shuai, Shuangwu Chen, Shenghao Ye, Zijian Wen, Xufei Su, Jie Jin, Jiangming Li, Jun Chen, Xiaobin Tan, Jian Yang

机构 * University of Science and Technology of China(中国科学技术大学) Xi’an Jiaotong University(西安交通大学) Nanjing University(南京大学) ZTE Corporation(中兴通讯)

专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 提出HardSecBench基准,包含924个任务覆盖Verilog RTL和固件C代码,评估LLM在硬件代码生成中的安全性,发现模型常满足功能需求但存在安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21811 2026-06-23 cs.SE cs.AI cs.LG 新提交 67%

Steer, Don't Solve: Training Small Critic Models for Large Code Agents

引导而非求解:为大型代码智能体训练小型评论模型

Shubham Gandhi, Yiqing Xie, Atharva Naik, Ruichen Zhu, Carolyn Rose

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 针对代码智能体策略推理不足的问题,提出冻结智能体并训练小型评论模型提供轨迹内反馈,在SWE-bench Verified上提升准确率并降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21297 2026-06-23 cs.LG cs.AI 新提交 62%

NASDAQ: Normalized Observation Space Dynamics-Augmented Q-Learning

NASDAQ:归一化观测空间动力学增强Q学习

Xinwei Liu, Junyuan Liang, Zicong Hong, Jianting Zhang, Wuhui Chen

机构 * Sun Yat-sen University(中山大学) EPFL(瑞士联邦理工学院洛桑分校) Purdue University(普渡大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对观测预测强化学习中低维观测维度不平衡导致性能下降的问题,提出归一化方法平衡损失和梯度,并构建NASDAQ框架,结合价值学习与两个辅助任务,在多个领域取得领先性能且训练时间更短。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20882 2026-06-23 cs.SE cs.AI 新提交 62%

The Substrate Collapse: AI Code Generation Invalidates Authorship-Based Knowledge Metrics

基底崩塌:AI代码生成使基于作者身份的知识度量失效

Brett Wheeler

机构 * Independent Researcher(独立研究者)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文论证AI代码生成从根本上切断了代码作者身份与理解之间的推理链,导致基于作者身份的知识度量(如卡车因子)不再有效,并提出以理解证据为基础的新度量方向。

Comments 10 pages, no figures. Position paper; states a falsifiable prediction and deliberately leaves construction of the comprehension-grounded instrument open

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20640 2026-06-23 cs.AI cs.LG math.OC 新提交 62%

An LLM-Explainable DRL Framework for Passenger-Directed Autonomous Driving

面向乘客导向自动驾驶的LLM可解释DRL框架

Ouided Braoui, Meriem Bouali, Nadir Farhi

机构 * LITAN, ESTIN(LITAN,ESTIN) Cosys-Grettia, Univ Gustave Eiffel(Cosys-Grettia,古斯塔夫·埃菲尔大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出结合深度强化学习与大型语言模型可解释模块的框架,实现自适应驾驶控制并向乘客解释决策,平衡安全性、适应性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25764 2026-06-23 cs.SE cs.AI 版本更新 62%

Confident and Wrong: Silent Semantic Failures in Coding Agents

自信且错误:编码智能体中的无声语义失败

Aman Mehta

机构 * Snowflake AI Research(Snowflake AI研究院)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文揭示编码智能体在任务完成率与可信度之间存在系统性偏差,提出“无声语义失败”这一危险模式,并建议通过多次运行的测试验证正确率来评估智能体。

Comments 8 pages, 8 figures. Request: please change the primary category to cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00491 2026-06-23 cs.PL cs.AI cs.SE 版本更新 62%

Executing as You Generate: Hiding Execution Latency in LLM Code Interpreters

边生成边执行:在LLM代码解释器中隐藏执行延迟

Zhensu Sun, Zhihao Lin, Zhi Chen, Chengran Yang, Mingyi Zhou, Li Li, David Lo

机构 * Singapore Management University Singapore(新加坡国立管理学院新加坡) Beihang University China(北航大学中国)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 提出并行执行范式,通过将生成、检测和执行三阶段流水线化,在代码生成过程中提前执行,显著降低端到端延迟。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00012 2026-06-23 cs.LG cs.AI cs.CY cs.IR 版本更新 62%

OGD4All: A Framework for Accessible Interaction with Geospatial Open Government Data Based on Large Language Models

OGD4All: 基于大语言模型的可访问地理空间开放政府数据交互框架

Michael Siebenmann, Javier Argota Sánchez-Vaquerizo, Stefan Arisona, Krystian Samp, Luis Gisler, Dirk Helbing

机构 * Professorship of Computational Social Science, ETH Zurich(计算社会科学教授职位,苏黎世联邦理工学院) Esri R&D Center Zurich(埃斯里苏黎世研发中心) Complexity Science Hub(复杂性科学中心)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出OGD4All框架,结合语义检索、智能体推理和沙盒执行,实现基于大语言模型的地理空间开放政府数据交互,在430个数据集上达到98%分析正确率和94%召回率,有效减少幻觉风险。

Comments Author Accepted Manuscript (AAM). Proceedings of 2026 IEEE CAI (Granada, Spain). Update manuscript with final DOI. Code & data available at: https://github.com/ethz-coss/ogd4all

Journal ref 2026 IEEE Conference on Artificial Intelligence (CAI), pp. 882-888

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23403 2026-06-23 cs.AI 新提交 57%

Litmus: Zero-Label, Code-Driven Metric Specification for Evaluating AI Systems

Litmus: 零标注、代码驱动的AI系统评估指标规范

Prajjwal Gupta, Prasang Gupta, Vishal Bhutani, Apoorva Sharma, Sumanth Chundru, Waqar Sarguroh, Kevin Paul

机构 * PricewaterhouseCoopers, U.S.(普华永道(美国))

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 提出Litmus系统,通过分析源代码自动生成评估指标,无需人工标注,在三个真实AI流水线上优于基线方法。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23321 2026-06-23 cs.CL 新提交 57%

Tmax: A simple recipe for terminal agents

Tmax: 终端智能体的简单配方

Hamish Ivison, Junjie Oscar Yin, Rulin Shao, Teng Xiao, Nathan Lambert, Hannaneh Hajishirzi

机构 * Allen Institute for AI(人工智能研究院) University of Washington(华盛顿大学)

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 提出Tmax配方,通过新颖分类法生成数据并结合结果奖励的强化学习,在9B参数下达到27%的Terminal-Bench 2.0性能,超越先前更大模型。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22704 2026-06-23 cs.CR cs.SE 新提交 57%

VeriPort: Automated and Verified Patch Backporting at Scale

VeriPort: 自动化且经过验证的大规模补丁回溯

Jonah Ghebremichael, Wenxin Jiang, Mikola Lysenko, Benjamin Barslev Nielsen, William Enck, Alexandros Kapravelos

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 提出VeriPort系统,自动化将安全补丁回溯到受影响的所有版本,并通过证据链验证补丁有效性和功能保留,在BackportBench上达到95.3%成功率,比现有方案高22.7个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17392 2026-06-23 cs.SE 57%

PLC-BinX: A Cross-Platform Binary Code Analysis Framework for PLC Binaries

更进一步:通过跨平台反向工程和函数级语义分析理解PLC二进制

Ang Jia, Yaxin Duan, He Jiang, Zhenzhou Tian, Zhilei Ren, Xiaochen Li

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 本文提出PLC-BinX,一种用于跨平台PLC二进制理解的二进制代码分析工作流,通过跨平台反向工程、核心函数提取和函数级语义表示构建,实现了对PLC二进制的深入理解,并在工具链预测和功能预测任务中取得了优异的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21931 2026-06-23 econ.TH 新提交 50%

Three Barriers to Kantian Cooperation under Inequality

不平等条件下康德合作的三个障碍

Igor Sloev, Gerasimos Lianos

专题命中 软件智能体 :agent(abstract)

AI总结 本文通过一个两人自愿提供公共品的模型,识别了不平等条件下自愿采纳康德合作的三个障碍:帕累托改进缺失、策略空间参数化的分配冲突以及帕累托前沿上的协调问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21658 2026-06-23 hep-ex astro-ph.IM hep-ph 新提交 50%

Towards LLM-Powered Automation of a Dark Matter Constraint Repository

基于大语言模型的暗物质约束库自动化

Lanqing Yuan, Karthik Ramanathan

专题命中 软件智能体 :agentic(abstract)

AI总结 提出一个LLM流水线,从arXiv论文中提取暗物质约束曲线并生成拉取请求,在基准测试中达到90.5%的耦合类型分类准确率和0.33 dex的中位残差。

详情

展开后加载摘要…

URL PDF HTML 收藏