arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-28 至 2026-04-28 共收录 16 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 16 篇

2604.23088 2026-04-28 cs.SE cs.AI cs.CL cs.PL 89%

Code Broker: A Multi-Agent System for Automated Code Quality Assessment

Code Broker:一个用于自动化代码质量评估的多智能体系统

Samer Attrah

机构 * Independent researcher(独立研究者) California, USA(美国加州)

专题命中 软件智能体 :agent(title,abstract);multi-agent(title);分类 cs.AI、cs.CL、cs.SE

AI总结 Code Broker通过多智能体架构对Python代码进行分析并生成质量评估报告,结合LLM推理与静态分析工具,提升代码审查的效率与准确性。

Comments 8 pages, 1 figure, 2 tables, 28 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24450 2026-04-28 cs.SE 85%

On the Footprints of Reviewer Bots Feedback on Agentic Pull Requests in OSS GitHub Repositories

审查员机器人反馈在OSS GitHub仓库中代理拉取请求的足迹

Syeda Kaneez Fatima, Yousuf Abrar, Abdul Rehman Tahir, Amelia Nawaz, Shamsa Abid, Abdul Ali Bangash

专题命中 软件智能体 :agentic(title,abstract);AI agent(abstract);workflow(abstract);分类 cs.SE

AI总结 研究探讨审查员机器人反馈质量与数量对代理拉取请求接受和解决时间的影响,发现反馈质量下降与评论数量增加相关,建议优先提供高相关性反馈。

Comments 5 pages, 3 figures, 1 table, Mining Software Repositories (MSR'26) Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24212 2026-04-28 cs.SE 84%

Empowering Autonomous Debugging Agents with Efficient Dynamic Analysis

通过高效动态分析赋能自主调试代理

Jiahong Xiang, Xiaoyang Xu, Xiaopan Chu, Hongliang Tian, Yuqun Zhang

专题命中 软件智能体 :agent(summary_cn,abstract);autonomous agent(abstract);分类 cs.SE

AI总结 本文提出Agent-centric Debugging Interface,通过函数级交互和Frame Lifetime Trace提升自主调试代理效率,在SWE-bench验证集上实现63.8%的任务解决率,成本仅为1.28美元/任务。

Comments Accepted to the ACM International Conference on the Foundations of Software Engineering (FSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23080 2026-04-28 cs.MA cs.AI cs.DC 83%

Usable Agent Discovery for Decentralized AI Systems

用于去中心化人工智能系统的可用代理发现

Patrizio Dazzi, Emanuele Carlini, Matteo Mordacchini, Saul Urso

机构 * Department of Computer Science(计算机科学系) University of Pisa(比萨大学) Institute of Information Science and Technologies(信息科学与技术研究所) National Research Council of Italy(意大利国家研究理事会) Institute of Informatics and Telematics(信息学与电信研究所)

专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 本文研究了在双层 churn 情况下去中心化代理发现,比较了不同机制在路由效率、鲁棒性和服务准备度方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23002 2026-04-28 cs.AI cs.CL 81%

FormalScience: Scalable Human-in-the-Loop Autoformalisation of Science with Agentic Code Generation in Lean

FormalScience: 基于代理代码生成的可扩展人类在环科学自动形式化

Jordan Meadows, Lan Zhang, Andre Freitas

机构 * University of Manchester, UK(英国曼彻斯特大学) Idiap Research Institute, Switzerland(瑞士Idiap研究所) National Biomarker Centre, CRUK-MI, UK(英国国家生物标志物中心,CRUK-MI)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 FormalScience通过人类在环的代理流程,使非专业领域专家以低成本生成形式化证明,构建了包含200个大学物理问题及解决方案的FormalPhysics数据集,并探讨了现代LLM在自动形式化中的局限性。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24657 2026-04-28 cs.CR cs.AI 79%

AgentWard: A Lifecycle Security Architecture for Autonomous AI Agents

AgentWard: 为自主AI代理设计的生命周期安全架构

Yixiang Zhang, Xinhao Deng, Jiaqing Wu, Yue Xiao, Ke Xu, Qi Li

专题命中 软件智能体 :AI agent(title,abstract);分类 cs.AI

AI总结 本文提出AgentWard架构,通过跨层协调实现对自主AI代理五个阶段的安全防护,展示了一个原型实现,为运行时安全控制提供了具体蓝图。

Comments 7 pages, 1 figure;

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14635 2026-04-28 cs.CL cs.PL cs.SE 79%

SWE-QA: Can Language Models Answer Repository-level Code Questions?

SWE-QA: 语言模型能否回答仓库级代码问题?

Weihan Peng, Yuling Shi, Yuhang Wang, Xinyun Zhang, Beijun Shen, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 软件智能体 :agent(abstract,abstract_cn);agentic(abstract);分类 cs.CL、cs.SE

AI总结 本文提出SWE-QA基准,旨在研究自动化QA系统在真实代码环境中的能力,包含576个高质量问题对,涵盖意图理解、跨文件推理和多跳依赖分析,评估六种先进LLM在不同上下文增强策略下的表现。

Comments Accepted to ACL 2026 Findings. Code and data available at https://github.com/peng-weihan/SWE-QA-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02450 2026-04-28 cs.CV 78%

GCP: Guarded Collaborative Perception with Spatial-Temporal Aware Malicious Agent Detection

GCP: 带空间-时间感知恶意代理检测的防护协作感知

Yihang Tao, Senkang Hu, Yue Hu, Haonan An, Hangcheng Cao, Yuguang Fang

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Department of Robotics, University of Michigan(密歇根大学机器人系)

专题命中 软件智能体 :agent(title,abstract)

AI总结 本文提出GCP框架,通过空间-时间感知恶意代理检测提升协作感知安全性,采用置信度加权空间一致性损失和联合空间-时间Benjamini-Hochberg检验,有效应对恶意代理攻击,实验显示在BAC攻击下AP@0.5提升34.69%。

Comments Accepted by IEEE TDSC

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23674 2026-04-28 cs.AI 77%

Vibe Medicine: Redefining Biomedical Research Through Human-AI Co-Work

Vibe Medicine:通过人机协作重新定义生物医学研究

Zihao Wu, Steven Xu, Bowen Chen, Shaowen Wan, Yiwei Li, Wei Ruan, Yanjun Lyu, Siyuan Li, Dajiang Zhu, Tianming Liu, Lin Zhao

机构 * School of Computing, University of Georgia(佐治亚大学计算学院) Department of Biomedical Engineering, New Jersey Institute of Technology(新泽西理工学院生物医学工程系) Department of Computer Science and Engineering, University of Texas at Arlington(德克萨斯大学阿灵顿分校计算机科学与工程系)

专题命中 软件智能体 :agent(abstract,abstract_cn);AI agent(abstract);分类 cs.AI

AI总结 本文提出Vibe Medicine,通过自然语言指导AI代理执行复杂生物医学流程,解决多领域数据整合与分析难题,提升研究效率与公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09388 2026-04-28 cs.SE cs.AI 74%

The AI Codebase Maturity Model: From Assisted Coding to Fully Autonomous Systems

AI代码库成熟度模型:从辅助编码到完全自主系统

Andy Anderson

机构 * IBM Research — Hybrid Cloud and AI Platform(IBM混合云和人工智能平台研究院)

专题命中 软件智能体 :agent(abstract,comments);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出AI代码库成熟度模型(ACMM),通过100天经验报告和Hive系统验证,展示代码库从基础AI辅助到完全自主的六级进化框架,强调测试覆盖率和反馈机制是关键因素。

Comments 30 pages, 7 tables. v2: Extended to 6 levels. Added Level 6 (Fully Autonomous), Hive reference implementation, Beads for agent memory continuity, throughput acceleration data. Metrics updated to 100 days. Source: https://github.com/kubestellar/console and https://github.com/kubestellar/hive

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23106 2026-04-28 cs.SE cs.AI cs.MA 73%

No Test Cases, No Problem: Distillation-Driven Code Generation for Scientific Workflows

无测试用例,无问题:基于知识蒸馏的科学工作流代码生成

Siddeshwar Raghavan, Tanwi Mallick

机构 * Purdue University(普渡大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出MOSAIC框架,通过知识蒸馏和结构化问题分解实现无测试用例的科学代码生成,提升准确性和执行精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13240 2026-04-28 cs.SE cs.AI cs.CL cs.LG 70%

KOCO-BENCH: Can Large Language Models Leverage Domain Knowledge in Software Development?

KOCO-BENCH: 大型语言模型能否在软件开发中利用领域知识?

Xue Jiang, Ge Li, Jiaru Qian, Xianjie Shi, Chenjie Li, Hao Zhu, Ziyu Wang, Jielun Zhang, Zheyu Zhao, Lingwei Wu, Kechi Zhang, Jia Li, Wenpin Jiao, Zhi Jin, Yihong Dong

机构 * School of Computer Science, Peking University(北京大学计算机科学系) School of Computer Science, Wuhan University(武汉大学计算机科学系)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 KOCO-BENCH旨在评估大型语言模型在软件开发中利用领域知识的能力,包含6个新兴领域、11个软件框架和25个项目,通过多粒度任务测试模型的知识获取与应用能力。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23251 2026-04-28 cs.SE cs.AI 62%

AI-Assisted Code Review as a Scaffold for Code Quality and Self-Regulated Learning: An Experience Report

AI辅助代码审查作为代码质量和自主学习的支架:经验报告

Eduardo Oliveira, Michael Fu, Patanamon Thongtanunam, Sonsoles López-Pernas, Mohammed Saqr

机构 * The University of Melbourne(墨尔本大学) University of Eastern Finland(东芬兰大学)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 本文探讨了AI辅助代码审查在软件工程教育中的应用,通过混合方法设计分析了学生自主学习过程,发现工具优化后技术问题显著减少,且AI审查的响应率稳定,提出了AI审查在教育中的设计和教学建议。

Comments 11 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23027 2026-04-28 cs.AI 57%

A Systematic Approach for Large Language Models Debugging

大语言模型调试的系统方法

Basel Shbita, Anna Lisa Gentile, Bing Zhang, Sungeun An, Shailja Thakur, Shubhi Asthana, Yi Zhou, Saptha Surendran, Farhan Ahmed, Rohan Kulkarni, Yuya Jeremy Ong, Chad DeLuca, Hima Patel

机构 * IBM Research(IBM研究院)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出系统化方法用于大语言模型调试,通过统一评估、可解释性和错误分析,帮助开发者迭代诊断模型弱点,优化提示和参数,并适应数据进行微调或评估,尤其在缺乏标准化基准时仍有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24120 2026-04-28 cs.DS 50%

New Convex Programming Technique for Nash Social Welfare and Scheduling

新的凸编程技术用于纳什社会福利与调度问题

Yuda Feng, Weijiang Hu, Shi Li

专题命中 软件智能体 :agent(abstract)

AI总结 本文提出了一种新的凸编程方法,用于解决加权纳什社会福利问题,通过Feng和Li的舍入算法达到(e^{1/e})近似比。该方法将指数规模的配置线性规划转换为多项式规模的紧凑线性规划,解决了标准线性规划求解问题。

Comments Accepted in ICALP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21436 2026-04-28 cs.CR 50%

A Stackelberg Model for Hybridization in Cryptography

密码学中混合策略的Stackelberg模型

Willie Kouam, Stefan Rass, Zahra Seyedi, Shahzad Ahmad, Eckhard Pfluegel

专题命中 软件智能体 :agent(abstract)

AI总结 本文提出基于Stackelberg博弈的密码学混合策略模型,分析防御方在资源约束下选择加密算法与攻击方选择密码分析方法的互动,通过动态规划和线性规划解决安全与成本平衡问题。

Comments 27 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏