arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-05-19 至 2026-05-19 共收录 6 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 软件智能体 6 篇

2605.18583 2026-05-19 cs.SE cs.AI cs.CL cs.CR 82%

Overeager Coding Agents: Measuring Out-of-Scope Actions on Benign Tasks

过度激进的编码代理:在良性任务中测量超出范围的动作

Yubin Qu, Ying Zhang, Yanjun Zhang, Gelei Deng, Yuekang Li, Leo Yu Zhang, Yi Liu

机构 * Griffith University(格里菲斯大学) Wake Forest University(威克森林大学) Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学) Quantstamp

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.CL、cs.AI

AI总结 本文提出OverEager-Gen基准,用于评估编码代理在良性任务中超出范围的行为。研究发现,当基准中明确列出授权范围时,代理会停止推断边界并开始匹配声明文本,从而影响测量有效性。通过行为梯度验证器和双通道堆栈审计内部工具调用,验证了不同框架下的过度激进行为差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17526 2026-05-19 cs.SE cs.AI 81%

SaaSBench: Exploring the Boundaries of Coding Agents in Long-Horizon Enterprise SaaS Engineering

SaaSBench: 探索编码代理在长周期企业SaaS工程中的边界

Qingnan Ren, Shun Zou, Shiting Huang, Ziao Zhang, Kou Shi, Zhen Fang, Yiming Zhao, Yu Zeng, Qisheng Su, Lin Chen, Yong Wang, Zehui Chen, Xiangxiang Chu, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) AMAP, Alibaba Group(阿里云实验室)

专题命中 软件智能体 :coding agent(title,abstract);分类 cs.SE、cs.AI

AI总结 本文提出SaaSBench,首个针对企业SaaS工程的基准,旨在探索AI代理在复杂系统中的边界,通过30个任务和5370个验证节点,涵盖8种编程语言、6种数据库和13种框架,揭示了当前最先进代理在多组件系统配置和集成中的主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18684 2026-05-19 cs.SE cs.AI 73%

Reversa: A Reverse Documentation Engineering Framework for Converting Legacy Software into Operational Specifications for AI Agents

Reversa:一个用于将遗留软件转换为AI代理操作规范的反向文档工程框架

Sanderson Oliveira de Macedo, Ronaldo Martins da Costa

机构 * Federal Institute of Goias(戈亚斯联邦理工学院) Federal University of Goias(戈亚斯联邦大学)

专题命中 软件智能体 :software agent(abstract);coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文提出Reversa框架,旨在通过反向文档工程将遗留软件转换为AI代理可操作的规范,通过多代理流水线流程提取隐含规则,生成可追溯的操作规范,并提出评估协议以衡量覆盖率、可追溯性、置信度、效用和成本。

Comments Preprint. Includes a generative AI use statement

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17242 2026-05-19 cs.SE 57%

From Runnable to Shippable: Multi-Agent Test-Driven Development for Generating Full-Stack Web Applications from Requirements

从可运行到可发布:多智能体测试驱动开发用于从需求生成全栈Web应用

Yuxuan Wan, Tingshuo Liang, Jiakai Xu, Jingyu Xiao, Yintong Huo, Michael R Lyu

专题命中 软件智能体 :coding agent(abstract);分类 cs.SE

AI总结 本文提出TDDev框架,通过三个阶段自动化测试驱动开发流程,提升Web应用生成质量,发现最佳协议取决于模型生成风格,且TDDev显著减少人工干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16827 2026-05-19 cs.AI 57%

Voices in the Loop: Mapping Participatory AI

循环中的声音:参与式AI的映射

Rashid Mushkani

机构 * Right to AI(人工智能权利) Mila -- Québec AI Institute(魁北克人工智能研究所)

专题命中 软件智能体 :repository(abstract);分类 cs.AI

AI总结 本文研究了参与式AI在公共、公民和人道主义领域的应用,提出了一个开放的参与式AI倡议存储库和交互式地图集,通过整合Maga~na和Shilton的可信AI语料库以及额外的审计案例,揭示了参与式AI在地理分布、参与层级、生命周期、组织形式、验证状态和文档缺口等方面的模式,并展示了如何通过版本发布、记录链接的问题和注释通道、模式反馈流程和删除或限制披露请求来实现参与式AI基础设施的设计和治理框架。

Comments Accepted to The 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26), June 25--28, 2026, Montreal, QC, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16300 2026-05-19 cs.CY cs.AI cs.MA cs.RO 57%

Consent Chain Degradation in Embodied Multi-Agent Systems: Bridging the Gap Between AI Agent Governance and Robot Ethics

具身多智能体系统中的同意链退化:弥合人工智能代理治理与机器人伦理之间的鸿沟

Mehmet Haklidir

机构 * Artificial Intelligence Institute, TÜBİTAK BİLGEM(人工智能研究所,TÜBİTAK BİLGEM)

专题命中 软件智能体 :software agent(abstract);分类 cs.AI

AI总结 本文提出同意链退化(CCD)概念,探讨多机器人委托链中人类同意的具体性、有效性及范围如何退化,并通过医疗、家庭和工业机器人场景展示其实际表现,分析现有法规对CCD核心维度的缺失。

Comments Accepted for oral presentation at the 2nd Workshop on Robot Ethics (WoRoBet), ICRA 2026, Vienna, Austria, June 1, 2026. 6 pages, 3 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏