arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-29 至 2026-05-29 共收录 13 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 13 篇

2605.29354 2026-05-29 cs.CR cs.LG 90%

Harmless Yet Harmful: Neutral Prompting Attacks for Stealthy Hallucination Steering in Agent Skills

无害却有害:针对Agent技能中隐蔽幻觉引导的中性提示攻击

Chia-Yi Hsu, Chia-Mu Yu, Chun-Ying Huang, Jun Sakuma

机构 * Department of Computer Science(计算机科学系) National Yang Ming Chiao Tung University(阳明交通大学) Department of Electronics and Electrical Engineering(电子与电气工程系) School of Computing(计算学院) Institute of Science Tokyo(东京科学研究所)

专题命中 软件智能体 :agent(title,title_cn);分类 cs.LG

AI总结 本文提出中性提示攻击(NPA),通过语义上看似无害的指令(如鼓励想象和详尽性)增加代码生成Agent的包幻觉倾向,从而引入软件供应链风险,并评估了其对多种编码LLM的有效性和逃避防御的能力。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29442 2026-05-29 cs.SE cs.AI cs.HC 81%

How Coding Agents Fail Their Users: A Large-Scale Analysis of Developer-Agent Misalignment in 20,574 Real-World Sessions

编码助手如何辜负用户:基于20,574个真实会话的开发人员与智能体不一致的大规模分析

Ningzhi Tang, Chaoran Chen, Gelei Xu, Yiyu Shi, Yu Huang, Collin McMillan, Tao Dong, Toby Jia-Jun Li

机构 * University of Notre Dame(诺丁汉大学) Vanderbilt University(范德比大学) Google(谷歌)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 通过对20,574个编码助手会话的分析,识别出七种常见的不一致形式,发现大多数不一致导致信任成本而非系统损坏,且多数仍需用户显式纠正。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14150 2026-05-29 cs.AI cs.LG cs.NE 76%

CodeEvolve: an open source evolutionary coding agent for algorithmic discovery and optimization

CodeEvolve:用于算法发现和优化的开源进化编码智能体

Henrique Assumpção, Diego Ferreira, Leandro Campos, Fabricio Murai

机构 * Inter Science - Inter&Co Federal University of Minas Gerais(联邦大学伯南迪斯) Worcester Polytechnic Institute(沃思彻斯特理工大学)

专题命中 软件智能体 :agent(title);分类 cs.AI、cs.LG

AI总结 提出CodeEvolve开源框架,结合大语言模型与岛屿进化搜索,通过灵感交叉、元提示和深度细化,在AlphaEvolve基准上匹配或超越5/9问题,并在匹配条件下优于OpenEvolve和ShinkaEvolve,以更低成本超越前沿闭源集成。

Comments 21 pages, 16 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30353 2026-05-29 cs.AI astro-ph.CO cs.HC cs.SE 74%

Physics Is All You Need? A Case Study in Physicist-Supervised AI Development of Scientific Software

物理学就是一切?物理学家监督人工智能开发科学软件的案例研究

Nhat-Minh Nguyen

机构 * Kavli IPMU (WPI), UTIAS, The University of Tokyo(Kavli研究所(WPI)、UTIAS、东京大学) Center for Data-Driven Discovery(数据驱动发现中心) Institute For Interdisciplinary Research in Science(科学跨学科研究中心)

专题命中 软件智能体 :AI agent(abstract,comments);agent(abstract);分类 cs.AI、cs.SE

AI总结 通过一个物理学家监督AI编码代理开发可微扰动理论模块的案例,研究AI代理在科学软件开发中的可靠性,发现监督设计比模型能力更能决定输出可信度。

Comments 10 pages, 2 figures, 2 tables, 1 physicist and a few AI agents. Accepted by ICML 2026 AI for Science Workshop. Code and development log are available at this repo: https://github.com/MinhMPA/clax-pt

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29372 2026-05-29 cs.SE 70%

On the Road to Personalized Code Intelligence: Portraiting and Assisting Developers Based on Their In-IDE Behaviors

通往个性化代码智能之路:基于IDE内行为的开发者画像与辅助

Yuhong Liu, Yunhe Su, Zhipeng Peng, Zhiwen Luo, Lin Shi, Zhi Jin, Li Zhang

专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.SE

AI总结 提出VirtualME数据基础设施,通过捕获和解释开发者在IDE中的动态编程行为,构建四维开发者画像,并集成到问答代理中实现个性化代码智能,实验显示平均提升33.80%。

Comments 23 pages, 6 figures, accepted by FSE`2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00991 2026-05-29 cs.AI cs.PL 70%

Tracking Capabilities for Safer Agents

更安全智能体的追踪能力

Martin Odersky, Yaoyu Zhao, Yichen Xu, Oliver Bračevac, Cao Nguyen Pham

机构 * EPFL(苏黎世联邦理工学院)

专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 提出通过Scala 3的捕获检查类型系统静态追踪能力,构建基于编程语言的智能体安全约束,防止信息泄露和恶意副作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30345 2026-05-29 cs.AI cs.CL cs.LG 67%

SchGen: PCB Schematic Generation with Semantic-Grounded Code Representations

SchGen: 基于语义接地代码表示的PCB原理图生成

Qinpei Luo, Ruichun Ma, Xinyu Zhang, Lili Qiu

机构 * University of California, San Diego(加州大学圣地亚哥分校) Microsoft Research Asia(微软亚洲研究院) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出SchGen,首个从自然语言请求生成可编辑PCB原理图的大语言模型,通过语义接地代码表示将几何驱动问题转化为语义驱动匹配任务,并构建大规模数据集,在连线准确性和功能正确性上显著优于现有方法。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29277 2026-05-29 cs.SE cs.AI 62%

Code-QA-Bench: Separating Code Reasoning from Documentation Memorization in Repository-Level QA

Code-QA-Bench:在仓库级问答中分离代码推理与文档记忆

Jun Zhang, JianYing Qu, Hanwen Du, Zhongkai Sun, Yehua Yang, Qiao Zhao

机构 * Baidu Inc(百度公司)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出Code-QA-Bench框架,通过答案优先生成和三条件实验设计,自动构建仓库级代码理解基准,以区分代码推理、文档回忆和预训练记忆的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28876 2026-05-29 cs.SE cs.AI 62%

LogDx-CI: Benchmarking Log Reduction Tools for LLM Root-Cause Diagnosis

LogDx-CI:为LLM根因诊断基准测试日志缩减工具

Bowen Qin

机构 * National University of Singapore(新加坡国立大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出LogDx-CI基准,比较11种日志缩减工具在35个真实CI故障案例上的效果,发现混合grep+tail路由器在成本质量上占优,且智能体循环可缩小质量差距但成本差异持续存在,同时跨家族LLM摘要器优于同家族。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11088 2026-05-29 cs.AI cs.CL 62%

Guardrails Beat Guidance: A Large-Scale Study of Rules, Skills, and Persistent Configuration for Coding Agents

护栏优于指导:关于编码智能体的规则、技能和持久配置的大规模研究

Xing Zhang, Guanghui Wang, Yanwei Cui, Wei Qiu, Ziyuan Li, Bing Zhu, Peiyang He

机构 * AWS Generative AI Innovation Center(AWS生成式人工智能创新中心) HSBC Holdings Plc., HSBC Technology Center, China(汇丰控股有限公司,汇丰技术中心,中国)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 通过大规模实验发现,随机规则与专家规则对编码智能体性能提升相当,且有益规则均为负面约束,有害规则均为正面指令,提出应使用约束而非指导来配置智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16077 2026-05-29 cs.PL cs.LG 57%

CompilerDream: Learning a Compiler World Model for General Code Optimization

CompilerDream: 学习编译器世界模型以实现通用代码优化

Chaoyi Deng, Jialong Wu, Ningya Feng, Jianmin Wang, Mingsheng Long

机构 * School of Software, BNRist Tsinghua University Beijing China(软件学院、北师大清华大学北京中国) Tsinghua University(清华大学)

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 提出基于模型的强化学习方法CompilerDream,通过编译器世界模型模拟优化pass属性并训练智能体,实现跨应用场景和语言的通用代码优化,在零样本泛化上超越LLVM内置优化。

Comments KDD 2025 camera-ready version with extended appendix. Code is available at https://github.com/thuml/CompilerDream. This update additionally fixes an issue in Table 6 where the dataset names in three rows were ordered incorrectly

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29522 2026-05-29 cs.AI 57%

DeepSurvey: Enhancing Analytical Depth and Citation Reliability in Automated Survey Generation

DeepSurvey: 提升自动综述生成中的分析深度与引用可靠性

Ziyue Yang, Da Ma, Hanqi Li, Zijian Wang, Tiancheng Huang, Zijian Hu, Chenrun Wang, Yunzhe Zhang, Xiaobao Wu, Kai Yu, Lu Chen

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院X-LANCE实验室) Jiangsu Key Lab of Language Computing, Suzhou, China(江苏省语言计算重点实验室) Suzhou Laboratory, Suzhou, China(苏州实验室)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 提出DeepSurvey智能体系统,通过结构化全文笔记、跨论文关系建模和代码仓库分析增强分析深度,结合引文图扩展与混合过滤、证据约束引用分配及多粒度智能体精炼提升引用可靠性,在内容质量和引用准确性上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09569 2026-05-29 cs.SE 57%

MigrationBench: Repository-Level Code Migration Benchmark from Java 8

MigrationBench:从Java 8的仓库级代码迁移基准

Linbo Liu, Xinle Liu, Qiang Zhou, Lin Chen, Yihan Liu, Hoan Nguyen, Behrooz Omidvar-Tehrani, Xi Shen, Jun Huan, Omer Tripp, Anoop Deoras

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 提出MigrationBench基准,用于评估大语言模型在从Java 8迁移到Java 17/21的仓库级代码迁移任务上的表现,并设计了智能体框架实现高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏