arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-28 至 2026-05-28 共收录 14 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 14 篇

2605.27531 2026-05-28 cs.PL cs.CL cs.SE 89%

Agentic Separation Logic Specification Synthesis

智能体分离逻辑规范合成

Tarun Suresh, David Korczynski, Julien Vanegue

机构 * Bloomberg(贝莱德)

专题命中 软件智能体 :agent(summary_cn,abstract);agentic(title,abstract);分类 cs.CL、cs.SE

AI总结 提出 Spec-Agent 智能体系统,通过静态分析、运行时堆追踪和反例引导迭代,为大型 C++ 代码库合成分离逻辑规范,在百万行级代码上达到 85% 有效规范合成率且无假阳性。

Comments 9 pages, 3 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28588 2026-05-28 cs.CR cs.AI 83%

Technical Report: Exploring the Emerging Threats of the Agent Skill Ecosystem

技术报告:探索智能体技能生态系统的新兴威胁

Luca Beurer-Kellner, Aleksei Kudrinskii, Marco Milanta, Kristian Bonde Nielsen, Hemang Sarkar, Liran Tal

机构 * Snyk

专题命中 软件智能体 :agent(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 本研究通过分析3984个AI智能体技能,发现76个恶意载荷,揭示了技能生态系统中的安全威胁,并提出了威胁分类和攻击模式。

Comments 10 pages, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08311 2026-05-28 cs.SE cs.AI 79%

Understanding Automated Program Repair Agents Through the Lens of Traceability: An Empirical Study

通过可追溯性视角理解自动化程序修复智能体:一项实证研究

Ira Ceka, Hailie Mitchell, Saurabh Pujar, Luca Buratti, Shyam Ramji, Junfeng Yang, Gail Kaiser, Baishakhi Ray

机构 * Columbia University(哥伦比亚大学) IBM Research(IBM研究院)

专题命中 软件智能体 :tool use(abstract);planning(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文通过追踪五个最先进的自动化程序修复智能体在500个真实世界修复任务中的决策流程,揭示了它们在逻辑密集型错误修复、测试生成和回归测试选择方面的关键局限性,并提出了改进方向。

Comments Accepted for publication (ISSTA '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27547 2026-05-28 cs.MA 78%

From Task Allocation to Risk Clearing: A Unifying Interface for Mixed Human-Agent Societies

从任务分配到风险清算:混合人机社会的统一接口

Vassilis Vassiliades

专题命中 软件智能体 :agent(title,abstract)

AI总结 提出风险感知选项清算(ROC)机制,通过将风险摘要与选项结合并由中央清算所优化风险调整任务效用,实现混合人机社会中异构代理的可扩展透明协调。

Comments Presented at EMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28617 2026-05-28 cs.AI cs.PL 77%

LACUNA: Safe Agents as Recursive Program Holes

LACUNA: 作为递归程序空洞的安全智能体

Yaoyu Zhao, Yichen Xu, Oliver Bračevac, Cao Nguyen Pham, Frank Zhengqing Wu, Martin Odersky

机构 * EPFL(苏黎世联邦理工学院)

专题命中 软件智能体 :agent(abstract,abstract_cn);planning(abstract);分类 cs.AI

AI总结 提出LACUNA编程模型,通过类型化调用和编译时检查,让LLM智能体以递归程序空洞的方式安全地编写代码,实现表达性与安全性的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28751 2026-05-28 cs.LG cs.AI cs.CL 75%

Extrapolative Weight Averaging Reveals Correctness-Efficiency Frontiers in Code RL

外推权重平均揭示代码强化学习中的正确性-效率前沿

Kunhao Zheng, Pierre Chambon, Juliette Decugis, Jonas Gehring, Taco Cohen, Benjamin Negrevergne, Gabriel Synnaeve

机构 * Meta Superintelligence Labs - FAIR(Meta超智能实验室 - FAIR)

专题命中 软件智能体 :tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 通过外推权重平均,无需额外RL训练即可扩展微调检查点间的帕累托前沿,在竞争性编程中实现正确性与效率的权衡,并提升推理时性能。

Comments 54 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24631 2026-05-28 cs.SE cs.AI 73%

Coherence Collapse: Diagnosing Why Code Agents Fail After Reaching the Right Code

一致性崩溃:诊断代码智能体在到达正确代码后失败的原因

Myeongsoo Kim, Dingmin Wang, Siwei Cui, Farima Farmahinifarahani, Terry Yue Zhuo, Shweta Garg, Baishakhi Ray, Rajdeep Mukherjee, Varun Kumar

机构 * AWS AI Labs(AWS AI实验室) Monash University(墨尔本大学)

专题命中 软件智能体 :agent(abstract,abstract_cn);分类 cs.AI、cs.SE

AI总结 通过轨迹分解分析,发现代码智能体在定位正确后仍因编辑质量缺陷(尤其是“一致性崩溃”)而失败,并提出了无需参考的共识驱动改进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26186 2026-05-28 cs.SE cs.AI cs.CL cs.LG 70%

SetupX: Can LLM Agents Learn from Past Failures in Functionality-Correct Code Repository Setup?

SetupX:LLM代理能否从过去的功能正确代码仓库设置失败中学习?

Zihang Zhou, Ziqian Ren, Yukai Wu, Yingjie Xiong, Wei Zhou, Chao Peng, Dong Zhang, Bingheng Yan, Xuanhe Zhou, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学) Independent Researcher(独立研究者) Jinan Inspur Data Technology Co., Ltd.(济南 Inspur 数据技术有限公司)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出SetupX框架,通过经验学习、推测执行和验证协议解决代码仓库设置中的跨仓库经验迁移、多步试错和鲁棒验证问题,在基准测试中达到92%通过率。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28515 2026-05-28 cs.SE cs.AI 62%

Do LLMs Favor Their Providers? Measuring Vertical Integration Bias in Code Generation

LLM 是否偏袒其提供商?测量代码生成中的垂直整合偏差

Melih Catal, Alex Wolf, Tiago Ferreiro Matos, Pooja Rani, Harald Gall

机构 * University of Zurich(苏黎世大学) University of Mannheim(曼海姆大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文提出 VIBench 基准,通过 20 个提供商可选的软件集成场景,测量前沿 LLM 在直接和代理代码生成中的垂直整合偏差,发现六成关联模型存在显著偏差,代理工作流加剧偏差至 +39.2 个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28122 2026-05-28 cs.CR cs.AI cs.CL 62%

SNARE: Adaptive Scenario Synthesis for Eliciting Overeager Behavior in Coding Agents

SNARE: 自适应场景合成以诱发编码代理中的过度行为

Yubin Qu, Yi Liu, Gelei Deng, Yanjun Zhang, Yuekang Li, Ying Zhang, Leo Yu Zhang

机构 * Griffith University(格里菲斯大学) Quantstamp Nanyang Technological University(南洋理工大学) UNSW Sydney(悉尼大学) Wake Forest University(卫斯理大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出SNARE流水线,通过组合良性场景片段并使用无评判器预言机评分与汤普森采样,自适应地诱发编码代理的过度行为,并在4×5代理-模型矩阵上评估,发现19.51%的良性运行触发过度行为,且代理框架比模型影响更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27908 2026-05-28 cs.CL cs.AI 62%

ESC-Skills: Discovering and Self-Evolving Skills for Emotional Support Conversations

ESC-Skills: 发现并自我进化情感支持对话技能

Jie Zhu, Huaixia Dou, Shuo Jiang, Junhui Li, Lifan Guo, Feng Chen, Chi Zhang, Fang Kong

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Qwen DianJin Team, Alibaba Cloud Computing(阿里云Qwen团队)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出ESC-Skills框架,通过干预单元建模支持交互并构建技能库,结合多轮廓自我进化机制,提升情感支持对话的可解释性、可控性和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27785 2026-05-28 cs.AI cs.DB 57%

A Query Engine for the Agents

面向智能体的查询引擎

Kenny Daniel

机构 * Hyperparam(Hyperparam公司)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 提出一个轻量级、JS原生、支持异步SQL和LLM UDF的查询引擎Hyperparam,用于在AI应用中分析非结构化文本,性能优于DuckDB-WASM。

Comments 4 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27499 2026-05-28 cs.LG astro-ph.CO astro-ph.IM physics.comp-ph stat.ML 57%

GenSBI: Generative Methods for Simulation-Based Inference in JAX

GenSBI: 基于JAX的模拟推断生成方法

Aurelio Amerio

机构 * Instituto de Física Corpuscular (IFIC) Universitat de València & CSIC(粒子物理研究所(IFIC)瓦伦西亚大学 & 西班牙国家科研委员会)

专题命中 软件智能体 :workflow(abstract);分类 cs.LG

AI总结 提出GenSBI库,在JAX中实现流匹配、分数匹配和去噪扩散等生成模型,用于模拟推断,提供统一接口和多种Transformer架构,并在标准基准上达到接近理想的C2ST分数。

Comments 48 pages + 1 appendix, 33 figures, 18 tables. For the associated Python code, see https://github.com/aurelio-amerio/GenSBI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17448 2026-05-28 cs.GR cs.CL 57%

Self-Improving CAD Generation Agents with Finite Element Analysis as Feedback

基于有限元分析反馈的自改进CAD生成智能体

Guijin Son, Jehyun Park, Seyeon Park, Sunghee Ahn, Youngjae Yu

机构 * Seoul National University(首尔国立大学) OneLineAI Sungkyunkwan University(成均馆大学) Ewha Womans University(成乙女子大学)

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 提出一种以有限元分析为反馈的CAD生成框架,通过蓝图和渲染图监督信号提升多部件装配质量,使生成结果满足工程需求。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏