arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-25 至 2026-06-25 共收录 11 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 11 篇

2509.06216 2026-06-25 cs.SE cs.AI 版本更新 84%

Agentic Software Engineering: Foundational Pillars and a Research Roadmap

代理软件工程:基础支柱与研究路线图

Ahmed E. Hassan, Hao Li, Dayi Lin, Bram Adams, Tse-Hsun Chen, Yutaro Kashiwa, Dong Qiu

机构 * Queen's University(女王大学) Concordia University(Concordia大学) Nara Institute of Science and Technology(奈ara科学和技术研究院) Huawei Canada(华为加拿大)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 提出代理软件工程(SE 3.0)时代,以“面向人类的SE”和“面向代理的SE”双重模式为基础,重新定义软件工程支柱,并设计代理命令环境(ACE)和代理执行环境(AEE)两种工作台,实现双向人机协作,推动从代理编码到真正代理软件工程的演进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29919 2026-06-25 cs.SE 版本更新 79%

SkillReducer: Optimizing LLM Agent Skills for Token Efficiency

SkillReducer: 优化LLM代理技能的令牌效率

Yudong Gao, Zongjie Li, Yuanyuan Yuan, Zimo Ji, Pingchuan Ma, Shuai Wang

专题命中 软件智能体 :agent(title,abstract);分类 cs.SE

AI总结 针对LLM代理技能中令牌浪费问题,提出SkillReducer两阶段优化框架,通过压缩路由描述和重构技能主体,实现48%描述压缩和39%主体压缩,同时提升功能质量2.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24965 2026-06-25 cs.AI cs.LG 新提交 73%

Project Auto-World: Towards Automated Benchmarking of Neural Relational Reasoners

Project Auto-World: 迈向神经关系推理器的自动化基准测试

Anirban Das, Joanne Boisson, Irtaza Khalid, Sumita Garai, Steven Schockaert

机构 * Cardiff University(卡迪夫大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 软件智能体 :autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 利用大语言模型自动化生成基准测试实例,通过进化搜索和自主代理搜索发现困难样本,提升Edge Transformer的泛化能力,并应用于新世界以推动神经关系推理的自主研究。

Comments Submitted to NeurIPS 2026 E&D track. Code is available at https://github.com/autoworldrules/auto-world-rules

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15834 2026-06-25 cs.AI cs.CR cs.SY eess.SY 新提交 70%

AIChilles: Automatically Uncovering Hidden Weaknesses in AI-Evolved Systems

AIChilles:自动发现AI进化系统中的隐藏弱点

Yajie Zhou, Ao Li, Ashwin Silla, Zaoxing Liu, Vyas Sekar

机构 * Carnegie Mellon University(卡内基梅隆大学) Boston University(波士顿大学)

专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 提出AIChilles框架,通过结合确定性工作负载参数提取、基于代理的约束推断、差异预言机和代码频率覆盖,自动发现AI进化程序在正确性、运行时、内存使用或输出质量上相对于基线程序的回归问题,在5个系统应用和30个AI进化程序中发现49个隐藏弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01708 2026-06-25 cs.DC cs.AI cs.LG 版本更新 62%

SplitZip: Ultra Fast Lossless KV Compression for Disaggregated LLM Serving

SplitZip:超快无损KV压缩用于解耦的大语言模型服务

Yipin Guo, Siddharth Joshi

机构 * University of Notre Dame IN, USA(诺丁汉大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 SplitZip通过GPU友好的无损压缩技术,提升大规模LLM服务中KV缓存的传输效率,实现快速压缩和解压,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11988 2026-06-25 cs.SE cs.AI 版本更新 62%

Evaluating AGENTS.md: Are Repository-Level Context Files Helpful for Coding Agents?

评估 AGENTS.md:仓库级上下文文件对编码助手有帮助吗?

Thibaud Gloaguen, Niels Mündler, Mark Müller, Veselin Raychev, Martin Vechev

机构 * Department of Computer Science(计算机科学系) ETH Zurich(苏黎世联邦理工学院)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 通过SWE-bench任务和开发者提交的上下文文件,评估发现上下文文件并未普遍提升编码助手的任务成功率,反而平均增加20%以上的推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26094 2026-06-25 cs.LG 新提交 57%

RevengeBench: Reverse Engineering Code-Space Policies from Behavioral Experiments

RevengeBench: 从行为实验中逆向工程代码空间策略

Babak Rahmani, Sebastian Dziadzio, Joschka Strüber, Sergio Hernández-Gutiérrez, Matthias Bethge

机构 * Tübingen AI Center(图宾根人工智能中心)

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 提出RevengeBench基准,通过行为轨迹和可控实验逆向工程LLM生成的策略代码,验证恢复质量在34-72%之间,并能提升下游对战胜率。

Comments 12 pages, 5 figures, 22 appendix pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25879 2026-06-25 cs.DC cs.AI 新提交 57%

AI-Assisted Computational Reproducibility on the FABRIC Testbed

AI辅助计算可复现性在FABRIC试验台上的研究

Komal Thareja, Paul Ruth, Berent Aldikacti, Michael Zink

机构 * RENCI, University of North Carolina at Chapel Hill, NC, USA(RENCI,北卡罗来纳大学教堂山分校) University of Massachusetts Amherst, MA, USA(马萨诸塞大学阿姆赫斯特分校)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI

AI总结 利用FABRIC试验台和LLM编码助手LoomAI,通过三个跨领域案例研究,展示了AI辅助工作流将复现实验的工作量减少约4-6倍,但在分析阶段仍需人工指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25550 2026-06-25 cs.SE 新提交 57%

On the Viability of Requirements Generation From Code: An Experience Report

从代码生成需求的可行性:经验报告

Alexander Korn, Jone Bartel, Max Unterbusch, Andreas Vogelsang

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 本文通过实验评估基于LLM和RAG的代理方法从源代码生成需求,发现LLM无法可靠生成未实现需求、高质量需求或引入需求气味,且单一人工难以检测气味,表明该方法尚不可行。

Comments Accepted for publication at the 13th International Workshop on Artificial Intelligence and Requirements Engineering (AIRE'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25195 2026-06-25 cs.CR cs.AI 新提交 57%

SoK: AI Secure Code Generation: Progress, Pitfalls, and Paths Forward

SoK:AI安全代码生成:进展、陷阱与前进之路

Rupam Patir, Keyan Guo, Haipeng Cai, Hongxin Hu

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 本文系统化分析AI安全代码生成的进展、陷阱与前进方向,提出三层次框架衡量模型对安全编码原则的理解、代码级执行及两者间的知识-执行差距,发现原则理解是代码安全性的强预测因子,但存在显著知识-执行差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25244 2026-06-25 cs.PL 新提交 50%

Reading AI Model Compilation in MLIR Through the Lens of Formal Theories

通过形式理论的视角解读MLIR中的AI模型编译

Javed Absar

专题命中 软件智能体 :agent(abstract)

AI总结 本文通过形式理论(如项重写系统、精化演算、抽象解释)对应MLIR的匹配-重写引擎、阶段降低和范围分析,论证形式概念有助于明确抽象完备性、理想设计及实际权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏