arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-25 至 2026-05-25 共收录 9 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 9 篇

2605.23058 2026-05-25 cs.SE cs.AI 89%

A measurement substrate for agentic Kubernetes operations: Methodology and a case study in retrieval-compounding falsification

面向代理化 Kubernetes 操作的测量基础:方法论与检索复合证伪案例研究

Joshua Odmark, Gideon Rubin, Deon van der Vyver

机构 * Independent(独立) LDE Cognyx

专题命中 软件智能体 :agent(summary_cn,abstract);agentic(title);autonomous agent(abstract);分类 cs.AI、cs.SE

AI总结 提出一个闭环测量框架 agent-breakage,通过注入故障、评分响应并累积带标签元组,解决 Kubernetes 操作代理经验声明的不可证伪性问题,并在案例研究中发现检索复合能力被三个混杂因素(pgvector 索引错误、+19% 选择偏差、小样本夸大效应约 3 倍)所掩盖。

Comments 22 pages. Code at https://github.com/odmarkj/agent-breakage tag v0.1.0 (Apache 2.0). Source repo at https://github.com/odmarkj/agent-breakage-paper tag arxiv-v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23772 2026-05-25 cs.AI cs.LO cs.PL cs.SE 81%

Agentic Proving for Program Verification

程序验证的智能体证明

Alessandro Sosso, Akhil Arora, Bas Spitters

机构 * Department of Computer Science(计算机科学系)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.SE

AI总结 本文评估Claude Code在Lean 4基准CLEVER上的智能体证明框架,结果显示其能生成98.8%问题的有效规范,87.5%的实现通过验证,端到端成功率达98.1%,并指出当前基准与智能体能力不匹配,需更严格的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14634 2026-05-25 cs.SE 79%

Documentation-Guided Agentic Codebase Migration from C to Rust

文档引导的从 C 到 Rust 的智能代码库迁移

Minh Le-Anh, Anh Nguyen Hoang, Bach Le, Nghi D. Q. Bui

专题命中 软件智能体 :agentic(title,abstract);分类 cs.SE

AI总结 提出 RustPrint 框架,通过文档引导的智能体协调,实现仓库级别的 C 到 Rust 迁移,在编译性、特征保留和测试通过率上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23109 2026-05-25 cs.AI cs.DC cs.LO cs.PL 70%

Inductive Deductive Synthesis: Enabling AI to Generate Formally Verified Systems

归纳演绎合成:使AI能够生成形式化验证的系统

Shubham Agarwal, Alexander Krentsel, Shu Liu, Mert Cemri, Audrey Cheng, Rui Meng, Tomas Pfister, Chun-Liang Li, Sylvia Ratnasamy, Aditya Parameswaran, Matei Zaharia, Ion Stoica, Mohsen Lesani

机构 * UC Berkeley(伯克利大学) Google(谷歌) UC Santa Cruz(圣克鲁兹大学)

专题命中 软件智能体 :AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出归纳演绎合成(IDS)方法,通过联合增量合成实现与证明,并利用失败尝试学习,使AI在分布式系统规范上实现100%验证成功率,成本和时间远低于专家和现有AI代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23091 2026-05-25 cs.SE cs.AI cs.CR 62%

Security of LLM-generated Code: A Comparative Analysis

LLM生成代码的安全性:一项比较分析

Srivathsan G Morkonda, Mahmoud Selim, Hala Assal

机构 * Carleton University(卡尔顿大学)

专题命中 软件智能体 :planning(abstract);分类 cs.AI、cs.SE

AI总结 本研究通过模拟开发者使用LLM生成代码的行为,评估了七种流行LLM生成代码的安全性,发现所有模型均生成包含漏洞的代码,且多数为严重或高危漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23007 2026-05-25 q-fin.TR cs.AI cs.LG q-fin.PM 62%

MadEvolve: Evolutionary Optimization of Trading Systems with Large Language Models

MadEvolve: 基于大型语言模型的交易系统进化优化

Yurii Kvasiuk, Tianyi Li, Owen Colegrove, Moritz Münchmeyer

机构 * Department of Physics, University of Wisconsin–Madison(威斯康星大学麦迪逊分校物理系) Event Horizon Labs(事件地平线实验室)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出 MadEvolve 框架,利用大型语言模型驱动的进化算法优化量化金融中的交易策略与 alpha 生成,以比特币交易为例,在特征集演化、策略组件优化及联合演化上取得显著改进,并对比了其他智能搜索方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23435 2026-05-25 cs.PL cs.SE 57%

MileStone: A Multi-Objective Compiler Phase Ordering Framework for Graph-based IR-Level Optimization

MileStone:一种面向基于图的IR级优化的多目标编译器阶段排序框架

Amirhosein Sadr, Mehran Alidoost Nia

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 提出MileStone框架,将编译器阶段排序建模为多目标优化问题,利用图神经网络预测性能,并通过强化学习代理探索满足用户约束的优化序列,实现执行时间、代码大小和能耗的Pareto最优权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20630 2026-05-25 cs.SE cond-mat.mtrl-sci 57%

Evaluating LLM-generated code for domain-specific languages: molecular dynamics with LAMMPS

评估LLM生成的领域特定语言代码:使用LAMMPS进行分子动力学模拟

Ethan Holbrook, Juan C. Verduzco, Alejandro Strachan

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 提出一种评估流程,结合标准化、解析、低成本执行和准确性检查,系统评估LLM为分子动力学代码LAMMPS生成输入文件的有效性,发现当前模型在科学准确性上有限,但通过可复用的智能体技能可显著提升。

Comments 19 pages, 5 figures, Supporting Info, 27 total pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03530 2026-05-25 cs.MM cs.CL cs.CV 57%

How Far Are We from Generating Missing Modalities with Foundation Models?

我们距离用基础模型生成缺失模态还有多远?

Guanzhou Ke, Bo Wang, Guoqing Chao, Weiming Hu, Shengfeng He

机构 * Institute of Data Science and Intelligent Decision Support, Beijing Jiaotong University(数据科学与智能决策支持研究所,北京交通大学) School of Computing and Information Systems, Singapore Management University(计算与信息系统学院,新加坡管理大学) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Computer Science and Technology, Harbin Institute of Technology(计算机科学与技术学院,哈尔滨工业大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.CL

AI总结 本文系统评估了基础模型在缺失模态重建中的三种范式,发现其在细粒度语义提取和生成模态验证方面存在不足,并提出一个包含模态感知挖掘和自精炼机制的智能框架,显著提升了重建质量。

Comments T-PAMI

详情

展开后加载摘要…

URL PDF HTML 收藏