arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-26 至 2026-05-26 共收录 15 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 15 篇

2605.26112 2026-05-26 cs.AI cs.LG 86%

From Model Scaling to System Scaling: Scaling the Harness in Agentic AI

从模型扩展到系统扩展:扩展智能体AI中的“缰绳”

Shangding Gu

机构 * UC Berkeley(伯克利大学)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);tool use(abstract);分类 cs.AI、cs.LG

AI总结 本文提出智能体AI的下一个瓶颈是系统扩展而非仅模型扩展,通过设计可审计、持久、模块化和可验证的架构(称为“缰绳”),并研究上下文治理、可信记忆和动态技能路由三大瓶颈,以推动智能体行为从模型能力向长期任务执行转化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24453 2026-05-26 cs.SE cs.AI 86%

Code2UML: Agentic LLMs with context engineering for scalable software visualization

Code2UML: 基于上下文工程的可扩展软件可视化的智能体LLM

Alin-Gabriel Văduva, Anca-Ioana Andreescu, Simona-Vasilica Oprea, Adela Bâra

机构 * Bucharest University of Economic Studies(布加勒斯特经济大学)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract,abstract_cn);分类 cs.AI、cs.SE

AI总结 提出一种基于五个专门智能体和确定性IR压缩层的智能体架构,用于从源代码仓库自动生成UML图,在12个开源仓库和7种UML图上验证了高语法有效性(平均91.5%)和结构质量(平均81.7/100),且质量不随规模下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23904 2026-05-26 cs.AI cs.CL 84%

SkillOpt: Executive Strategy for Self-Evolving Agent Skills

SkillOpt: 自我进化智能体技能的执行策略

Yifan Yang, Ziyang Gong, Weiquan Huang, Qihao Yang, Ziwei Zhou, Zisu Huang, Yan Li, Xuemei Gao, Qi Dai, Bei Liu, Kai Qiu, Yuqing Yang, Dongdong Chen, Xue Yang, Chong Luo

机构 * Microsoft(微软公司) Shanghai Jiao Tong University(上海交通大学) Tongji University(同济大学) Fudan University(复旦大学)

专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出SkillOpt,一种系统性的可控文本空间优化器,通过分离的优化器模型对技能文档进行有界编辑,并仅在严格改善验证分数时接受编辑,从而稳定训练技能,在六个基准测试中全面优于现有方法。

Comments 27 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25748 2026-05-26 cs.AI 79%

Agent-Centric Social Trajectory Prediction: A Free Energy Principle Perspective

以智能体为中心的社交轨迹预测:自由能原理视角

Yanping Wu, Ji Zhang, Hao Chen, Edmond S. L. Ho, Chongfeng Wei

机构 * University of Glasgow(格拉斯哥大学) Southwest Jiaotong University(西南交通大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI

AI总结 针对现有轨迹预测方法依赖全局状态、部分可观测下信念推理不足及缺乏认知行为约束的问题,提出基于自由能原理的智能体中心轨迹预测框架FEP-Diff,通过双分支时空编码器、目标条件信念学习器和残差扩散轨迹生成器,在受限可观测条件下实现认知合理的预测。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20160 2026-05-26 cs.SE 77%

How do Agents Refactor: An Empirical Study

智能体如何重构:一项实证研究

Lukas Ottenhof, Daniel Penner, Abram Hindle, Thibaud Lutellier

专题命中 软件智能体 :agent(abstract,abstract_cn);agentic(abstract);分类 cs.SE

AI总结 通过对比86个Java项目中智能体与开发者的重构拉取请求,发现智能体重构以注释修改为主,而Cursor是唯一显著增加代码味道的模型。

Comments Accepted for publication in 23rd International Mining Software Repositories Conference (MSR 2026) : 5 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24812 2026-05-26 cs.AI 77%

CoRe-Code: Collaborative Reinforcement Learning for Code Generation

CoRe-Code:面向代码生成的协作式强化学习

Zhihao Dou, Qinjian Zhao, Zhongwei Wan, Xiaoyu Xia, Sumon Biswas

机构 * The Ohio State University(俄亥俄州立大学) Royal Melbourne Institute of Technology(皇家墨尔本理工学院)

专题命中 软件智能体 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI

AI总结 提出CoRe-Code框架,通过规划器-编码器范式和基于GRPO的协作感知强化学习,增强多智能体间的协调与专业化,提升代码生成的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24659 2026-05-26 cs.LG 77%

IterInject: Indirect Prompt Injection Against LLM Agents via Feedback-Guided Iterative Optimization

IterInject: 通过反馈引导的迭代优化实现对LLM智能体的间接提示注入

Zixuan Chen, Jiaxiang Chen, Li Luo, Ke Xu, Xiaoxiang Huang, Tanfeng Sun, Xinghao Jiang

机构 * Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学)

专题命中 软件智能体 :agent(abstract);tool use(abstract);planning(abstract);分类 cs.LG

AI总结 提出IterInject框架,通过规则诊断器和LLM优化器迭代优化对抗载荷,实现对LLM智能体的间接提示注入攻击,在多个基准和实际系统中显著优于现有方法,并揭示了注意力介导的阈值机制。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09268 2026-05-26 cs.SE 74%

Decoding the Configuration of AI Coding Agents: Insights from Claude Code Projects

解码AI编码代理的配置:来自Claude Code项目的洞察

Helio Victor F. Santos, Vitor Costa, Joao Eduardo Montandon, Marco Tulio Valente

专题命中 软件智能体 :agent(abstract,journal_ref);agentic(abstract,journal_ref);分类 cs.SE

AI总结 通过对328个Claude Code配置文件进行实证研究,揭示了代理编码系统的配置文件中指定的软件工程关注点及其共现模式,强调了定义架构约束的重要性。

Journal ref Accepted at 1st International Workshop on Agentic Engineering (AGENT 2026, colocated with ICSE), pages 63-67

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13305 2026-05-26 cs.SE 70%

SAINT: Service-level Integration Test Generation with Program Analysis and LLM-based Agents

SAINT: 基于程序分析和LLM智能体的服务级集成测试生成

Rangeet Pan, Raju Pavuluri, Ruikai Huang, Rahul Krishna, Tyler Stennett, Alessandro Orso, Saurabh SInha

专题命中 软件智能体 :planning(abstract);agentic(abstract);分类 cs.SE

AI总结 提出SAINT方法,结合静态分析、大语言模型和智能体,自动生成企业Java应用的服务级端点测试和场景测试,提升覆盖率和缺陷检测能力。

Comments Accepted at ICSE'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26017 2026-05-26 cs.SE 57%

Trustworthy Software Project Generation : a Case Study with an Interactive Theorem Prover

可信软件项目生成:以交互式定理证明器为例的案例研究

Jian Fang, Yingfei Xiong

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文研究利用交互式定理证明器(ITP)从自然语言需求自动生成大规模可信软件项目,通过将纯逻辑与有副作用的代码分离,在Rocq中完成验证并提取C++代码,成功生成一个RISC-V RV32I CPU解释器,证明了ITP作为LLM生成软件验证后端的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25592 2026-05-26 stat.ML cs.LG 57%

Optimal Design for Multinomial Logit Model with Applications to Best Assortment Identification

多项Logit模型的最优设计及其在最佳组合识别中的应用

Joongkyu Lee, Min-hwan Oh

机构 * Seoul National University, Seoul, Korea(首尔国立大学)

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 针对多项Logit(MNL)模型,提出计算高效的最优实验设计框架,通过混合整数线性规划和多项式时间松弛方法实现统计效率与可扩展性,并应用于线性效用和非均匀收益下的最佳组合识别。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25430 2026-05-26 cs.AI 57%

CODESKILL: Learning Self-Evolving Skills for Coding Agents

CODESKILL:学习自进化技能的编码智能体

Yanzhou Li, Yiran Zhang, Xiaoyu Zhang, Xiaoxia Liu, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 提出CODESKILL框架,通过强化学习从编码智能体轨迹中提取多粒度程序性技能并维护技能库,提升下游任务解决能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25285 2026-05-26 cs.SE 57%

PR-Aware Automated Unit Test Generation: Challenges and Opportunities

PR感知的自动化单元测试生成:挑战与机遇

Vahid Haratian, Atakan Akar, Berk Çakar, Eray Tüzün

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 本研究评估了EvoSuite和GPT-4o在拉取请求(PR)级别生成测试用例的能力,发现两者均难以有效生成捕获变更的测试,但EvoSuite优于GPT-4o,并指出智能体代码生成方法具有潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24375 2026-05-26 cs.AI 57%

Distilling Game Code World Model Generation into Lightweight Large Language Models

将游戏代码世界模型生成蒸馏到轻量级大型语言模型

Tyrone Serapio, Arjun Prakash, Haoyang Xu, Kevin Wang, Amy Greenwald

机构 * Brown University(布朗大学)

专题命中 软件智能体 :AI agent(abstract);分类 cs.AI

AI总结 研究通过后训练将游戏代码世界模型生成能力蒸馏到小型模型,采用监督微调和带可验证奖励的强化学习提升生成代码的语法正确性和规则遵循性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24110 2026-05-26 cs.AI 57%

EvoCode-Bench: Evaluating Coding Agents in Multi-Turn Iterative Interactions

EvoCode-Bench:评估多轮迭代交互中的编码智能体

Haiyang Shen, Xuanzhong Chen, Wendong Xu, Yun Ma, Liang Chen, Kuan Li

机构 * UniPat AI Peking University(北京大学) Tsinghua University(清华大学) HKU(香港大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 提出EvoCode-Bench基准,通过多轮状态化任务和累积测试评估编码智能体在需求变化下维持代码库工作的能力,发现多轮指标远低于单轮指标,且最强智能体多轮成功率仅约50%。

Comments Work in Progress; 32 pages, 10 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏