arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-14 至 2026-08-14 共收录 13 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 13 篇

2608.13228 2026-08-14 cs.AI cs.LG 新提交 81%

Capability Sheaves for Compositional Agent-Harness Repair: Controlled Quotients and a Real-Repository Stress Test

用于组合智能体 harness 修复的层架:受控商与真实仓库压力测试

Saveliy Batruin

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出用能力层架建模智能体 harness 故障,通过受控实验验证其可减少候选预算,在SWE-bench多语言库测试中,弃权门解决127个问题,支持其受控不变性机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12440 2026-08-14 cs.SE cs.AI 新提交 81%

Specification-first convergence with an AI coding agent: a case study of dismantling a core architectural invariant across 189 files in a 717k-line codebase with no test oracle and no human code review

采用AI编码智能体的规范优先收敛:在71.7万行代码库中拆解189个文件的核心架构不变量的案例研究

Joel Abenhaim

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文通过案例研究,展示AI编码智能体在规范优先协议下,成功在71.7万行代码库中拆解核心架构不变量,耗时3天、成本2430美元,修正201个缺陷,涉及189个文件。

Comments 14 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12355 2026-08-14 cs.HC cs.AI cs.SE 新提交 81%

Humans are Missing from AI Coding Agent Research

AI编码智能体研究中缺失了人类

Zora Z. Wang, John Yang, Kilian Lieret, Alexa Tartaglini, Valerie Chen, Yuxiang Wei, Zijian Wang, Lingming Zhang, Karthik Narasimhan, Ludwig Schmidt, Graham Neubig, Daniel Fried, Diyi Yang

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 该文指出AI编码智能体研究当前缺失人类维度,主张转向以人为中心的编码智能体,明确了人机交互的四个核心层面并提出相关研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30777 2026-08-14 cs.SE 版本更新 79%

What Breaks When LLMs Code? Characterizing Operational Safety Failures of Agentic Code Assistants

当LLM编码时会出现什么问题?表征自主代码助手的操作安全故障

Alif Al Hasan, Sumon Biswas

专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.SE

AI总结 通过系统分析文献和GitHub问题,构建了包含33种操作风险类型的多维安全分类法,发现编码代理故障通常严重且主要源于约束违反、破坏性操作、授权绕过和欺骗。

Comments This paper is accepted to the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026), Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13122 2026-08-14 cs.DC 新提交 75%

Validation-Centric AI-Assisted GPU Porting of a 250,000+ Line Legacy Weather Simulation Code

面向验证的25万行以上遗留气象模拟代码的AI辅助GPU移植

Tetsuya Hoshino, Masaya Kato, Kazuhisa Tsuboki, Daichi Mukunoki, Takahiro Katagiri, Toshihiro Hanawa

专题命中 软件智能体 :agent(abstract);AI agent(abstract);workflow(abstract)

AI总结 本文以遗留Fortran气象模拟代码CReSS为例,提出面向验证的AI辅助GPU移植工作流,为162个内核生成经数值验证的GPU实现,获5.1倍应用级加速,还检测到5个内核的数值不一致。

Comments 11 pages, 1 figure, 3 tables. Submitted to AgenticAI4HPC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12771 2026-08-14 cs.SE cs.AI 新提交 62%

Memorization Diagnostics for Code LLMs Should be Scale-Aware

代码大语言模型的记忆诊断应考虑规模因素

Prateek Kumar Rajput, Abdoul Aziz Bonkoungou, Alberick Euraste Djiré, Xunzhu Tang, Yewei Song, Iyiola Emmanuel Olatunji, El Hacen Diallo, Jacques Klein, Tegawendé F. Bissyandé

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 该研究针对代码大语言模型记忆诊断的规模敏感性问题,通过分离表征负载与记忆,发现现有探测技术在大规模模型上失效,提出未来评估需解耦二者的方法。

Comments 26 pages, 6 figures, 6 tables. Under review at EMSE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14573 2026-08-14 cs.AI cs.SE 版本更新 62%

Alipay-PIBench: A Realistic Payment Integration Benchmark for Coding Agents

支付宝-PIBench:用于编码代理的现实支付集成基准测试

Shiyu Ying, Xuejie Cao, Yingfan Ma, Yuanhao Dong, Wenyu Chen, Bowen Song, Lin Zhu

机构 * Ant Group(蚂蚁集团)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 研究旨在评估编码代理在支付宝支付集成任务中的表现,引入支付宝-PIBench基准测试,含九个产品项目和18个任务实例,分不同场景。通过评估六个编码代理模型得出评分通过率,发现有技能条件下RPR提升,为诊断模型能力和评估支付集成指导提供可控环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13292 2026-08-14 cs.SE 新提交 57%

Refine After Generation: Toward Correct and Concise Patches in LLM-based Program Repair

生成后优化:面向基于大语言模型的程序修复中正确且简洁的补丁

Wenqiang Luo, Jacky Keung, Xiaoyu Shi, Yicheng Sun, Boyang Yang, Zhou Yang, Haoye Tian

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 针对基于LLM的程序修复中补丁冗余问题,提出RECAP适配器,在保留或提升解决率的同时,大幅降低补丁大小,实现更优的大小-正确性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12161 2026-08-14 cs.CL 版本更新 57%

Token Reduction Is Not Cost Reduction

令牌减少并非成本降低

Sarel Weinberger, Amir Hozez

机构 * PointFive

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 研究基于 API 的编码代理上下文减少层,通过对 2848 次 Claude Code 运行分析,发现提示缓存流量主导成本,工具输出减少不能可靠预测计费成本降低,压缩可能损害任务完成,进而提出以成功调整计费成本为核心的分层证据标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13448 2026-08-14 cs.RO 新提交 50%

Mind the Context: Continual Learning of Socially Appropriate Robot Actions via Environmental-Social Disentanglement

关注上下文:通过环境-社会解耦实现社会适配机器人动作的持续学习

Rafal Robert Karpinski, Fethiye Irmak Dogan, Nikhil Churamani, Yiming Luo, Maartje M. A. de Graaf, Davide Dell'Anna, Hatice Gunes

机构 * Utrecht University(乌得勒支大学) University of Cambridge(剑桥大学)

专题命中 软件智能体 :agent(abstract)

AI总结 该研究针对社交机器人在多样上下文场景下的持续学习问题,提出EDD框架解耦环境与社会知识,缓解遗忘,性能优于现有基线,相关代码已公开。

Comments Extended version of the paper accepted at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13027 2026-08-14 cs.AR 新提交 50%

Why Do Prefetchers Fail? Let Agents Answer

预取器为何失效?让智能体来解答

Xiangfeng Sun, Ceyu Xu, Ningzhi Ai, Zeyu Zhu, Yiyang Yuan, Yuan Xie

专题命中 软件智能体 :agent(abstract)

AI总结 该研究提出智能体驱动的自动研究流程构建预取器混合模型MoP,在SPEC CPU2006/2017上实现61.1%几何平均IPC加速,超越多款人工设计预取器,为硬件预取器设计提供新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04724 2026-08-14 cs.RO cs.CV 版本更新 50%

A GitOps-Driven Annotation Catalog for Fully Automatic Railway Operations

面向全自动铁路运行的GitOps驱动标注目录

Martin Köppel, Tobias Cronauer, Zekiye Ilknur-Öz, Sebastian Dubiel, Patrick Naumann, Philipp Neumaier

专题命中 软件智能体 :workflow(abstract)

AI总结 针对全自动铁路运行的标注数据管理难题,提出基于GitOps的轻量级元数据管理架构,结合Data-as-Code、CI/CD与SSG,实现以开发者为中心的工作流,保障可追溯性与合规性并自动生成数据集概览。

Journal ref 16th International Conference on Advanced Computer Information Technologies in Zlín, Czech Republic, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29545 2026-08-14 cs.CY cs.CR 版本更新 50%

Stand-Alone Complex or Vibercrime? Exploring the adoption and innovation of GenAI tools, coding assistants, and agents within cybercrime ecosystems

独立复杂或维伯犯罪?探索生成AI工具、编码助手和代理在网络犯罪生态系统中的采用与创新

Jack Hughes, Ben Collier, Daniel R. Thomas

专题命中 软件智能体 :agentic(abstract)

AI总结 本文通过创新理论和演化经济学分析网络犯罪生态系统,提出独立复杂和维伯犯罪概念,发现AI在现有低利润方案中有早期应用,但未造成广泛破坏。

Comments Updated with results on developments in the first half of 2026

详情

展开后加载摘要…

URL PDF HTML 收藏