arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-29 至 2026-07-29 共收录 11 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 11 篇

2607.24882 2026-07-29 cs.IR cs.AI cs.CL 新提交 84%

Agent Retrieval Bench: Evaluating Repository Context Retrieval for Coding Agents

智能体检索基准:评估代码智能体的仓库上下文检索

Bowen Qin, Yi Xie

专题命中 软件智能体 :agent(title,abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 研究代码智能体仓库上下文检索问题,引入智能体检索基准,涵盖多种检索任务和样本。评估多种检索方法,发现无单一方法占优,存在校准差距,且记录轨迹有缺失。通过试验表明检索得出的初始上下文有优势,神谕金上下文还有提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26563 2026-07-29 cs.SE 版本更新 83%

TrajAudit: Automated Failure Diagnosis for Agentic Coding Systems

TrajAudit:智能体编码系统的自动化故障诊断

Minxing Wang, Xiaofei Xie, Yintong Huo

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.SE

AI总结 针对仓库级编码轨迹中噪声多、上下文长的问题,提出TrajAudit框架,通过模式匹配过滤和测试报告先验知识辅助,实现高效故障诊断,在RootSE基准上定位准确率提升24.4个百分点,令牌消耗降低18%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25975 2026-07-29 cs.HC 新提交 82%

Who is scientific code for? Maintaining human-readable landmarks in agent-written code

科学代码是为谁而设?在代理编写的代码中维护人类可读的地标

Elle O'Brien

专题命中 软件智能体 :agent(title,abstract);agentic(abstract)

AI总结 研究在科学家采用编码代理后,代码维护假设瓦解的问题,核心方法是通过多种调查及工作流程,发现科学家发明“地标策略”标记代码,指出明确划分人类可读与代理上下文能利于科学代码的开发、记录与维护。

Comments Position piece submitted to Infrastructure @ CSCW 26 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24964 2026-07-29 cs.CR 新提交 82%

ALIBI: Adaptive Agentic Attacks on LLM-Based Vulnerability Detectors via Adversarial Code Comments

ALIBI:通过对抗性代码注释对基于大语言模型的漏洞检测器进行自适应智能体攻击

Zixuan Wu, Cristina Nita-Rotaru

专题命中 软件智能体 :agentic(title);agent(abstract);multi-agent(abstract)

AI总结 研究如何通过对抗性代码注释对基于大语言模型的漏洞检测器进行自适应智能体攻击,提出ALIBI框架,将现实世界漏洞修复提交转换为编码任务评估多个检测器,发现其高度易受攻击,揭示攻击面并推动安全意识设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25032 2026-07-29 cs.SE cs.AI 新提交 81%

Authoring Agent Skills: A Software-Engineering Approach

编写智能体技能:一种软件工程方法

Giuseppe Destefanis

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 研究如何编写智能体技能,遵循软件工程原则,以Claude Code为参考实现阐述技能结构等,与其他塑造智能体行为机制比较并给出选择规则,还介绍评估驱动编写过程等,为智能体技能编写提供方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24762 2026-07-29 cs.AI cs.PF 新提交 79%

Kernel Forge: An Agent Harness for LLM-based Generation and Optimization of CUDA Kernels

Kernel Forge:用于基于大语言模型的CUDA内核生成与优化的代理框架

Joshua Brodsky, Dhravid Kumar, Savini Kashmira, Jayanaka Danatanarayana, Jason Mars, Krisztian Flautner, Lingjia Tang

机构 * University of Michigan(密歇根大学)

专题命中 软件智能体 :agent(title);agentic(abstract);分类 cs.AI

AI总结 研究针对机器学习模型中计算内核优化需专家手写代码的问题,提出开源端到端代理框架Kernel Forge,它支持多种工作负载,用蒙特卡洛树搜索优化路径,经实验评估,优化后的内核性能优于PyTorch即时模式。

Comments The code is available at: https://github.com/TheJoshBrod/KernelForge

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25890 2026-07-29 cs.AI 新提交 77%

Distributing Security Controls Through Harness Engineering

通过工具工程分发安全控制

William Robert Gore

专题命中 软件智能体 :agent(abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI

AI总结 研究商业AI编码代理安全控制分发问题,通过分阶段测试方法,利用SHarD工具在多种代理配置上测试,证明三类安全控制可通过单个命令嵌入分发,效果与直接安装商业代理相同,还提出相关框架特征及后续研究问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13767 2026-07-29 cs.AR 版本更新 67%

Retrieve, Schedule, Reflect: LLM Agents for Chip QoR Optimization

检索、调度、反思:用于芯片QoR优化的LLM代理

Yikang Ouyang, Yang Luo, Dongsheng Zuo, Yuzhe Ma

专题命中 软件智能体 :agent(abstract);agentic(abstract)

AI总结 本文提出基于LLM的代理框架,通过与EDA工具交互实现芯片优化调度,利用检索增强生成和帕累托驱动反馈提升QoR,实验显示其在时序改进、能耗和面积上优于强化学习等黑盒方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07195 2026-07-29 cs.SE cs.LG 版本更新 62%

Automated Modernization of Machine Learning Engineering Notebooks for Reproducibility

机器学习工程笔记本的自动化现代化进程以实现可重现性

Bihui Jin, Kaiyuan Wang, Pengyu Nie

机构 * University of Waterloo(滑铁卢大学) Google(谷歌公司)

专题命中 软件智能体 :agentic(abstract);分类 cs.LG、cs.SE

AI总结 本文提出MLEModernizer,通过LLM驱动的框架自动化现代化工机器学习工程笔记本,以恢复其在不断变化的环境中的可重现性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25619 2026-07-29 cs.SE cs.CR 新提交 57%

SkillGate: Cost Efficient Runtime Malicious Skill File Detection in Coding Agents

SkillGate:编码代理中经济高效的运行时恶意技能文件检测

Rui Yang, Michael Fu, Kla Tantithamthavorn, Chetan Arora, Joey Chua

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 研究针对编码代理中恶意技能文件检测问题,提出SkillGate安全网关,采用混合正则表达式预过滤器+大语言模型判断管道,在SkillsBench基准测试中,检测效果好、成本低、运行时开销小,相比现有工具性能显著提升。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09720 2026-07-29 physics.plasm-ph physics.comp-ph 版本更新 50%

Predictive capabilities of the integrated modeling TRANSP code for tokamak plasmas

整合建模TRANSP代码对托卡马克等离子体的预测能力

A. Y. Pankin, J. Breslau, M. V. Gorelenkova, R. Budny, M. Goliyad, B. A. Grierson, G. W. Hammett, S. C. Jardin, J. B. Lestz, X. Yuan

专题命中 软件智能体 :workflow(abstract)

AI总结 本文探讨TRANSP代码在预测托卡马克等离子体中的能力,重点介绍PT_SOLVER模块和高保真T3D/GX框架的开发,用于基于高保真gyrokinetic模型的湍流输运预测。

详情

展开后加载摘要…

URL PDF HTML 收藏