arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-05 至 2026-06-05 共收录 12 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 12 篇

2606.05647 2026-06-05 cs.AI cs.CL cs.CY cs.HC 87%

Coding with "Enemy": Can Human Developers Detect AI Agent Sabotage?

与“敌人”编码:人类开发者能否检测到AI代理的破坏行为?

Jingheng Ye, Huiqi Zou, Simon Yu, Weiyan Shi

机构 * Northeastern University(东北大学)

专题命中 软件智能体 :agent(title,abstract);AI agent(title);分类 cs.AI、cs.CL

AI总结 通过大规模用户实验,研究人类开发者在长时间编码任务中检测AI代理恶意代码插入的能力,发现94%的开发者未能识别破坏,并分析其原因,提出安全监控设计建议。

Comments 34 pages, 30 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05391 2026-06-05 cs.SE cs.AI 84%

Human oversight of agentic systems in practice: Examining the oversight work, challenges, and heuristics of developers using software agents

实践中对智能体系统的人类监督:考察使用软件代理的开发者的监督工作、挑战与启发式方法

Shipi Dhanorkar, Samir Passi, Mihaela Vorvoreanu

机构 * Microsoft Redmond USA(微软红mond美国)

专题命中 软件智能体 :agentic(title);agent(abstract);planning(abstract);分类 cs.AI、cs.SE

AI总结 通过访谈17位经验丰富的开发者,探索人类对自主软件代理的监督实践,发现四种监督工作形式(先验控制、协同规划、实时监控、事后审查),并总结监督挑战与应对策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11732 2026-06-05 cs.IR cs.CL cs.MA cs.MM 77%

AgentDisCo: Towards Disentanglement and Collaboration in Open-ended Deep Research Agents

AgentDisCo: 向开放深度研究代理中的解耦与协作迈进

Jiarui Jin, Zexuan Yan, Shijian Wang, Wenxiang Jiao, Yuan Lu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 软件智能体 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.CL

AI总结 本文提出AgentDisCo,一种解耦且协作的代理架构,将深度研究视为信息探索与利用之间的对抗优化问题。通过批评代理评估生成的草稿并优化搜索查询,生成代理检索更新结果并修订草稿,最终生成综合报告。该框架通过元优化 harness 支持手工和自动发现的设计策略,并利用强大的代码生成代理自完善。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26233 2026-06-05 cs.CL 70%

Ask or Assume? Uncertainty-Aware Clarification-Seeking in Coding Agents

提问还是假设?编码代理中的不确定性意识澄清寻求

Nicholas Edwards, Sebastian Schuster

机构 * Faculty of Computer Science, University of Vienna(维也纳大学计算机科学系) UniVie Doctoral School Computer Science, University of Vienna(维也纳大学计算机科学博士学院)

专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本研究评估了LLM代理在未指定任务中的澄清能力,提出了一种不确定性意识的多代理框架,提高了任务解决率,并展示了多代理系统在复杂任务中主动寻求信息的行为。

Comments 18 pages, 7 figures; added experiments evaluating open-weight models (Kimi K2.6), expanded related work, and included dataset validation details

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05920 2026-06-05 cs.SE cs.CL 62%

Asuka-Bench: Benchmarking Code Agents on Underspecified User Intent and Multi-Round Refinement

Asuka-Bench: 针对未明确用户意图与多轮优化的代码智能体基准测试

Xin Wang, Liangtai Sun, Yaoming Zhu, Shuang Zhou, Jiaxing Liu, Fengjiao Chen, Lin Qiu, Xuezhi Cao, Xunliang Cai, Licheng Zhang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Independent researchers(独立研究人员)

专题命中 软件智能体 :agent(abstract);分类 cs.CL、cs.SE

AI总结 提出Asuka-Bench基准,通过未明确用户意图与多轮优化闭环评估代码智能体,包含50个网页任务和784个评估标准,揭示模型间显著性能差异。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05720 2026-06-05 cs.SE cs.AI 62%

Microskill Architecture: A Modular Skill-Driven Framework for AI-Native Code Generation

微技能架构:一种面向AI原生代码生成的模块化技能驱动框架

Mohammad Zare, Omid Abdolrahmani

机构 * Artificial Intelligence Laboratory at AriooBarzan(AriooBarzan人工智能实验室) Engineering Team, Shiraz, Iran(伊朗谢尔兹工程团队)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出微技能架构,通过将知识封装为原子技能胶囊并动态选择相关胶囊,解决AI代码生成中的上下文窗口管理问题,显著降低token消耗、提高编译成功率并消除架构违规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05570 2026-06-05 cs.CL cs.AI 62%

TensorBench: Benchmarking Coding Agents on a Compiler-Based Tensor Framework

TensorBench: 在基于编译器的张量框架上对编码智能体进行基准测试

Bobby Yan, Fredrik Kjolstad

机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出 TensorBench,一个包含199个特征添加和重构任务的基准测试,用于评估编码智能体在基于编译器的张量框架上的表现,并通过测试套件自动评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05564 2026-06-05 cs.CL 57%

Using Large Language Models to Support High Volume Application Review for an Undergraduate Research Program

使用大型语言模型支持本科研究项目的高容量申请评审

Varun Aggarwal, Kay Kobak, John Howarter

机构 * Engineering Undergraduate Research Office, Purdue University(普渡大学本科生研究办公室) Elmore School of Electrical and Computer Engineering, Purdue University(普渡大学电子与计算机工程学院) School of Materials Engineering, Purdue University(材料工程学院)

专题命中 软件智能体 :workflow(abstract);分类 cs.CL

AI总结 本研究开发并部署基于GPT模型(GPT-4o、GPT-5-mini、GPT-5.2)的工具,对普渡大学SURF项目约1200份目的陈述进行自动化评分与理由注释,将评审时间从数周缩短至约4小时。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09192 2026-06-05 cs.AI 57%

Evidence Over Plans: Online Trajectory Verification for Skill Distillation

证据与计划:用于技能蒸馏的在线轨迹验证

Yang Zhou, Zihan Dong, Zhenting Wang, Can Jin, Shiyu Zhao, Bangwei Guo, Difei Gu, Linjun Zhang, Mu Zhou, Dimitris N. Metaxas

机构 * Rutgers University(罗杰斯大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种基于轨迹的后验蒸馏指数(PDI)来评估技能与任务环境证据的契合度,通过SPARK框架实现环境验证轨迹的生成,从而提升技能的效率和可迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05518 2026-06-05 cs.DC 50%

Latent Reasoning Guidance for Parallel Code Translation

并行代码翻译的潜在推理引导

Tomer Bitan, Erel Kaplan, Roee Bar-Yadin, Lian Ghrayeb, Le Chen, Samyak Jhaveri, Niranjan Hasabnis, Gal Oren

专题命中 软件智能体 :autonomous agent(abstract)

AI总结 提出一种在测试时使用过程奖励模型(PRM)对连续潜在前缀进行评分,以在最终代码解码前选择替代隐藏状态轨迹的方法,从而提升并行代码翻译的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05397 2026-06-05 quant-ph 50%

Multi-Qubit Dyadic Phase Fixing for Fault-Tolerant Quantum Compilation

用于容错量子编译的多量子比特二元相位固定

Justin Kalloor, Mathias Weiden, Ed Younis, John Kubiatowicz, Costin Iancu

专题命中 软件智能体 :workflow(abstract)

AI总结 提出一种名为二元相位固定(DPF)的多量子比特合成工具,通过数值酉合成贪婪提取二元角度旋转,结合决策矩阵自动调整相位梯度寄存器大小,在多种基准测试中实现T计数减少高达70%,并降低表面码架构中的时空体积。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30507 2026-06-05 cs.PF cs.DC cs.PL 50%

A Virtual Processor brings back the Free Lunch

虚拟处理器重现免费午餐

Haymo Kutschbach

专题命中 软件智能体 :agent(abstract)

AI总结 提出一种自优化的虚拟处理器,通过去中心化的协作执行段网络,在运行时自动并行化数值数组程序,无需开发者手动设计并行策略。

Comments 10 pages + appendix (3 pages), 7 figures, 4 benchmarks at https://github.com/hokb/decentralized-array-execution-artifacts2026 (GitHub) or https://doi.org/10.5281/zenodo.20407801 (DOI Zenodo)

详情

展开后加载摘要…

URL PDF HTML 收藏