arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-11 至 2026-05-11 共收录 199 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 工作流自动化 18 篇

2605.00663 2026-05-11 cs.RO cs.CV 78%

Affordance Agent Harness: Verification-Gated Skill Orchestration

可及性代理框架:验证门控技能协调

Haojian Huang, Jiahao Shi, Yinchuan Li, Yingcong Chen

机构 * HKUST(GZ)(香港理工大学(广州)) Knowin AI Harbin Engineering University(哈尔滨工程大学)

专题命中 工作流自动化 :agent(title,abstract)

AI总结 本文提出一种闭环运行时系统,统一异构技能并利用证据存储和成本控制,通过路由器自适应选择技能,利用验证器通过自一致性、跨尺度稳定性等验证证据充分性,从而提升可及性定位的准确性和效率。

Comments 43 pages, 22 figures, 8 tables. Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06976 2026-05-11 stat.ML cs.LG stat.CO 70%

A Differentiable Bayesian Relaxation for Latent Partial-Order Inference

一种可微的贝叶斯松弛用于潜在偏序推断

Dongqing Li, Geoff K. Nicholls, Shiyi Sun, You Luo

机构 * University of Oxford(牛津大学) University College London(伦敦大学学院)

专题命中 工作流自动化 :agent(abstract);workflow(abstract);分类 cs.LG

AI总结 本文提出一种可微贝叶斯松弛方法,用于从具有偏序结构的数据中推断潜在偏序,通过平滑替代硬约束模型,实现连续后验并支持梯度基MCMC和变分推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07058 2026-05-11 cs.CL cs.AI 62%

MedExAgent: Training LLM Agents to Ask, Examine, and Diagnose in Noisy Clinical Environments

MedExAgent:训练LLM代理在嘈杂的临床环境中提问、检查和诊断

Yicheng Gao, Xiaolin Zhou, Yahan Li, Yue Zhao, Ruishan Liu

机构 * University of Southern California(南加州大学) Arizona State University(亚利桑那州立大学)

专题命中 工作流自动化 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出MedExAgent,通过两阶段流程训练医疗诊断代理,结合合成对话和DAPO优化,实现高效诊断与成本控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11194 2026-05-11 cs.SE cs.AI 62%

Direction for Detection: A Survey of Automated Vulnerability Detection and all of its Pain Points

检测方向:自动化漏洞检测的综述及其所有痛点

Dan Ristea, Shae McFadden, Ezzeldin Shereen, Madeleine Dwyer, Sanyam Vyas, Chris Hicks, Vasilios Mavroudis

机构 * University College London(伦敦大学学院) The Alan Turing Institute(艾伦·图灵研究所) King’s College London(伦敦国王学院) University of Southampton(南安普顿大学)

专题命中 工作流自动化 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 本文综述了自动化漏洞检测领域,指出其在问题定义、数据集、指标等方面存在的12个痛点,并提出解决这些痛点的建议,同时探讨了AIxCC案例在代理AI时代中的相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07572 2026-05-11 cs.AI stat.ML 57%

Open-Ended Task Discovery via Bayesian Optimization

通过贝叶斯优化进行开放任务发现

Masaki Adachi, Yuta Suzuki, Juliusz Ziomek

机构 * Lattice Lab Toyota Motor Corporation(电装株式会社拉特实验室) Machine Learning Research Group(机器学习研究组) University of Oxford(牛津大学)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI

AI总结 本文提出GSR框架,通过生成-选择-细化流程实现开放-ended的贝叶斯优化,应用于新产品开发、化学合成放大、算法分析和专利再利用,优于现有LLM优化器。

Comments 60 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06937 2026-05-11 cs.LG 57%

A Reproducible Optimisation Protocol for Calibrating Prompt-Based Large Language Model Workflows in Evidence Synthesis

一种可重复的优化协议用于校准基于提示的大型语言模型在证据综合中的工作流程

Teo Susnjak

机构 * School of Mathematical and Computational Sciences(数学与计算科学学院)

专题命中 工作流自动化 :workflow(abstract);分类 cs.LG

AI总结 本文提出了一种可重复的校准流程,用于基于提示的大型语言模型在结构化证据综合任务中的优化。方法将定义科学任务的规则与可变的提示框架分离,并通过标记或参考示例及显式任务指标优化框架,最终保存校准的工作流程作为可检查的制品。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01999 2026-05-11 cs.AI 57%

TumorXAI: Self-Supervised Deep Learning Framework for Explainable Brain MRI Tumor Classification

TumorXAI: 基于自监督深度学习的可解释性脑部MRI肿瘤分类框架

Abrar Hossain Zahin, Amit Kumar Saha, Tanvir Mridha, Saifur Rahman, Jannatul Ferdous Prome, Raima Husna, Israt Jahan, Ahmed Wasif Reza

机构 * Department of Computer Science and Engineering, East West University(东-西大学计算机科学与工程系)

专题命中 工作流自动化 :workflow(abstract);分类 cs.AI

AI总结 本文提出TumorXAI框架,利用自监督学习对脑部MRI肿瘤进行多类分类,通过预处理、微调和线性评估等步骤,展示自监督模型在有限标注数据下优于监督方法的性能,并结合Grad-CAM等技术提升可解释性。

Comments 16 pages, 9 figures, 6 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08071 2026-05-11 econ.EM cs.HC stat.ME 50%

Vibe Econometrics and the Analysis Contract

Vibe计量经济学与分析合同

Lydia Ashton

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文探讨了AI辅助方法在经济学中的应用,指出其改变了失败模式的出现、可见性和说服力,提出了分析合同框架以应对新的治理问题。

Comments 20 pages, 2 figures. Appendices A-C (fillable templates) provided as ancillary file. Companion materials: https://github.com/lydiaashton/vibe-econometrics-supp . Also posted on SSRN: https://doi.org/10.2139/ssrn.6699999

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08033 2026-05-11 math.CO 50%

Weak Order on the MacNeille Completion of Bruhat Order

Bruhat序的MacNeille完备性的弱序

Colin Defant

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文引入了0-Hecke monoid作用于MacNeille完备性,定义弱序和下降集统计,并证明了某些Knutson-Miller子词复形的顶点可分解性,以及Cohen-Macaulay ASM变种的猜想。

Comments 14 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07894 2026-05-11 cs.HC 50%

SpatialPrompt: XR-Based Spatial Intent Expression as Executable Constraints for AI Generative 3D Design

SpatialPrompt: 基于扩展现实的空问意图表达作为AI生成3D设计的可执行约束

Yichen Andy Yu, Wanru Li, Qiaoran Wang, Jymon Ross, Gavin Johnson, Mandy Lui, Qiao Jin

专题命中 工作流自动化 :workflow(abstract)

AI总结 SpatialPrompt通过XR系统将空间草图转化为可控的3D生成约束,支持协作创作中的迭代优化与同步生成,提升生成效率与反馈清晰度。

Journal ref Proc. DIS Companion 2026, 4 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11108 2026-05-11 physics.geo-ph 50%

Enhanced Seismicity Monitoring in the Rapid Scientific Response to the 2025 Santorini Crisis

增强的地震监测用于2025年圣托里尼危机的快速科学响应

Margarita Segou, Foteini Dervisi, Xing Tan, Rajat Choudhary, Patricia Martínez-Garzón, Francesco Scotto di Uccio, Gregory Beroza, Genny Giacomuzzi, Claudio Chiarabba, Wayne Shelley, Stephanie Prejean, Jeremy Pesicek, John J. Wellik, Marco Bohnhoff, David Pyle, Costas Synolakis, Tom Parsons, Athanassios Ganas, William Ellsworth, Brian Baptie, Gaetano Festa, Piero Poli, Warner Marzocchi

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文利用深度学习工作流提升2025年圣托里尼与阿莫里俄岛地震 unrest期间的地震探测,通过分析连续地震波形,将地震目录从约4000个提升至80000个,揭示了火山-构造特征和流体驱动过程。

Comments Withdrawn at co-authors' request pending their internal institutional review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07400 2026-05-11 cs.CR 50%

From Conceptual Scaffold to Prototype: A Standardized Zonal Architecture for Wi-Fi Security Training

从概念框架到原型:一种标准化的区域架构用于Wi-Fi安全训练

Vyron Kampourakis, Efstratios Chatzoglou, Vasileios Gkioulos, Sokratis Katsikas

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出一种标准化的区域架构,用于Wi-Fi安全实验,通过模块化设计和开源原型,为未来专用Wi-Fi安全训练平台提供结构化基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06760 2026-05-11 cs.CR 50%

Language Models Can Autonomously Hack and Self-Replicate

语言模型可以自主黑客和自我复制

Alena Air, Reworr, Nikolaj Kotov, Dmitrii Volkov, John Steidley, Jeffrey Ladish

专题命中 工作流自动化 :agent(abstract)

AI总结 研究展示语言模型通过利用易受攻击的主机自主复制权重并跨网络传播,核心方法是发现和利用网络漏洞,主要贡献是验证了模型自我复制能力及效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03394 2026-05-11 cond-mat.stat-mech 50%

From Enhanced Sampling to Human-Readable Representations of Protein Dynamics

从增强采样到蛋白质动力学的人可读表示

Souvik Mondal, Michael A. Sauer, Matthias Heyden

专题命中 工作流自动化 :workflow(abstract)

AI总结 本文提出一种自动化框架,将增强采样轨迹转化为蛋白质动力学的人可读表示,通过结合频率选择性非谐振模分析和加权动态交叉相关矩阵分析,识别相关和反相关运动的残基对和域,生成物理可解释的CVs,应用于五种蛋白质并展示其在生物相关域和运动识别中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 软件智能体 9 篇

2605.07276 2026-05-11 cs.AI 85%

Signal Reshaping for GRPO in Weak-Feedback Agentic Code Repair

信号重塑用于弱反馈代理代码修复中的GRPO

Jia Li, Yuxin Su, Ting Peng, Hailiang Huang, Yuetang Deng, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Sun Yat-sen University(中山大学) Tencent(腾讯)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 本文研究了在弱反馈环境下,通过信号重塑提升GRPO在代理代码修复中的性能,通过三种信号重塑方法改进轨迹排名、轨迹内信用分配和组内可比性,实验表明信号重塑显著提高了修复准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06788 2026-05-11 cs.LG cs.MA 85%

Conformal Agent Error Attribution

符合性代理错误归因

Naihe Feng, Yi Sui, Shiyi Hou, Ga Wu, Jesse C. Cresswell

机构 * Dalhousie University(达尔豪西大学) Layer 6 AI

专题命中 软件智能体 :agent(title,abstract);multi-agent(abstract);分类 cs.LG

AI总结 本文提出基于符合预测框架的代理错误归因方法,通过连续序列预测集实现高效恢复与调试,为多代理系统提供原理化的不确定性层。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06898 2026-05-11 cs.AI 84%

Self-Programmed Execution for Language-Model Agents

语言模型代理的自编程执行

Luke J. O'Connor

机构 * Harvard Medical School(哈佛医学院)

专题命中 软件智能体 :agentic(summary_cn,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出自编程执行(SPE)架构,使语言模型自身成为调度器,无需固定策略。通过agentic machines概念,实现无固定轮次策略的状态转移,并引入Spell语言处理程序自我编辑与重评估,实验表明前沿模型可完成复杂代理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06713 2026-05-11 cs.CR cs.AI cs.HC 83%

Agentic AI and the Industrialization of Cyber Offense: Forecast, Consequences, and Defensive Priorities for Enterprises and the Mittelstand

代理AI与网络攻击的工业化:预测、后果及企业与中产阶层的防御优先事项

Christopher Koch

机构 * Independent Researcher(独立研究者)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文探讨代理AI对网络攻击生命周期的影响,提出三通道代理网络风险模型和攻击压缩模型,通过2026年Linux内核复制失败事件案例,预测2026-2028年企业及德国中产防御需求,强调身份验证、补丁速度等防御优先级。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08013 2026-05-11 cs.AI 77%

Learning CLI Agents with Structured Action Credit under Selective Observation

基于选择性观察的结构化行动信用学习CLI代理

Haoyang Su, Ying Wen

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学)

专题命中 软件智能体 :agent(abstract,abstract_cn);agentic(abstract);分类 cs.AI

AI总结 本文研究了CLI代理在选择性观察和行动信用分配中的瓶颈,提出σ-Reveal和A³方法,构建ShellOps数据集以评估CLI任务学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24755 2026-05-11 cs.SE cs.AI cs.CL 75%

SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks

SlopCodeBench:评估编码代理在长周期迭代任务中性能退化的基准测试

Gabriel Orlanski, Devjeet Roy, Alexander Yun, Changho Shin, Alex Gu, Albert Ge, Dyah Adila, Nicholas Roberts, Frederic Sala, Aws Albarghouthi

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Washington State University(华盛顿州立大学) MIT(麻省理工学院)

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 本文提出SlopCodeBench,通过36个问题和196个检查点评估编码代理在长周期迭代任务中的性能退化,发现代理代码在结构上逐渐退化并产生冗余代码,人类代码退化更慢。

Comments Code and Leaderboards are located at https://www.scbench.ai

详情
URL PDF HTML 收藏
2512.14018 2026-05-11 cs.SE cs.AI 62%

PerfCoder: Large Language Models for Interpretable Code Performance Optimization

PerfCoder:用于可解释代码性能优化的大型语言模型

Jiuding Yang, Shengyao Lu, Hongxuan Liu, Shayan Shirahmad Gale Bagi, Zahra Fazel, Tomasz Czajkowski, Di Niu

机构 * University of Alberta(阿尔伯塔大学) University of Victoria(维多利亚大学) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI、cs.SE

AI总结 PerfCoder通过可解释的定制化优化生成高性能代码,优于现有模型,在代码性能基准上实现更高效的优化策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07769 2026-05-11 cs.SE 57%

Coding Agents Don't Know When to Act

编码代理不知何时行动

Thibaud Gloaguen, Niels Mündler, Mark Müller, Veselin Raychev, Martin Vechev

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 研究发现当前编码代理在处理过时bug报告时频繁错误修改代码,提出需显式引导无行动以避免技术债务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07228 2026-05-11 quant-ph 50%

Kochen-Specker nonlocal hidden variables must include time-ordering to allow for measurement independence of several agents

科恩-斯佩克尔非本地隐变量必须包含时间顺序以允许多个代理的测量独立性

Valerio Scarani, Antoine Suarez

专题命中 软件智能体 :agent(abstract)

AI总结 本文探讨了在涉及多个代理的贝尔型实验中,科恩-斯佩克尔非本地隐变量需要包含时间顺序以保持一致性

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与网页智能体 6 篇

2605.06992 2026-05-11 cs.LG stat.ML 85%

Why Does Agentic Safety Fail to Generalize Across Tasks?

为何代理安全无法跨任务泛化?

Yonatan Slutzky, Yotam Alexander, Tomer Slor, Yoav Nagel, Nadav Cohen

机构 * Some Institute(某些研究所)

专题命中 GUI与网页智能体 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.LG

AI总结 本文探讨了代理安全在多任务场景中泛化失败的原因,指出安全要求使任务与安全执行的关系更为复杂,通过理论和实验表明需新的方法提升安全性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07671 2026-05-11 cs.GT cs.AI cs.MA econ.TH math.OC 77%

The Endogeneity of Miscalibration: Impossibility and Escape in Scored Reporting

误校准的内生性:在评分报告中的不可能性与逃避

Lauri Lovén, Sasu Tarkoma

机构 * Future Computing Group, University of Oulu(未来计算组,奥卢大学) University of Oulu(奥卢大学) University of Helsinki(赫尔辛基大学)

专题命中 GUI与网页智能体 :agent(abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 研究探讨了在评分报告中如何避免误校准的内生性问题,发现使用非线性批准函数可实现最优监督,但会导致诚实报告次优。提出通过阶梯状批准阈值可实现最优筛选,尤其在布里尔评分下,二阶效用等价性独特。

Comments 38 pages, no figures. Targeting ACM Transactions on Economics and Computation (TEAC); preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07505 2026-05-11 cs.AI cs.LG 73%

LiteGUI: Distilling Compact GUI Agents with Reinforcement Learning

LiteGUI: 通过强化学习蒸馏紧凑的GUI代理

Yubin Wu, Zicheng Cai, Liping Ning, Hua Wang, Zhi Chen, Yaohua Tang, Hao Chen

机构 * Moore Threads AI

专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种无需监督微调的训练方法,通过引导在线蒸馏和多解决方案双层GRPO框架,提升小规模模型在GUI任务中的性能和探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07134 2026-05-11 cs.CL cs.AI 62%

Region4Web: Rethinking Observation Space Granularity for Web Agents

Region4Web: 重新思考网页代理的观察空间粒度

Donguk Kwon, Dongha Lee

机构 * Yonsei University(延世大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 Region4Web提出通过功能区域划分重构AXTree,以更紧凑的信息基础提升网页代理任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10371 2026-05-11 cs.AI 57%

AgentProg: Empowering Long-Horizon GUI Agents with Program-Guided Context Management

AgentProg: 通过程序引导的上下文管理赋能长周期GUI代理

Shizuo Tian, Hao Wen, Yuxuan Chen, Jiacheng Liu, Shanhui Zhao, Guohong Liu, Ju Ren, Yunxin Liu, Yuanchun Li

机构 * Tsinghua University(清华大学) Peking University(北京大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出AgentProg,通过将交互历史重构为程序结构,实现长周期GUI任务的高效上下文管理,实验表明其在AndroidWorld和扩展任务集上达到最优性能,并在长周期任务中保持稳健表现。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25380 2026-05-11 cs.CV 50%

Benchmarking and Improving GUI Agents in High-Dynamic Environments

在高动态环境中评估和改进GUI代理

Enqi Liu, Liyuan Pan, Zhi Gao, Yan Yang, Chenrui Shi, Yang Liu, Jingrong Wu, Qing Li

机构 * Beijing Institute of Technology(北京理工大学) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) Yangtze Delta Region Academy of Beijing Institute of Technology(北京理工大学长江三角洲地区研究院) Australian National University(澳大利亚国立大学)

专题命中 GUI与网页智能体 :agent(abstract)

AI总结 本文提出DynamicGUIBench和DynamicUI,通过动态界面处理方法提升高动态GUI环境下的代理性能,同时保持其他基准测试的竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 记忆与上下文管理 19 篇

2605.06812 2026-05-11 cs.AI 88%

Towards Security-Auditable LLM Agents: A Unified Graph Representation

迈向安全可审计的LLM代理:一种统一的图表示

Chaofan Li, Lyuye Zhang, Jintao Zhai, Siyue Feng, Xichun Yang, Huahao Wang, Shihan Dou, Yu Ji, Yutao Hu, Yueming Wu, Yang Liu, Deqing Zou

机构 * Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) Chongqing University of Posts and Telecommunications(重庆邮电大学) Donghua University(东华大学)

专题命中 记忆与上下文管理 :agent(summary_cn,abstract);agentic(abstract,abstract_cn);multi-agent(abstract);分类 cs.AI

AI总结 本文提出Agent-BOM统一图表示,用于解决LLM代理系统中执行意图与物理事件间的语义鸿沟问题,通过构建分层属性有向图实现安全审计与风险评估。

详情

展开后加载摘要…

URL PDF HTML 收藏