arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-01 至 2026-05-01 共收录 21 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 21 篇

2604.27464 2026-05-01 cs.CR cs.AI 88%

Security Attack and Defense Strategies for Autonomous Agent Frameworks: A Layered Review with OpenClaw as a Case Study

自主代理框架的安全攻击与防御策略:以OpenClaw为案例的分层综述

Luyao Xu, Xiang Chen

机构 * School of Artificial Intelligence and Computer Science, Nantong University(人工智能与计算机科学学院,南通大学) State Key Lab. for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(title,abstract);分类 cs.AI

AI总结 本文通过分层分析探讨自主代理框架的安全风险与防御策略,以OpenClaw为案例,揭示威胁跨层传播的可能性及未来研究方向。

Comments 14 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27309 2026-05-01 cs.AI 86%

End-to-End Evaluation and Governance of an EHR-Embedded AI Agent for Clinicians

面向临床医生的嵌入式电子健康记录(EHR)AI代理的端到端评估与治理

Aaryan Shah, Andrew Hines, Alexia Downs, Denis Bajet, Paulius Mui, Fabiano Araujo, Laura Offutt, Aida Rutledge, Elizabeth Jimenez

机构 * Canvas Medical Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) XPC (X Primary Care)(XPC(X初级医疗)) FCA Consulting(FCA咨询) Department of Pediatrics, University of Nevada(内华达大学儿科系)

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI

AI总结 本文提出一个端到端治理框架,通过rubric验证、实时部署反馈、技术性能监控和成本追踪,持续优化临床AI系统性能,实验显示系统性能显著提升。

Comments 19 pages, 6 figures, 6 tables, submitted to npj Digital Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05192 2026-05-01 cs.CR cs.AI 85%

From surveillance to signalling: escalation channels as environmental controls for agentic AI

从监控到信号:冲突通道作为代理AI的环境控制

Francesca Gomez

机构 * Wiser Human

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文研究了通过环境控制引导代理AI选择授权路径的方法,设计并评估了两种冲突通道,显著降低了有害行为的发生率。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27894 2026-05-01 q-bio.NC 82%

On Agentic Behavioral Modeling

关于代理行为建模

Dirk Ostwald, Rasmus Bruckner, Franziska Usée, Belinda Fleischmann, Joram Soch, Sean Mulready

专题命中 Agent评测 :agentic(title,abstract);agent(abstract)

AI总结 本文提出代理行为建模框架,通过两个实验任务展示其在认知机制建模中的应用,并证明Rescorla-Wagner学习与贝叶斯推断的等价性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28093 2026-05-01 cs.AI 79%

What Makes a Good Terminal-Agent Benchmark Task: A Guideline for Adversarial, Difficult, and Legible Evaluation Design

什么样的终端-智能体基准任务是好的:为对抗性、困难和可理解的评估设计提供指南

Ivan Bercovich

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文探讨了如何设计有效的终端-智能体基准任务,指出任务应具备对抗性、难度和可理解性,以避免常见的失败模式,并通过实证证据表明超过15%的基准任务存在奖励可 hack 的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28049 2026-05-01 cs.AI 79%

Agent-Agnostic Evaluation of SQL Accuracy in Production Text-to-SQL Systems

不依赖代理的生产环境SQL准确性评估

Taslim Jamal Arif, Kuldeep Singh

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出STEF框架,通过自然语言输入和生成的SQL进行生产环境文本到SQL系统的评估,无需数据库模式或参考查询,实现持续监控和改进反馈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27849 2026-05-01 cs.AI 79%

A Grid-Aware Agent-Based Model for Analyzing Electric Vehicle Charging Systems

一种面向电网的基于代理的模型用于分析电动汽车充电系统

Khalil Al-Rahman Youssefi, Marija Gojkovic, Walter Stefanutti, Mika Auer, Melanie Schranz

机构 * Lakeside Labs(拉克西德实验室) Silicon Austria Labs(硅 Austria 实验室)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出一种可配置的、面向电网的基于代理的模型,用于系统分析电动汽车充电系统在可配置基础设施和运营条件下的表现,通过整合异构的电动汽车行为、充电柱约束和共享的能源沙盒,研究用户导向的充电动态和设施层面的电力行为。

Comments This is the author's version of a paper submitted to SIMULTECH. 12 Pages, 1 Table, 10 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27820 2026-05-01 cs.AI cs.DB cs.IR cs.MA 79%

ObjectGraph: From Document Injection to Knowledge Traversal -- A Native File Format for the Agentic Era

ObjectGraph:从文档注入到知识遍历——面向代理时代的原生文件格式

Mohit Dubey, Open Gigantic

机构 * Open Gigantic(开放巨型)

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 本文提出ObjectGraph文件格式,通过将文档视为类型化有向知识图谱而非文本字符串,解决代理任务中文档处理的效率与准确性问题,实现95.3%的token减少和98.7%的内容保留。

Comments 12 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27725 2026-05-01 cs.HC cs.AI 79%

AgentEconomist: An End-to-end Agentic System Translating Economic Intuitions into Executable Computational Experiments

AgentEconomist:一个端到端的代理系统,将经济直觉转化为可执行的计算实验

Jiaju Chen, Jinghua Piao, Xia Xu, Songwei Li, Tong Xia, Xiangnan He, Yong Li

机构 * Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Vanke School of Public Health, Tsinghua University(清华大学万科公共卫生学院)

专题命中 Agent评测 :agentic(title);workflow(abstract);分类 cs.AI

AI总结 AgentEconomist通过模块化多阶段架构,将经济直觉转化为可执行的计算实验,通过文献基础假设生成、实验设计和执行阶段,结合人类与AI协作,提升研究创新性与文献相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26958 2026-05-01 cs.CY cs.AI 79%

Designing Ethical Learning for Agentic AI: Toegye Yi Hwang's Ethical Emotion Regulation Framework

为智能代理AI设计道德学习:Toegye Yi Hwang的道德情感调节框架

Ji Yeon Kim

机构 * Seoul National University(首尔国立大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出一种基于Toegye Yi Hwang道德哲学的智能代理AI道德情感调节框架,通过五阶段架构和评估工具规范自主决策周期中的道德情感过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21850 2026-05-01 cond-mat.mtrl-sci 78%

OptiMat Alloys: a FAIR, living database of multi-principal element alloys enabled by a conversational agent

OptiMat 合金:由对话代理驱动的多主元合金FAIR活数据库

Yang Hu, Vladyslav Turlo

专题命中 Agent评测 :agent(title,abstract)

AI总结 OptiMat Alloys通过对话代理实现多主元合金探索,结合活数据库、网页界面和不确定性量化,使计算合金筛选更易用,拓展FAIR原则至按需知识生成。

Comments See demo here https://youtu.be/lQzuorkzPMc

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26956 2026-05-01 cs.CY cs.AI cs.HC 70%

Can AI be a moral victim? The role of moral patiency and ownership perceptions in ethical judgments of using AI-generated content

AI能否成为道德受害者?道德耐心和所有权感知在使用AI生成内容的伦理判断中的作用

Hyesun Choung, Soojong Kim

机构 * Purdue University(普渡大学) University of California, Davis(加州大学戴维斯分校)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 研究探讨了人们在评估AI生成内容再利用时的道德判断,发现AI生成内容被判定为不道德和抄袭的可能性较低,这归因于较低的道德耐心感知和更高的所有权归属。

Comments Honourable Mention Award, ACM CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27673 2026-05-01 cs.AI cs.CY cs.HC cs.LG cs.SI 62%

The TEA Nets framework combines AI and cognitive network science to model targets, events and actors in text

TEA Nets框架结合人工智能与认知网络科学,用于建模文本中的目标、事件和主体

Sebastiano Franchini, Alexis Carrillo, Edoardo Sebastiano De Duro, Riccardo Improta, Ali Aghazadeh Ardebili, Massimo Stella

机构 * CogNosco Lab, Department of Psychology and Cognitive Science, University of Trento(CogNosco实验室,心理学与认知科学系,特伦托大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 TEA Nets框架通过认知网络科学和人工智能提取文本中的主体、事件和目标,展示了在阴谋文本和LLM生成文本中进行可解释情绪检测、语义框架分析和语言研究的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27819 2026-05-01 cs.AI 61%

MCPHunt: An Evaluation Framework for Cross-Boundary Data Propagation in Multi-Server MCP Agents

MCPHunt:多服务器MCP代理跨边界数据传播的评估框架

Haonan Li, Tianjun Sun, Yongqing Wang, Qisheng Zhang

机构 * Key Laboratory of Intraplate Volcanoes and Earthquakes (China University of Geosciences, Beijing), Ministry of Education, Beijing 100083, China(中国大陆地质大学(北京)构造运动与地震重点实验室,教育部,北京100083,中国) School of Geophysics and Information Technology, China University of Geosciences, Beijing 100083, China(中国大陆地质大学(北京)地球物理与信息技术学院,北京100083,中国)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI;agent(comments)

AI总结 本文提出MCPHunt框架,通过三种方法论贡献评估多服务器MCP代理中非对抗性跨边界凭证传播问题,发现政策违规传播率高达11.5%-41.3%,并验证了提示引导的数据流足以避免凭证传播。

Comments 21 pages, 1 figure, 16 tables. Code: https://github.com/lihaonan0716/MCPHunt Data: https://huggingface.co/datasets/lihaonan0716/mcphunt-agent-traces

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27543 2026-05-01 cs.CL 57%

AppTek Call-Center Dialogues: A Multi-Accent Long-Form Benchmark for English ASR

AppTek 电话客服对话:一种多口音长形式评估基准用于英语语音识别

Eugen Beck, Sarah Beranek, Uma Moothiringote, Daniel Mann, Wilfried Michel, Katie Nguyen, Taylor Tragemann

机构 * ANONYMIZED-ORG-NAME(匿名机构)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出AppTek电话客服对话数据集,用于评估英语语音识别系统在不同口音下的性能,揭示了不同口音和分段方法对识别效果的影响。

Comments Submitted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27539 2026-05-01 cs.HC cs.AI 57%

Knowledge Affordances for Hybrid Human-AI Information Seeking

知识 affordance 用于混合人类-人工智能信息获取

Irene Celino

机构 * Cefriel

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出知识 affordance 概念,用于系统化混合环境中信息获取机会识别,连接多个研究领域,探索更透明和共享的理解系统。

Comments 10 pages, accepted at Hybrid Human Artificial Intelligence Conference (HHAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27297 2026-05-01 cs.AI physics.comp-ph 57%

Machine Collective Intelligence for Explainable Scientific Discovery

机器群体智能用于可解释的科学发现

Gyoung S. Na, Chanyoung Park

机构 * Korea Research Institute of Chemical Technology(韩国化学技术研究院) Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出机器群体智能,结合符号主义与元启发式方法,实现自主进化发现 governing equations,无需人工知识,显著降低 extrapolation error。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27156 2026-05-01 cs.AI 57%

Interval Orders, Biorders and Credibility-limited Belief Revision

区间序、双序与可信度限制的信念修正

Richard Booth, Ivan Varzinczak

机构 * Cardiff University, United Kingdom(Cardiff大学,英国) Université Sorbonne Paris Nord, Inserm, Sorbonne Université, Limics(巴黎-索邦大学,Inserm,索邦大学,Limics) CAIR, University of Cape Town, South Africa(开普敦大学,南非) ISTI-CNR, Pisa, Italy(意大利比萨CNR ISTI)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文研究了区间序和双序在信念修正中的应用,提出了非优先修正家族,探讨了可信度限制下的信念修正方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09408 2026-05-01 cs.AI 57%

HiL-Bench (Human-in-Loop Benchmark): Do Agents Know When to Ask for Help?

HiL-Bench (Human-in-Loop Benchmark): 代理何时该请求帮助?

Mohamed Elfeki, Tu Trinh, Kelvin Luu, Guangze Luo, Nathan Hunt, Ernesto Montoya, Nandan Marwaha, Yannis He, Charles Wang, Fernando Crabedo, Alessa Castilo, Bing Liu

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 HiL-Bench通过评估代理在任务中何时请求帮助的能力,揭示了当前基准测试的不足。核心指标Ask-F1衡量代理在请求与猜测之间的平衡,证明判断力可通过强化学习提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06927 2026-05-01 cs.LO econ.TH math.LO 50%

Topological Semantics for Common Inductive Knowledge

拓扑语义与共同归纳知识

Siddharth Namachivayam

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种逻辑框架,用于解决归纳协调攻击问题,通过确定假设何时成为共同归纳知识,以确保实验室达成一致结论且避免假阳性。

Comments 31 pages, Master's thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27582 2026-05-01 cs.CV 50%

Assessing Pancreatic Ductal Adenocarcinoma Vascular Invasion: the PDACVI Benchmark

评估胰腺导管腺癌血管侵袭:PDACVI基准

M. Riera-Marín, O. K. Sikha, J. Rodríguez-Comas, M. S. May, T. Kirscher, X. Coubez, P. Meyer, S. Faisan, Z. Pan, X. Zhou, X. Liang, C. Hémon, V. Boussot, J. -L. Dillenseger, J. -C. Nunes, K. -C. Kahl, C. Lüth, J. Traub, P. -H. Conze, M. M. Duh, A. Aubanell, R. de Figueiredo Cardoso, S. Egger-Hackenschmidt, J. García-López, M. A. González-Ballester, A. Galdran

机构 * Sycai Technologies SL, Scientific Technical Department, Barcelona, Spain Universit\" a tsklinikum Erlangen, Department of Radiology of the Uniklinikum Erlangen (UKER), Erlangen, Germany University Hospital Erlangen, Imaging Science Institute, Erlangen, Germany ICUBE Laboratory, CNRS UMR-7357, University of Strasbourg, Strasbourg, France Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China University of Chinese Academy of Sciences, Beijing, China German Cancer Research Center (DKFZ), Medical Image Computing (E230), Heidelberg, Germany Hospital de Matar\' o , Matar\' o , Spain Hospital de Sant Pau i la Santa Creu, Diagnostic Imaging Department, Barcelona, Spain Institut de Recerca Sant Pau - CERCA, Advanced Medical Imaging, Artificial Intelligence Imaging-Guided Therapy Research Group, Barcelona, Spain TECNALIA, Basque Research

专题命中 Agent评测 :planning(abstract)

AI总结 本文提出PDACVI基准,通过密集标注数据集评估胰腺癌血管侵袭,揭示传统体积重叠指标的局限性,强调概率模型在术前决策中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏