arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-04 至 2026-05-04 共收录 20 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 20 篇

2505.23723 2026-05-04 cs.CL cs.AI cs.LG 91%

ML-Agent: Reinforcing LLM Agents for Autonomous Machine Learning Engineering

ML-Agent: 通过强化学习增强大语言模型代理以实现自主机器学习工程

Zexi Liu, Jingyi Chai, Xinyu Zhu, Shuo Tang, Rui Ye, Bo Zhang, Lei Bai, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(title,title_cn);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出基于强化学习的代理机器学习框架,通过探索增强微调、分步强化学习和专用奖励模块,训练出性能媲美大模型但成本更低的ML-Agent,实现跨任务泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18829 2026-05-04 cs.CR cs.AI 86%

Agent Control Protocol: Admission Control for Agent Actions

代理控制协议:代理行为的准入控制

Marcelo Fernandez

机构 * TraslaIA

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文提出ACP协议,通过静态风险评分与状态信号结合,控制代理行为,实验显示其能显著降低恶意行为执行率,同时通过形式化验证确保安全性和活性。

Comments 95 pages. Paper 1 of 6 in the Agent Governance Series (Papers 0-6). Zenodo: https://doi.org/10.5281/zenodo.19672575. Companion: P0 (arXiv:2604.17511), P2/IML (arXiv:2604.17517), P3/4 (zenodo.19708496), P5/RAM (arXiv:2604.22898), P6 (zenodo.19699460). Spec: https://github.com/chelof100/acp-framework-en. v1.30: series updated to 6 papers, P3/4 consolidated, P6 added

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19932 2026-05-04 cs.AI 85%

CASE: An Agentic AI Framework for Enhancing Scam Intelligence in Digital Payments

CASE:一种增强数字支付中诈骗情报的代理AI框架

Nitish Jaipuria, Lorenzo Gatto, Zijun Kan, Shankey Poddar, Bill Cheung, Diksha Bansal, Ramanan Balakrishnan, Aviral Suri, Jose Estevez

机构 * Google, Inc(谷歌公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出CASE框架,通过收集和管理用户诈骗反馈,提升诈骗识别能力,实现在数字支付中21%的欺诈打击提升。

Comments 7 pages, 5 figures, Version published in IEEE Xplore

Journal ref 2025 IEEE International Conference on Big Data (BigData), Macau, China, 2025, pp. 2177-2183

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28139 2026-05-04 cs.SE cs.AI 84%

Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows

Claw-Eval-Live: 一个用于评估进化现实工作流的活体代理基准

Chenxin Li, Zhengyang Tang, Mingxin Huang, Yunlong Lin, Shijue Huang, Shengyuan Liu, Bowen Ye, Rang Li, Lei Li, Benyou Wang, Yixuan Yuan

机构 * The Chinese University of Hong Kong(香港中文大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) South China University of Technology(华南理工大学) Xiamen University(厦门大学) Peking University(北京大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 本文提出Claw-Eval-Live活体基准,通过分离可刷新信号层和可复现的发布快照,评估代理在动态工作流需求下的表现,发现可靠工作流自动化仍待解决,领先模型仅完成66.7%的任务。

Comments Project page: https://claw-eval-live.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00073 2026-05-04 cs.AI 83%

AgentReputation: A Decentralized Agentic AI Reputation Framework

AgentReputation: 一种去中心化的代理AI声誉框架

Mohd Sameen Chishti, Damilare Peter Oyinloye, Jingyue Li

机构 * Department of Computer Science(计算机科学系)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出AgentReputation框架,旨在解决去中心化代理AI市场中声誉机制失效的问题,通过分层架构和上下文感知声誉卡片实现声誉管理,同时提供风险驱动的决策引擎。

Comments 5 pages, 1 figure, accepted to FSE 2026, Ideas, Visions and Reflections track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10887 2026-05-04 cs.AI 83%

InfantAgent-Next: A Multimodal Generalist Agent for Automated Computer Interaction

InfantAgent-Next:一种用于自动化计算机交互的多模态通用代理

Bin Lei, Weitai Kang, Zijian Zhang, Winson Chen, Xi Xie, Shan Zuo, Mimi Xie, Ali Payani, Mingyi Hong, Yan Yan, Caiwen Ding

机构 * University of Minnesota(明尼苏达大学) University of Illinois Chicago(伊利诺伊大学香槟分校) University of Connecticut(康涅狄格大学) The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校) Cisco Research(思科研究)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 本文提出InfantAgent-Next,一种多模态通用代理,能够通过文本、图像、音频和视频与计算机交互。该代理结合工具型和纯视觉代理,在高度模块化架构中协同解决解耦任务。在OSWorld等基准上取得7.27%准确率,超越Claude-Computer-Use。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00382 2026-05-04 cs.SE cs.AI cs.SI 82%

Social Bias in LLM-Generated Code: Benchmark and Mitigation

LLM生成代码中的社会偏见:基准测试与缓解

Fazle Rabbi, Lin Ling, Song Wang, Jinqiu Yang

机构 * Concordia University(康科德大学) Lassonde School of Engineering, York University(York大学工程学院)

专题命中 Agent评测 :agent(summary_cn,abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 本文研究LLM生成代码中的社会偏见问题,通过SocialBias-Bench基准测试发现四种主流模型存在严重偏见,提出Fairness Monitor Agent (FMA)有效降低偏见并提升代码正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15367 2026-05-04 cs.CR cs.MA 82%

SoK: Security of Autonomous LLM Agents in Agentic Commerce

SoK:自主大语言模型代理在代理商业中的安全性

Qian'ang Mao, Jiaxin Wang, Ya Liu, Li Zhu, Cong Ma, Jiaqi Yan

专题命中 Agent评测 :agentic(title,abstract);agent(abstract)

AI总结 本文系统分析了自主LLM代理在商业中的安全问题,提出统一的安全框架,识别12种跨层攻击向量,并提出分层防御架构以解决现有协议的授权漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00383 2026-05-04 cs.CL 79%

Agentic AI for Substance Use Education: Integrating Regulatory and Scientific Knowledge Sources

代理AI用于物质使用教育:整合监管与科学知识源

Kosar Haghani, Zahra Kolagar, Mohammed Atiquzzaman

机构 * Department of Social Science, Texas Woman's University(德克萨斯女子大学社会科学系) Department of Computer Science, Augsburg University of Applied Sciences(应用科学大学计算机科学系) School of Computer Science, University of Oklahoma(俄克拉荷马大学计算机科学学院)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.CL

AI总结 本文提出一种基于代理的AI系统,结合监管数据与科学文献,提供实时、权威的物质使用教育,通过专家评估验证其准确性与适用性。

Comments 22 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00314 2026-05-04 cs.CR cs.AI cs.PL 79%

Semia: Auditing Agent Skills via Constraint-Guided Representation Synthesis

Semia:通过约束引导的表示合成审计代理技能

Hongbo Wen, Ying Li, Hanzhi Liu, Chaofan Shou, Yanju Chen, Yuan Tian, Yu Feng

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) University of California, Los Angeles(加州大学洛杉矶分校) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 Semia通过约束引导的表示合成技术,对代理技能进行静态审计,发现超过一半的技能存在关键语义风险,其召回率和F1值显著优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00007 2026-05-04 math.OC cs.AI stat.ML 70%

Mean-Field Path-Integral Diffusion: From Samples to Interacting Agents

均场路径积分扩散:从样本到交互代理

Michael Chertkov

机构 * Graduate Interdisciplinary Program in Applied Mathematics & Department of Mathematics, University of Arizona(应用数学联合计划与数学系,亚利桑那大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出均场路径积分扩散框架,通过共享统计量使样本协调传输概率质量,统一生成模型与多代理控制,证明在二次交互势能下,自洽引导是初始与目标均值的精确线性插值。

Comments 31 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14201 2026-05-04 cs.CR cs.AI cs.CL 62%

ExCyTIn-Bench: Evaluating LLM agents on Cyber Threat Investigation

ExCyTIn-Bench:评估LLM代理在网络安全调查中的表现

Yiran Wu, Mauricio Velazco, Andrew Zhao, Manuel Raúl Meléndez Luján, Srisuma Movva, Yogesh K Roy, Quang Nguyen, Roberto Rodriguez, Qingyun Wu, Michael Albada, Julia Kiseleva, Anand Mudgerikar

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Microsoft Security AI Research(微软安全AI研究) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 ExCyTIn-Bench是首个评估LLM代理在网络安全调查任务中的基准,通过从调查图中生成的安全问题进行测试。该基准利用Azure租户中的SQL环境和Microsoft Sentinel日志构建威胁调查图,并生成问题以评估LLM代理的能力。

Comments Accepted By ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00723 2026-05-04 stat.ML cs.LG math.PR 57%

Decentralized Proximal Stochastic Gradient Langevin Dynamics

去中心化近端随机梯度兰格朗日动力学

Mohammad Rafiqul Islam, Lingjiong Zhu

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出去中心化近端随机梯度兰格朗日动力学算法,用于在凸域内采样对数凹概率分布。通过共享的近端正则化约束,保证更新一致性。算法在2-瓦瑟斯坦距离下具有非渐近收敛性,并在合成和真实数据集上验证了其有效性。

Comments 42 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00420 2026-05-04 cs.MA cs.LG q-fin.GN 57%

Foresight Arena: An On-Chain Benchmark for Evaluating AI Forecasting Agents

前瞻性竞技场:一种去中心化的链上基准,用于评估AI预测代理

Maksym Nechepurenko, Pavel Shuvalov

机构 * Director of Research, Devnull(研发总监,Devnull) Chief Technology Officer, Devnull(首席技术官,Devnull)

专题命中 Agent评测 :AI agent(abstract);分类 cs.LG

AI总结 本文提出Foresight Arena,首个去中心化链上基准,用于评估AI预测代理在真实世界预测市场中的能力,通过概率预测和智能合约评估,结合Brier分数和Alpha分数衡量性能。

Comments 27 pages, 5 figures, 10 tables. Project page: https://foresightarena.xyz/. Code: https://github.com/foresight-arena/contracts

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00400 2026-05-04 cs.IR cs.CL 57%

FollowTable: A Benchmark for Instruction-Following Table Retrieval

FollowTable:一项指令遵循表格检索的基准测试

Rihui Jin, Yuchen Lu, Ting Zhang, Jun Wang, Kuicai Dong, Zhaocheng Du, Dongping Liu, Gang Wang, Yong Liu, Guilin Qi

机构 * Southeast University(东南大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education(新一代人工智能技术及其交叉应用国家重点实验室(东南大学)) Its Interdisciplinary Applications (Southeast University), Ministry of Education(交叉应用(东南大学),教育部)

专题命中 Agent评测 :agentic(abstract);分类 cs.CL

AI总结 本文提出了一项新的表格检索任务IFTR,要求模型同时满足主题相关性和细粒度指令约束。通过引入FollowTable基准测试,评估模型在遵循指令方面的表现,发现现有检索模型在处理表格数据时存在系统性偏差。

Comments SIGIR 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00281 2026-05-04 cs.LG cs.MA math.OC 57%

High-Probability Convergence in Decentralized Stochastic Optimization with Gradient Tracking

去中心化随机优化中带有梯度跟踪的高概率收敛性

Aleksandar Armacki, Haoyuan Cai, Ali H. Sayed

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文研究去中心化随机优化中的高概率收敛性,提出结合梯度跟踪技术的DSGD算法,证明其在非凸和Polyak-Łojasiewicz成本下的最优收敛率,且在放松的子高斯条件下实现高概率收敛。

Comments 49 pages, 4 figures. arXiv admin note: text overlap with arXiv:2510.06141

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00074 2026-05-04 cs.CY cs.AI 57%

Adoption and Use of LLMs at an Academic Medical Center

学术医疗中心中大语言模型的采用与使用

Nigam H. Shah, Nerissa Ambers, Abby Pandya, Timothy Keyes, Juan M. Banda, Srikar Nallan, Carlene Lugtu, Artem A. Trotsyuk, Suhana Bedi, Alyssa Unell, Miguel Fuentes, Francois Grolleau, Sneha S. Jain, Jonathan Chen, Devdutta Dash, Danton Char, Aditya Sharma, Duncan McElfresh, Patrick Scully, Vishanthan Kumar, Clancy Dennis, Connor OBrien, Satchi Mouniswamy, Elvis Jones, Krishna Jasti, Gunavathi Mannika Lakshmanan, Sree Ram Akula, Varun Kumar Singh, Ramesh Rajmanickam, Sudhir Sinha, Vicky Zhou, Xu Wang, Bilal Mawji, Joshua Ge, Wencheng Li, Travis Lyons, Jarrod Helzer, Vikas Kakkar, Ramesh Powar, Darren Batara, Cheryl Cordova, William Frederick, Olivia Tang, Phoebe Morgan, April S. Liang, Stephen P. Ma, Shivam Vedak, Dong-han Yao, Akshay Swaminathan, Mehr Kashyap, Brian Ng, Jamie Hellman, Nikesh Kotecha, Christopher Sharp, Gretchen Brown, Christian Lindmark, Anurang Revri, Michael A. Pfeffer

机构 * Stanford Medicine, Technology and Digital Solutions(斯坦福医学院技术与数字解决方案)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 本文提出ChatEHR系统,通过整合患者多年医疗记录,实现LLM在临床文档中的自动化与交互应用,提升医疗效率与数据准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08597 2026-05-04 cs.GT cs.AI cs.MA econ.TH 57%

Markets with Heterogeneous Agents: Dynamics and Survival of Bayesian vs. No-Regret Learners

异质主体市场:贝叶斯学习者与无遗憾学习者的动态与生存

David Easley, Yoav Kolumbus, Eva Tardos

机构 * Cornell University(康奈尔大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究比较贝叶斯学习者与无遗憾学习者在资产市场中的表现,探讨其生存条件及市场主导因素,提出混合策略提升鲁棒性与适应性。

Comments Learning in Markets, Heterogeneous Agents, Regret and Survival, Bayesian Learning, No-Regret Learning, Portfolio Optimization, Kelly Rule, Distribution Shifts, Robust Bayesian Updates

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26858 2026-05-04 physics.soc-ph 50%

A well-motivated model of pedestrian dynamics

一种有说服力的行人动力学模型

Ezel Üsten, Anna Sieben, Mohcine Chraibi, Armin Seyfried

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出基于期望-价值理论的动态动机模型,通过考虑目标接近度、相对位置和个体目标重要性,动态调节行人移动参数,模拟预瓶颈等待场景,揭示人群自我组织的异质性特征。

Comments 35 pages, 12 figures, 2 tables. Manuscript prepared for submission to a Springer journal. Using JuPedSim 1.4.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07041 2026-05-04 cs.DC 50%

AIReSim: A Discrete Event Simulator for Large-scale AI Cluster Reliability Modeling

AIReSim:用于大规模AI集群可靠性建模的离散事件模拟器

Karthik Pattabiraman, Mihir Patel, Fred Lin

专题命中 Agent评测 :planning(abstract)

AI总结 本文提出AIReSim,用于评估大规模AI集群中故障、恢复、调度和修复过程中的设计选择,通过系统性评估参数对整体可靠性的影响,帮助优先改进系统。

Comments To appear in the Industry track of the IEEE/IFIP International Conference on Dependable Systems and Networks (DSN), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏