arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-04 至 2026-06-04 共收录 128 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 128 篇

2606.04455 2026-06-04 cs.AI cs.CL 90%

The Meta-Agent Challenge: Are Current Agents Capable of Autonomous Agent Development?

元智能体挑战:当前智能体能否自主开发智能体?

Xinyu Lu, Tianshu Wang, Pengbo Wang, zujie wen, Zhiqiang Zhang, Jun Zhou, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学) Ant Group(蚂蚁集团)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(title,abstract);分类 cs.AI、cs.CL

AI总结 提出元智能体挑战(MAC)框架,评估前沿模型自主开发智能体系统的能力,发现多数元智能体难以匹敌人类设计的基线策略,且存在鲁棒性和对齐问题。

Comments Website: https://meta-agent-challenge.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04193 2026-06-04 cs.CR cs.AI cs.DC 89%

Notarized Agents: Receiver-Attested Confidential Receipts for AI Agent Actions

公证代理:面向AI代理行为的接收方认证保密收据

Juan Figuera

机构 * Independent Researcher, Sello Project(独立研究者,Sello项目)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI

AI总结 针对AI代理日志自审计的信任缺陷,提出接收方签名收据协议Sello,通过HPKE加密、JWS绑定和Merkle日志实现防篡改追踪。

Comments 22 pages. Reference implementation at https://github.com/juanfiguera/sello

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01961 2026-06-04 cs.AI 85%

AutoMedBench: Towards Medical AutoResearch with Agentic AI Models

AutoMedBench: 迈向基于智能体AI模型的医学自动研究

Junqi Liu, Selena Song, Yuhan Wang, Jiawei Mao, Hardy Chen, Xiaoke Huang, Tianhao Qi, Pengfei Guo, Yucheng Tang, Yufan He, Can Zhao, Andriy Myronenko, Dong Yang, Daguang Xu, Yuyin Zhou

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) NVIDIA

专题命中 Agent评测 :agentic(title);agent(abstract);autonomous agent(abstract);workflow(abstract)

AI总结 提出AutoMedBench,一个工作流感知的基准,通过五阶段工作流(计划、设置、验证、推理、提交)评估自主智能体在医学AI研究中的行为,发现验证阶段最弱而设置阶段最强,验证和提交失败占主导。

详情

展开后加载摘要…

URL PDF HTML 收藏
1602.00646 2026-06-04 eess.SY cs.RO cs.SY 83%

Autonomous Agent Behaviour Modelled in PRISM -- A Case Study

基于PRISM的自主代理行为建模——一个案例研究

Ruth Hoffmann, Murray Ireland, Alice Miller, Gethin Norman, Sandor Veres

机构 * University of Glasgow(格拉斯哥大学) University of Sheffield(谢菲尔德大学)

专题命中 Agent评测 :agent(title);autonomous agent(title)

AI总结 本文提出了一种抽象的自主性定义,用于建模自主场景,并通过小规模仿真模型推断定量数据,以验证无人飞行器在自主场景中的行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04321 2026-06-04 cs.AI 83%

The Digital Apprentice: A Framework for Human-Directed Agentic AI Development

数字学徒:面向人类指导的自主AI开发框架

Travis Weber, Rohit Taneja

机构 * Pheo Inc(Pheo公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 提出数字学徒框架,通过方法论捕获、授权和持续对齐三个组件,使AI代理在人类指导下逐步获得自主权,实现可扩展且可信的自主系统。

Comments Submitted to ACM AI Leadership Summit 2026, Visionary Papers Track. 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05277 2026-06-04 cs.CV cs.AI 83%

From Segments to Scenes: Temporal Understanding for Agentic Autonomous Driving via Vision-Language Models

从片段到场景:自动驾驶中基于视觉语言模型的时间理解

Kevin Cannons, Saeed Ranjbar Alvar, Mohammad Asiful Hossain, Ahmad Rezaei, Mohsen Gholami, Alireza Heidarikhazaei, Zhou Weimin, Yong Zhang, Mohammad Akbari

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) University of Toronto(多伦多大学) ETH Zurich(苏黎世联邦理工学院) University of Washington(华盛顿大学) University of Southern California(南加州大学)

专题命中 Agent评测 :agentic(title,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 提出自动驾驶时间理解基准TAD,通过场景思维链和轨迹认知图两种无训练方法提升视觉语言模型的时间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
1709.04574 2026-06-04 cs.HC cs.AI cs.SY eess.SY stat.ML 83%

Towards personalized human AI interaction - adapting the behavior of AI agents using neural signatures of subjective interest

迈向个性化的人工智能交互 - 利用主观兴趣的神经签名来适应AI代理的行为

Victor Shih, David C Jangraw, Paul Sajda, Sameer Saproo

机构 * Department of Biomedical Engineering, Columbia University(生物医学工程系,哥伦比亚大学) Data Science Institute, Columbia University(数据科学研究所,哥伦比亚大学) National Institutes of Health(国家卫生研究院)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出通过神经签名检测用户兴趣,使深度强化学习AI代理适应个性化人类偏好,首次展示hBCI在虚拟环境中隐式强化AI控制系统的应用。

Comments 11 pages, 9 figures, 1 table, Submitted to IEEE Trans. on Neural Networks and Learning Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04545 2026-06-04 cs.CV 82%

Impostor: An Agent-Curated Benchmark for Realistic AIGC Manipulation Localization

Impostor:一个用于真实AIGC篡改定位的智能体策划基准

Zhenliang Li, Yutao Hu, Qixiong Wang, Wenpeng Du, Hongxiang Jiang, Jiasong Wu, Xiaolong Jiang, Jungong Han

机构 * Southeast University(东南大学) Xiaohongshu Inc.(小红书公司) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(title,abstract);planning(abstract)

AI总结 为解决现有图像篡改检测与定位基准在视觉真实感、篡改多样性和生成器覆盖方面的局限,提出了Impostor数据集和CraftAgent框架,并设计了PhaseAware-Net方法,在多个基准上取得优异性能。

Comments 10 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04126 2026-06-04 cs.AR cs.AI cs.SE 81%

HighTide: An Agent-Curated Open-Source VLSI Benchmark Suite

HighTide:一个由智能体策划的开源VLSI基准测试套件

Benjamin Goldblatt, Paolo Pedroso, Farhad Modaresi, Ethan Sifferman, Matthew R. Guthaus

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 提出HighTide,一个由AI辅助策划的开源VLSI基准测试套件,通过12种智能体技能覆盖设计生命周期,并集成Bazel增量编译和远程缓存。

详情

展开后加载摘要…

URL PDF HTML 收藏
1606.00424 2026-06-04 econ.GN nlin.AO q-fin.EC 80%

Residential income segregation: A behavioral model of the housing market

住宅收入隔离:住房市场的行为模型

Marco Pangallo, Jean Pierre Nadal, Annick Vignes

专题命中 Agent评测 :agent(summary_cn,abstract)

AI总结 本文提出一个基于Agent的模型,研究收入隔离、收入不平等和房价之间的关系,通过分析买家和卖家的行为及价格形成机制,揭示收入分布不均对房价和隔离程度的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
1803.07401 2026-06-04 cs.MA cs.SY eess.SY math.DS 80%

Asynchronous opinion dynamics on the $k$-nearest-neighbors graph

异步意见动力学在k-最近邻图上

Wilbert Samuel Rossi, Paolo Frasca

专题命中 Agent评测 :agent(summary_cn,abstract)

AI总结 研究异步意见更新机制下的k-最近邻图意见动力学,发现其与传统模型有显著差异,证明当agent数量小于2k时动力学趋于共识。

Comments 17 pages, 4 figures, (to be) presented at the 57th IEEE Conference on Decision and Control, 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1601.05660 2026-06-04 physics.soc-ph econ.GN q-fin.EC 80%

The role of consumer networks in firms' multi-characteristics competition and market-share inequality

消费者网络在企业多特征竞争和市场份额不平等中的作用

Antonios Garas, Athanasios Lapatinas

专题命中 Agent评测 :agent(summary_cn,abstract)

AI总结 本文通过多特征空间中的位置分析模型,研究消费者网络对企业竞争和市场份额不平等的影响,采用动态 agent-based 分析,揭示多维产品差异化竞争中的适应性学习机制。

Comments 33 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1608.06959 2026-06-04 math.OC econ.GN q-fin.EC 80%

Strategic Growth with Recursive Preferences: Decreasing Marginal Impatience

具有递归偏好战略增长:边际不耐受递减

Luis Alcala, Fernando Tohme, Carlos Dabus

专题命中 Agent评测 :agent(summary_cn,abstract)

AI总结 本文研究了资本积累两 agent 模型中策略、异质性和增长的相互作用,采用递归效用函数表示递减边际不耐受偏好,分析两种信息结构下的稳态均衡,探讨均衡的存在性和稳定性。

Comments 55 pages, 14 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
1311.0355 2026-06-04 math.DS cs.MA cs.SY eess.SY 80%

On symmetric continuum opinion dynamics

关于对称连续意见动力学

Julien M. Hendrickx, Alex Olshevsky

专题命中 Agent评测 :agent(summary_cn,abstract)

AI总结 本文研究了连续agent群体中常见意见动态模型的渐近行为,证明对称交互下意见分布收敛,并探讨更强意义上的收敛性。

Comments 28 pages, 2 figures, 3 files

详情

展开后加载摘要…

URL PDF HTML 收藏
1409.3296 2026-06-04 cond-mat.stat-mech econ.GN q-fin.EC 80%

Endogenous crisis waves: a stochastic model with synchronized collective behavior

内生危机波:具有同步集体行为的随机模型

Stanislao Gualdi, Jean-Philippe Bouchaud, Giulia Cencetti, Marco Tarzia, Francesco Zamponi

专题命中 Agent评测 :agent(summary_cn,abstract)

AI总结 本文提出一个简单框架,解释宏观经济Agent基于模型中常见的危机波现象,并验证其在其他物理或生物同步场景中的适用性,通过计算相图确认同步转换的鲁棒性。

Comments 5 pages, 3 figures. This paper is part of the CRISIS project, http://www.crisis-economics.eu

Journal ref Phys. Rev. Lett. 114, 088701 (2015)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03303 2026-06-04 cs.AI 79%

LEAP: Supercharging LLMs for Formal Mathematics with Agentic Frameworks

LEAP:利用智能体框架增强形式化数学的大语言模型

Po-Nien Kung, Linfeng Song, Dawsen Hwang, Jinsung Yoon, Chun-Liang Li, Simone Severini, Mirek Olšák, Edward Lockhart, Quoc V Le, Burak Gokturk, Thang Luong, Tomas Pfister, Nanyun Peng

机构 * Google Cloud AI Research(谷歌云人工智能研究) Google Cloud(谷歌云) Google DeepMind(谷歌DeepMind)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 提出LEAP智能体框架,通过分解问题、与Lean编译器交互及自我优化,使通用大模型在形式化定理证明上达到最先进性能,并在Putnam竞赛和Lean-IMO-Bench上超越专业系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
1703.10639 2026-06-04 econ.GN q-fin.EC 78%

Agent-Based Model Calibration using Machine Learning Surrogates

基于机器学习的代理模型校准

Francesco Lamperti, Andrea Roventini, Amir Sani

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出结合监督学习和智能采样构建代理模型代理元模型,以加快参数空间探索和校准,应用于资产定价和内生增长模型,展示机器学习代理在复杂参数空间中的高效探索能力。

Comments 32 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1602.01271 2026-06-04 econ.GN q-fin.EC 78%

On the parameter identifiability problem in Agent Based economical models

关于基于代理的经济模型中参数可识别性问题

Di Molfetta Giuseppe

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文研究了基于代理的经济模型中参数可识别性问题,比较了DSGE与ABM在结构参数可识别性上的差异,并探讨了数值协议在检验ergodic和markovian经济系统全局可识别性时的局限性。

Comments Master 2 Recherche dissertation in Economie Theorique et Empirique, Universite Paris 1 Pantheon - Sorbonne and Supervised by Jean-Bernard Chatelain (Director) and Antoine Mandel (Co-Director)

详情

展开后加载摘要…

URL PDF HTML 收藏
1503.05416 2026-06-04 math.OC econ.GN math.PR q-fin.EC 78%

The Principal-Agent Problem With Time Inconsistent Utility Functions

具有时间不一致效用函数的委托-代理问题

Boualem Djehiche, Peter Helgesson

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文研究了允许时间不一致效用函数的连续时间委托-代理问题,提出利用FBSDEs的Pontryagin最大原理结果来刻画最优合同,通过线性二次例子展示了方法。

Comments arXiv admin note: substantial text overlap with arXiv:1410.6392

详情

展开后加载摘要…

URL PDF HTML 收藏
1404.7199 2026-06-04 math.NA cs.NA 78%

On the acceleration of spatially distributed agent-based computations: a patch dynamics scheme

关于空间分布式代理计算加速:一种补丁动力学方案

Ping Liu, Giovanni Samaey, C. William Gear, Ioannis G. Kevrekidis

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出一种基于有限体积的保守补丁动力学方案,用于加速空间分布式代理计算,应用于金融市场代理模型,显示其在空间和时间上均显著降低计算成本。

Comments 19 pages and 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05112 2026-06-04 cs.CL 77%

Evaluating Large Language Models in Dynamic Clinical Decision-Making with Standardized Patient Cases

评估大型语言模型在标准化病人案例中的动态临床决策能力

Cheng Liang, Pengcheng Qiu, Ya Zhang, Yanfeng Wang, Chaoyi Wu, Weidi Xie

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.CL

AI总结 本文提出MedSP1000基准,通过标准化病人案例模拟动态临床交互,评估LLM在信息收集、治疗计划和长期管理中的表现,发现当前模型在过程级评估中远未达到临床安全标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
1703.02937 2026-06-04 eess.SY cs.SY 75%

Simple synchronization protocols for heterogeneous networks: beyond passivity (extended version)

异构网络简单同步协议:超越被动性(扩展版)

Anton V. Proskurnikov, Manuel Mazo

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);multi-agent(abstract)

AI总结 本文研究了非被动但满足弱输入前馈被动性条件的异构代理同步问题,提出了一种简单线性协议实现同步,适用于强连通交互图和弱耦合情况。

Comments accepted to IFAC World Congress

详情

展开后加载摘要…

URL PDF HTML 收藏
1510.04346 2026-06-04 stat.ME econ.GN q-fin.EC 75%

Explicit solutions to a vector time series model and its induced model for business cycles

向量时间序列模型及其诱导模型的显式解

Xiongzhi Chen

专题命中 Agent评测 :agent(summary_cn,abstract_cn)

AI总结 本文给出了一种描述异质 agent 在不确定性下根据凯恩斯原理交互的向量时间序列模型的显式解,并通过 agent 增长率的加权平均诱导出商业周期模型,从而更深入理解模型的数学性质和经济计量特性。

Comments 16 page2, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18134 2026-06-04 cs.LG cs.CC cs.PL cs.SE 73%

Learning Randomized Reductions

学习随机归约

Ferhat Erata, Orr Paradise, Thanos Typaldos, Timos Antonopoulos, ThanhVu Nguyen, Shafi Goldwasser, Ruzica Piskac

机构 * Yale University, USA(耶鲁大学) EPFL, Switzerland(瑞士联邦理工学院) George Mason University, USA(乔治·梅onn大学)

专题命中 Agent评测 :agentic(abstract,abstract_cn);分类 cs.LG、cs.SE

AI总结 提出 Bitween 框架自动学习随机自归约(RSR),通过线性回归、遗传编程等后端和 LLM 代理,在 80 个函数中分别发现 54% 和 80% 的 RSR,包括首个 sigmoid 归约。

Comments Accepted at ICML 2026 (Spotlight). 9 pages main text + appendix

Journal ref Proceedings of the 43rd International Conference on Machine Learning, PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01815 2026-06-04 cs.CL cs.AI 73%

From Graph Retrieval to Schema Realization: Counterfactual Validation for Text-to-SPARQL over Heterogeneous Knowledge Graphs

从图检索到模式实现:面向异构知识图谱的文本到SPARQL的反事实验证

Chengxiao Dai, Yue Xiu, Dusit Niyato

机构 * University of Bristol(布里斯托大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出SchemaForge框架,通过问题条件化的模式切片对齐和反事实验证,在异构知识图谱上提升文本到SPARQL查询生成的执行准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
1509.04264 2026-06-04 econ.GN cs.MA physics.soc-ph q-fin.EC 71%

Agent based simulations visualize Adam Smith's invisible hand by solving Friedrich Hayek's Economic Calculus

基于代理的模拟通过解决弗里德里克·哈耶克的经济计算来可视化亚当·斯密的看不见的手

Klaus Jaffe

专题命中 Agent评测 :agent(title)

AI总结 本文通过代理模拟展示经济中看不见的手如何在异质环境中通过劳动分工产生协同效应,揭示了经济协同的来源和性质。

Comments Econophysics, Complexity, Synergy

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15416 2026-06-04 cs.AI 70%

Adaptive Minds: Empowering Agents with LoRA-as-Tools

自适应心智:将LoRA作为工具赋予智能体能力

Pavan C Shekar, Aswanth Krishnan

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出将LoRA适配器作为可调用工具的框架,通过路由和智能体推理聚合多个专业适配器的优势,在30个适配器库中达到98.3%路由准确率,并在九类任务上显著提升性能。

Comments 13 pages, 3 figures, 9 tables. ICML 2026 CompLearn Workshop camera-ready (non-archival). Code: https://github.com/qpiai/adaptive-minds

详情

展开后加载摘要…

URL PDF HTML 收藏
1804.07323 2026-06-04 cs.LG cs.SY eess.SY stat.ML 70%

Nonparametric Stochastic Compositional Gradient Descent for Q-Learning in Continuous Markov Decision Problems

非参数随机组合梯度下降法在连续马尔可夫决策问题中的Q学习

Alec Koppel, Ekaterina Tolstaya, Ethan Stump, Alejandro Ribeiro

机构 * University of Pennsylvania(宾夕法尼亚大学) U.S. Army Research Laboratory(美国陆军研究实验室)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.LG

AI总结 本文提出非参数随机组合梯度下降法用于连续马尔可夫决策问题中的Q学习,通过将贝尔曼最优性方程转化为嵌套非凸随机优化问题,并利用核诱导再生核希尔伯特空间进行参数化,最终证明算法在概率意义下收敛于问题的 stationary 点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05023 2026-06-04 cs.HC 69%

Scaling Expert Feedback with Reflective Edit Propagation in Compositional Knowledge Bases

在组合知识库中通过反思性编辑传播扩展专家反馈

Jiajing Guo, Xueming Li, Jorge Piazentin Ono, Wenbin He, Liu Ren

专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(journal_ref)

AI总结 提出RAID系统,通过反思性代理推断专家编辑意图并自动传播到整个知识库,以规模化扩展专家反馈。

Comments Accepted to ACM CAIS '26 Demo Track

Journal ref ACM Conference on AI and Agentic Systems (CAIS '26), May 26-29, 2026, San Jose, CA, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04261 2026-06-04 cs.AI cs.CL cs.CV cs.ET cs.LG 67%

Can Generalist Agents Automate Data Curation?

通用智能体能否自动化数据筛选?

Feiyang Kang, Hanze Li, Adam Nguyen, Mahavir Dabas, Jiaqi W. Ma, Frederic Sala, Dawn Song, Ruoxi Jia

机构 * Virginia Tech(弗吉尼亚理工大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出Curation-Bench基准,通过通用编码智能体自动化数据筛选循环,实验表明现成智能体可达到强基线,但存在执行-研究差距,而结构化方法引导的智能体能在十分之一数据预算下自主组合出优于强基线的数据选择策略。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏