arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-18 至 2026-05-18 共收录 31 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 31 篇

2605.15228 2026-05-18 cs.AI cs.LG 88%

Verifiable Agentic Infrastructure: Proof-Derived Authorization for Sovereign AI Systems

可验证的代理基础设施:基于证明的授权机制用于主权AI系统

Jun He, Deying Yu

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);autonomous agent(abstract)

AI总结 本文提出Distributed Trust Framework,通过结构化可验证的艺术品计算执行权限,解决自主AI代理执行安全风险问题,实现授权过程的可验证、分布和可回放。

Comments 19 pager, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15625 2026-05-18 cs.AI cond-mat.soft 85%

ColPackAgent: Agent-Skill-Guided Hard-Particle Monte Carlo Workflows for Colloidal Packing

ColPackAgent:基于代理技能的硬粒子蒙特卡罗工作流程用于胶体堆积

Lijie Ding, Changwoo Do

机构 * Neutron Scattering Division, Oak Ridge National Laboratory, Oak Ridge, TN 37831, USA(奥克勒德国家实验室中子散射部)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);workflow(abstract);分类 cs.AI

AI总结 ColPackAgent通过MCP工具服务器和代理技能实现胶体堆积模拟的自主工作流程,展示了如何利用LLM代理执行模拟任务并评估不同模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15226 2026-05-18 cs.AR cs.AI cs.SE 84%

Is Agentic AI Ready for Real-World Hardware Engineering? A Deep Dive with Phoenix-bench

代理AI是否准备好进行现实世界硬件工程?通过Phoenix-bench的深入探讨

Qingyun Zou, Feng Yu, Hongshi Tan, Bingsheng He, WengFai Wong

机构 * National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.SE

AI总结 本文通过Phoenix-bench评估代理AI在硬件工程中的表现,发现软件与硬件工程本质不同,且故障集中于设计控制流、验证测试用例等,定位精度比定位本身更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15215 2026-05-18 cs.AI cs.SE 84%

SkillSmith: Compiling Agent Skills into Boundary-Guided Runtime Interfaces

SkillSmith:将技能编译为边界引导的运行时接口

Duling Xu, Zheng Chen, Zaifeng Pan, Jiawei Guan, Dong Dong, Jialin Li, Bangzheng Pu

机构 * AetherHeart Tech Co., Ltd.(AetherHeart科技有限公司) Renmin University of China(中国人民大学) University of California San Diego(加州大学圣地亚哥分校)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);分类 cs.AI、cs.SE

AI总结 SkillSmith通过将技能包编译为最小执行接口,减少运行时冗余,提升效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14572 2026-05-18 cs.IR cs.AI cs.CL cs.MA 84%

Don't Retrieve, Navigate: Distilling Enterprise Knowledge into Navigable Agent Skills for QA and RAG

不要检索,导航:将企业知识转化为可导航的代理技能用于问答和RAG

Yiqun Sun, Pengfei Wei, Lawrence B. Hsieh

机构 * Magellan Technology Research Institute(马格纳技术研究 institute)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Corpus2Skill,通过将文档库转化为层次化技能目录,使LLM代理在服务时能导航该目录,提升问答质量和 grounding,但指出导航并非所有场景下的最佳替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15871 2026-05-18 cs.AI 83%

Agentic Discovery of Neural Architectures: AIRA-Compose and AIRA-Design

代理发现神经架构:AIRA-Compose和AIRA-Design

Alberto Pepe, Chien-Yu Lin, Despoina Magka, Bilge Acun, Yannan Nellie Wu, Anton Protopopov, Carole-Jean Wu, Yoram Bachrach

机构 * FAIR at Meta(Meta的FAIR)

专题命中 Agent评测 :agentic(title);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出AIRA-Compose和AIRA-Design框架,通过自主设计神经网络架构,实现超越标准Transformer的基础模型,提升模型性能和效率。

Comments 55 pages, 28 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16194 2026-05-18 cs.DL cs.AI cs.IR cs.MA 79%

paper.json: A Coordination Convention for LLM-Agent-Actionable Papers

为LLM-代理可操作论文的协调约定

Arquimedes Canedo

机构 * arquicanedo

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出paper.json文件,通过稳定声明ID、明确不声明列表、精确图示命令和稳定定义ID等约定,解决LLM代理在阅读学术论文时的重复失败问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15710 2026-05-18 cs.CL 79%

SMMBench: A Benchmark for Source-Distributed Multimodal Agent Memory

SMMBench:一种用于源分布多模态智能体记忆的基准测试

Huacan Chai, Yukai Wang, Yingxuan Yang, Dan Peng, Yuanyi Song, Zhihui Fu, Weiwen Liu, Jianghao Lin, Jun Wang, Weinan Zhang

机构 * Shanghai Jiao Tong University, China(上海交通大学,中国) OPPO, China(OPPO,中国)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 SMMBench旨在评估智能体在多源分布证据下进行多模态推理、冲突解决和行动预测的能力,揭示当前系统在处理碎片化异构数据时的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15537 2026-05-18 cs.AI 79%

RTL-BenchMT: Dynamic Maintenance of RTL Generation Benchmark Through Agent-Assisted Analysis and Revision

RTL-BenchMT:通过代理辅助分析和修订动态维护RTL生成基准

Jing Wang, Shang Liu, Hangan Zhou, Zhiyao Xie

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 Agent评测 :agent(title);agentic(abstract);分类 cs.AI

AI总结 本文提出RTL-BenchMT框架,通过自动识别和修正错误案例及检测更新过拟合案例,解决RTL基准中的缺陷和过拟合问题,降低人工维护成本。

Comments This paper has been accepted by DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15473 2026-05-18 cs.CY 78%

Validated Hypotheses as a Lens for Human-Likeness Evaluation in AI Agents

以验证假设为视角评估AI代理的人性化程度

Xuan Liu, HaoYang Shang, Zizhang Liu, Yuanjun Feng, Guankai Zhai, Yunze Xiao, Yiwen Tu, Haojian Jin

专题命中 Agent评测 :AI agent(title);agent(abstract)

AI总结 本文提出利用验证过的行为假设作为评估AI代理人性化的视角,通过HumanStudy-Bench平台对12个研究进行评估,发现代理响应在完全复制与彻底失败间极化,代理设计比模型规模对齐影响更大但效果非单调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15581 2026-05-18 cs.AI 77%

STAR: A Stage-attributed Triage and Repair framework for RCA Agents in Microservices

STAR: 一种针对微服务中RCA代理的阶段属性分诊与修复框架

Junle Wang, Xingchuang Liao, Wenjun Wu

机构 * School of Artificial Intelligence, Beihang University Beijing, China(人工智能学院,北京航空航天大学,北京,中国)

专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出STAR框架,通过将RCA流程分解为四个阶段,提升微服务中RCA代理的可靠性与自修复能力。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01283 2026-05-18 cs.AI cs.LG 73%

The Informational Cost of Agency: A Bounded Measure of Interaction Efficiency for Deployed Reinforcement Learning

代理的信息成本:部署强化学习的有限交互效率度量

Wael Hafez, Cameron Reid, Amit Nazeri

机构 * Semarx Research LLC(Semarx研究公司)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Bipredictability度量代理与环境交互的效率,通过实验证明代理行为会降低该度量,且在多个系统中验证其普遍性,为部署自主系统提供运行可靠性测量。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00417 2026-05-18 cs.CL 70%

CryptoBench: A Dynamic Benchmark for Expert-Level Evaluation of LLM Agents in Cryptocurrency

CryptoBench: 一种动态基准,用于评估LLM代理在加密货币领域的专家级能力

Jiacheng Guo, Suozhi Huang, Zixin Yao, Yifan Zhang, Yifu Lu, Jiashuo Liu, Zihao Li, Nicholas Deng, Qixin Xiao, Jia Tian, Kanghong Zhan, Tianyi Li, Xiaochen Liu, Jason Ge, Chaoyang He, Kaixuan Huang, Lin Yang, Wenhao Huang, Mengdi Wang

机构 * Princeton University(普林斯顿大学) Zenith Lab(Zenith实验室) University of California, Los Angeles(加州大学洛杉矶分校) University of California, Berkeley(加州大学伯克利分校) University of Michigan(密歇根大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 本文提出CryptoBench,首个专家 curated 的动态基准,用于严格评估LLM在加密货币领域的真实能力。通过50题/月的动态任务,细分子类评估数据获取与预测能力,揭示LLM在检索与预测上的不平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15225 2026-05-18 q-bio.QM cs.AI 70%

Do Biological Structural Guarantees Earn Their Complexity?

生物结构保证是否值得其复杂性?

Bogdan Banu

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文通过三个深度基准测试,比较生物启发式实现与非生物替代方案,评估生物结构保证在AI代理中的可靠性优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06390 2026-05-18 cs.AI 70%

Automated alignment is harder than you think

自动化对齐比你想象的更困难

Aleksandr Bowkis, Marie Davidsen Buhl, Jacob Pfau, Geoffrey Irving

机构 * AI Security Institute(人工智能安全研究所)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 论文指出,即使研究代理不故意破坏对齐工作,自动化对齐研究也可能导致误导性的安全评估,因模糊任务难以监督且人类判断有误。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16143 2026-05-18 cs.AI cs.CL 62%

Look Before You Leap: Autonomous Exploration for LLM Agents

先看再跳:面向LLM代理的自主探索

Ziang Ye, Wentao Shi, Yuxin Liu, Yu Wang, Zhengzhou Cai, Yaorui Shi, Qi Gu, Xunliang Cai, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) Meituan(美团)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出自主探索能力,通过探索检查点覆盖率指标,改进LLM代理在陌生环境中的适应性,采用探索与执行交替训练策略,提升任务执行的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19923 2026-05-18 cs.CL cs.AI 62%

Structure-BiEval: A Self-Supervised, Dual-Track Framework for Decoupling Structure and Content in LLM Evaluation for Web Information Systems

Structure-BiEval: 一种自监督、双轨框架,用于解耦Web信息系统中LLM评估的结构与内容

Boxiang Zhao, Qince Li, Zhonghao Wang, Zelin Cao, Yi Wang, Peng Cheng, Bo Lin

机构 * Tele-Communication Technology Bureau, Xinhua News Agency(新华通讯社电信技术局)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Structure-BiEval框架,通过确定性中间表示解耦结构与内容,利用内容语义准确性和归一化树编辑距离评估Web数据工程中的LLM结构 fidelity,发现不同模型在Web数据格式化中表现差异显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25099 2026-05-18 cs.CE cs.AI 57%

Large Language Models as Optimization Controllers: Adaptive Continuation for SIMP Topology Optimization

大语言模型作为优化控制器:SIMP拓扑优化的自适应延续

Shaoliang Yang, Jun Wang, Yunsheng Wang

机构 * Department of Mechanical Engineering, Santa Clara University(圣克拉拉大学机械工程系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型作为SIMP拓扑优化的在线自适应控制器,通过实时状态条件参数决策替代传统固定调度延续方法,提升优化效果。

Comments 32 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15769 2026-05-18 cs.RO cs.AI 57%

Lamarckian Inheritance in Dynamic Environments: How Key Variables Affect Evolutionary Dynamics

动态环境中的拉马克继承:关键变量如何影响进化动态

K. Ege de Bruin, Kyrre Glette, Kai Olav Ellefsen

机构 * Department of Informatics, University of Oslo, Norway(奥斯陆大学信息学院) RITMO, University of Oslo, Norway(奥斯陆大学RITMO)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文研究动态环境中关键变量对进化动态的影响,通过虚拟软机器人和两种学习方法,发现拉马克继承在环境变化冲突且不可预测时表现欠佳,但添加环境感知传感器可恢复其优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16257 2026-05-18 cs.RO 50%

DexJoCo: A Benchmark and Toolkit for Task-Oriented Dexterous Manipulation on MuJoCo

DexJoCo:用于MuJoCo上的任务导向灵巧操作的基准和工具包

Hanwen Wang, Weizhi Zhao, Xiangyu Wang, Siyuan Huang, He Lin, Boyuan Zheng, Rongtao Xu, Gang Wang, Yao Mu, He Wang, Lue Fan, Hongsheng Li, Zhaoxiang Zhang, Tieniu Tan

机构 * NLPR & MAIS, CASIA(中国科学院南京自动化研究所与模式识别与人工智能实验室) SJTU(上海交通大学) MBZUAI(马克斯·普朗克研究所) Beijing Institute of Basic Medical Sciences(北京基础医学研究所) PKU & Galbot(北京大学与Galbot) CUHK(香港大学)

专题命中 Agent评测 :tool-use(abstract)

AI总结 本文提出DexJoCo基准和工具包,包含11个功能任务评估灵巧手的工具使用、双臂协调、长周期执行和推理能力,通过低成本数据收集系统和领域随机化评估鲁棒性,揭示当前策略的局限性。

Comments 8 pages, 6 figures, project page is available at: https://dexjoco.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16214 2026-05-18 cond-mat.mtrl-sci 50%

Bridging Atomistic Simulation and Experimental Processing Timescales with Goal-Directed Deep Reinforcement Learning

通过目标导向的深度强化学习弥合原子模拟与实验处理时间尺度

Wonseok Jeong, Francesca Tavazza, Brian DeCost

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种目标导向的深度强化学习框架,用于发现材料形成路径,无需人工设计反应坐标,通过障碍意识奖励保持动力学合理性,解决传统原子动力学方法在稀有事件路径模拟中的不足。

Comments 35 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15935 2026-05-18 cs.RO cs.SY eess.SY physics.plasm-ph 50%

Dynamic Plasma Shape Control with Arbitrary Sensor Subsets

等离子体形状动态控制与任意传感器子集

D. Sorokin, M. Stokolesov, A. Granovskiy, I. Prokofyev, E. Adishchev, M. Nurgaliev, E. Khayrutdinov, G. Subbotin, R. Clark, D. Orlov

机构 * Next Step Fusion Center for Energy Research, University of California San Diego(加州大学圣地亚哥分校能源研究中心)

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种强化学习代理,通过NSFsim模拟器在120个实验等离子体形状数据集上训练,实现了对动态变化的等离子体形状目标的实时跟踪,并在诊断故障情况下保持鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15843 2026-05-18 cs.CV 50%

WorldAct: Activating Monolithic 3D Worlds into Interactive-Ready Object-Centric Scenes

WorldAct:将单体3D世界激活为可交互的以对象为中心的场景

Jichen Hu, Jiawei Guo, Jiazhong Cen, Chen Yang, Sikuang Li, Wei Shen

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Inc(华为公司)

专题命中 Agent评测 :agent(abstract)

AI总结 WorldAct通过多模态代理将静态生成的3D世界分解为可编辑的交互场景,支持对象级编辑和任务执行,保留全局一致性。

Comments Project page: https://sjtu-deepvisionlab.github.io/WorldAct

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15833 2026-05-18 cs.DS cs.DM math.CO 50%

Exploration of $k$-edge-deficient temporal graphs in linear time

$k$-边缺陷时间图的线性时间探索研究

Ivan Lahtin, Viktor Zamaraev

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了时间图的探索问题,提出了一种线性时间内探索始终连通的$k$-边缺陷时间图的方法,解决了静态图线性时间探索的复杂性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11673 2026-05-18 econ.TH 50%

Grabbing the Forbidden Fruit: Restriction-Sensitive Choice

摘取禁果:限制敏感选择

Niels Boissonnet, Alexis Ghersengorin

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出限制敏感选择模型,解释禁果效应,并分析信仰回火效应和少数族裔整合政策的反噬现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15766 2026-05-18 cs.CE 50%

BioXArena: Benchmarking LLM Agents on Multi-Modal Biomedical Machine Learning Tasks

BioXArena:在多模态生物医学机器学习任务上评估LLM代理的基准测试

Loka Li, Duzhen Zhang, Xingbo Du, Leonard Song, Zixiao Wang, Assanali Aukenov, Noel Thomas, Shakhnazar Sailaukan, Yonghan Yang, Feilong Chen, Jiahua Dong, Kun Zhang, Bin Zhang, Le Song

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出BioXArena基准测试,旨在评估LLM代理能否为异构多模态生物医学数据集生成任务特定的模型训练流程,包含9个领域76个端到端任务,评估指标涵盖隐藏标签、隐藏评分者和生物意识度量,通过标准化环境评估11种代理配置。

Comments 69 pages, 13 figures, 34 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15650 2026-05-18 cs.RO 50%

MyoChallenge 2025: A New Benchmark for Human Athletic Intelligence

MyoChallenge 2025: 人类运动智能的新基准

Cheryl Wang, Chun Kwang Tan, Balint K. Hodossy, Eric Lyu, Jun Guo, Wentao Zhao, Huaping Liu, Chengkun Li, Merkourios Simos, Bianca Ziliotto, Alexander Mathis, Siyuan Liu, Jiahao Chen, Shanlin Zhong, Bo Jiang, Ci Song, Yaoye Zhu, Chenhui Zuo, Yanan Sui, Mohamed Irfan Refai, Massimo Sartori, Guillaume Durandau, Vikash Kumar, Vittorio Caggiano

机构 * McGill University(麦吉尔大学) National University of Singapore(国立新加坡大学) Imperial College London(伦敦帝国理工学院) King’s College London(伦敦国王学院) Tsinghua University(清华大学) EPFL(苏黎世联邦理工学院) CASIA(中国科学院自动化所) University of Twente(代尔夫特理工大学) MyoLab

专题命中 Agent评测 :planning(abstract)

AI总结 本文提出MyoChallenge 2025基准,通过高保真骨骼肌模型与机器学习算法结合,推动运动控制智能研究,包含乒乓球和足球点球两个任务,促进多学科交叉研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15210 2026-05-18 q-fin.TR econ.TH 50%

TradeMech: A Method to Multilaterally Net Trades Without Altering Counterparty Exposure

TradeMech:一种无需改变对手方暴露的多边净交易方法

Daniel Aronoff, Robert M. Townsend, Madars Virza

专题命中 Agent评测 :agent(abstract)

AI总结 TradeMech通过将双边合同转化为链和循环,实现多边净交易,同时保持合同利润和对手方风险位置,避免新对手方暴露。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15598 2026-05-18 nlin.CG q-bio.QM stat.AP 50%

When do trajectories matter? Identifiability analysis for stochastic transport phenomena

轨迹何时重要?随机传输现象的可识别性分析

Matthew J Simpson, Michael J Plank

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了在随机传输现象中,仅使用计数数据或轨迹数据对模型参数进行识别的可行性,结合多种方法揭示了结构不可识别性问题及实验设计对推断精度的影响。

Comments 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00364 2026-05-18 cs.CR 50%

"Someone Hid It": Query-Agnostic Black-Box Attacks on LLM-Based Retrieval

有人隐藏了它:针对基于大语言模型的检索的查询无关黑盒攻击

Jiate Li, Defu Cao, Li Li, Wei Yang, Yuehan Qin, Chenxiao Yu, Tiannuo Yang, Ryan A. Rossi, Yan Liu, Xiyang Hu, Yue Zhao

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种无需查询或模型知识的黑盒攻击方法,通过零样本代理LLM生成可迁移的注入标记,揭示LLM检索系统的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏