arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-18 至 2026-05-18 共收录 167 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 31 篇

2605.06390 2026-05-18 cs.AI 70%

Automated alignment is harder than you think

自动化对齐比你想象的更困难

Aleksandr Bowkis, Marie Davidsen Buhl, Jacob Pfau, Geoffrey Irving

机构 * AI Security Institute(人工智能安全研究所)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 论文指出,即使研究代理不故意破坏对齐工作,自动化对齐研究也可能导致误导性的安全评估,因模糊任务难以监督且人类判断有误。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16143 2026-05-18 cs.AI cs.CL 62%

Look Before You Leap: Autonomous Exploration for LLM Agents

先看再跳:面向LLM代理的自主探索

Ziang Ye, Wentao Shi, Yuxin Liu, Yu Wang, Zhengzhou Cai, Yaorui Shi, Qi Gu, Xunliang Cai, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) Meituan(美团)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出自主探索能力,通过探索检查点覆盖率指标,改进LLM代理在陌生环境中的适应性,采用探索与执行交替训练策略,提升任务执行的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19923 2026-05-18 cs.CL cs.AI 62%

Structure-BiEval: A Self-Supervised, Dual-Track Framework for Decoupling Structure and Content in LLM Evaluation for Web Information Systems

Structure-BiEval: 一种自监督、双轨框架,用于解耦Web信息系统中LLM评估的结构与内容

Boxiang Zhao, Qince Li, Zhonghao Wang, Zelin Cao, Yi Wang, Peng Cheng, Bo Lin

机构 * Tele-Communication Technology Bureau, Xinhua News Agency(新华通讯社电信技术局)

专题命中 Agent评测 :autonomous agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Structure-BiEval框架,通过确定性中间表示解耦结构与内容,利用内容语义准确性和归一化树编辑距离评估Web数据工程中的LLM结构 fidelity,发现不同模型在Web数据格式化中表现差异显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25099 2026-05-18 cs.CE cs.AI 57%

Large Language Models as Optimization Controllers: Adaptive Continuation for SIMP Topology Optimization

大语言模型作为优化控制器:SIMP拓扑优化的自适应延续

Shaoliang Yang, Jun Wang, Yunsheng Wang

机构 * Department of Mechanical Engineering, Santa Clara University(圣克拉拉大学机械工程系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型作为SIMP拓扑优化的在线自适应控制器,通过实时状态条件参数决策替代传统固定调度延续方法,提升优化效果。

Comments 32 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15769 2026-05-18 cs.RO cs.AI 57%

Lamarckian Inheritance in Dynamic Environments: How Key Variables Affect Evolutionary Dynamics

动态环境中的拉马克继承:关键变量如何影响进化动态

K. Ege de Bruin, Kyrre Glette, Kai Olav Ellefsen

机构 * Department of Informatics, University of Oslo, Norway(奥斯陆大学信息学院) RITMO, University of Oslo, Norway(奥斯陆大学RITMO)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文研究动态环境中关键变量对进化动态的影响,通过虚拟软机器人和两种学习方法,发现拉马克继承在环境变化冲突且不可预测时表现欠佳,但添加环境感知传感器可恢复其优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16257 2026-05-18 cs.RO 50%

DexJoCo: A Benchmark and Toolkit for Task-Oriented Dexterous Manipulation on MuJoCo

DexJoCo:用于MuJoCo上的任务导向灵巧操作的基准和工具包

Hanwen Wang, Weizhi Zhao, Xiangyu Wang, Siyuan Huang, He Lin, Boyuan Zheng, Rongtao Xu, Gang Wang, Yao Mu, He Wang, Lue Fan, Hongsheng Li, Zhaoxiang Zhang, Tieniu Tan

机构 * NLPR & MAIS, CASIA(中国科学院南京自动化研究所与模式识别与人工智能实验室) SJTU(上海交通大学) MBZUAI(马克斯·普朗克研究所) Beijing Institute of Basic Medical Sciences(北京基础医学研究所) PKU & Galbot(北京大学与Galbot) CUHK(香港大学)

专题命中 Agent评测 :tool-use(abstract)

AI总结 本文提出DexJoCo基准和工具包,包含11个功能任务评估灵巧手的工具使用、双臂协调、长周期执行和推理能力,通过低成本数据收集系统和领域随机化评估鲁棒性,揭示当前策略的局限性。

Comments 8 pages, 6 figures, project page is available at: https://dexjoco.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16214 2026-05-18 cond-mat.mtrl-sci 50%

Bridging Atomistic Simulation and Experimental Processing Timescales with Goal-Directed Deep Reinforcement Learning

通过目标导向的深度强化学习弥合原子模拟与实验处理时间尺度

Wonseok Jeong, Francesca Tavazza, Brian DeCost

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种目标导向的深度强化学习框架,用于发现材料形成路径,无需人工设计反应坐标,通过障碍意识奖励保持动力学合理性,解决传统原子动力学方法在稀有事件路径模拟中的不足。

Comments 35 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15935 2026-05-18 cs.RO cs.SY eess.SY physics.plasm-ph 50%

Dynamic Plasma Shape Control with Arbitrary Sensor Subsets

等离子体形状动态控制与任意传感器子集

D. Sorokin, M. Stokolesov, A. Granovskiy, I. Prokofyev, E. Adishchev, M. Nurgaliev, E. Khayrutdinov, G. Subbotin, R. Clark, D. Orlov

机构 * Next Step Fusion Center for Energy Research, University of California San Diego(加州大学圣地亚哥分校能源研究中心)

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种强化学习代理,通过NSFsim模拟器在120个实验等离子体形状数据集上训练,实现了对动态变化的等离子体形状目标的实时跟踪,并在诊断故障情况下保持鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15843 2026-05-18 cs.CV 50%

WorldAct: Activating Monolithic 3D Worlds into Interactive-Ready Object-Centric Scenes

WorldAct:将单体3D世界激活为可交互的以对象为中心的场景

Jichen Hu, Jiawei Guo, Jiazhong Cen, Chen Yang, Sikuang Li, Wei Shen

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Inc(华为公司)

专题命中 Agent评测 :agent(abstract)

AI总结 WorldAct通过多模态代理将静态生成的3D世界分解为可编辑的交互场景,支持对象级编辑和任务执行,保留全局一致性。

Comments Project page: https://sjtu-deepvisionlab.github.io/WorldAct

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15833 2026-05-18 cs.DS cs.DM math.CO 50%

Exploration of $k$-edge-deficient temporal graphs in linear time

$k$-边缺陷时间图的线性时间探索研究

Ivan Lahtin, Viktor Zamaraev

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了时间图的探索问题,提出了一种线性时间内探索始终连通的$k$-边缺陷时间图的方法,解决了静态图线性时间探索的复杂性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11673 2026-05-18 econ.TH 50%

Grabbing the Forbidden Fruit: Restriction-Sensitive Choice

摘取禁果:限制敏感选择

Niels Boissonnet, Alexis Ghersengorin

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出限制敏感选择模型,解释禁果效应,并分析信仰回火效应和少数族裔整合政策的反噬现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15766 2026-05-18 cs.CE 50%

BioXArena: Benchmarking LLM Agents on Multi-Modal Biomedical Machine Learning Tasks

BioXArena:在多模态生物医学机器学习任务上评估LLM代理的基准测试

Loka Li, Duzhen Zhang, Xingbo Du, Leonard Song, Zixiao Wang, Assanali Aukenov, Noel Thomas, Shakhnazar Sailaukan, Yonghan Yang, Feilong Chen, Jiahua Dong, Kun Zhang, Bin Zhang, Le Song

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出BioXArena基准测试,旨在评估LLM代理能否为异构多模态生物医学数据集生成任务特定的模型训练流程,包含9个领域76个端到端任务,评估指标涵盖隐藏标签、隐藏评分者和生物意识度量,通过标准化环境评估11种代理配置。

Comments 69 pages, 13 figures, 34 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15650 2026-05-18 cs.RO 50%

MyoChallenge 2025: A New Benchmark for Human Athletic Intelligence

MyoChallenge 2025: 人类运动智能的新基准

Cheryl Wang, Chun Kwang Tan, Balint K. Hodossy, Eric Lyu, Jun Guo, Wentao Zhao, Huaping Liu, Chengkun Li, Merkourios Simos, Bianca Ziliotto, Alexander Mathis, Siyuan Liu, Jiahao Chen, Shanlin Zhong, Bo Jiang, Ci Song, Yaoye Zhu, Chenhui Zuo, Yanan Sui, Mohamed Irfan Refai, Massimo Sartori, Guillaume Durandau, Vikash Kumar, Vittorio Caggiano

机构 * McGill University(麦吉尔大学) National University of Singapore(国立新加坡大学) Imperial College London(伦敦帝国理工学院) King’s College London(伦敦国王学院) Tsinghua University(清华大学) EPFL(苏黎世联邦理工学院) CASIA(中国科学院自动化所) University of Twente(代尔夫特理工大学) MyoLab

专题命中 Agent评测 :planning(abstract)

AI总结 本文提出MyoChallenge 2025基准,通过高保真骨骼肌模型与机器学习算法结合,推动运动控制智能研究,包含乒乓球和足球点球两个任务,促进多学科交叉研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15210 2026-05-18 q-fin.TR econ.TH 50%

TradeMech: A Method to Multilaterally Net Trades Without Altering Counterparty Exposure

TradeMech:一种无需改变对手方暴露的多边净交易方法

Daniel Aronoff, Robert M. Townsend, Madars Virza

专题命中 Agent评测 :agent(abstract)

AI总结 TradeMech通过将双边合同转化为链和循环,实现多边净交易,同时保持合同利润和对手方风险位置,避免新对手方暴露。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15598 2026-05-18 nlin.CG q-bio.QM stat.AP 50%

When do trajectories matter? Identifiability analysis for stochastic transport phenomena

轨迹何时重要?随机传输现象的可识别性分析

Matthew J Simpson, Michael J Plank

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了在随机传输现象中,仅使用计数数据或轨迹数据对模型参数进行识别的可行性,结合多种方法揭示了结构不可识别性问题及实验设计对推断精度的影响。

Comments 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00364 2026-05-18 cs.CR 50%

"Someone Hid It": Query-Agnostic Black-Box Attacks on LLM-Based Retrieval

有人隐藏了它:针对基于大语言模型的检索的查询无关黑盒攻击

Jiate Li, Defu Cao, Li Li, Wei Yang, Yuehan Qin, Chenxiao Yu, Tiannuo Yang, Ryan A. Rossi, Yan Liu, Xiyang Hu, Yue Zhao

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种无需查询或模型知识的黑盒攻击方法,通过零样本代理LLM生成可迁移的注入标记,揭示LLM检索系统的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13529 2026-05-18 cs.RO 50%

The OncoReach Stylet for Brachytherapy: Design Evaluation and Pilot Study

OncoReach 术式在近距离放疗中的应用:设计评估与试点研究

Pejman Kheradmand, Kent K. Yamamoto, Emma Webster, Keith Sowards, Gianna Hatheway, Katharine L. Jackson, Sabino Zani, Julie A. Raffi, Diandra N. Ayala-Peacock, Scott R. Silva, Joanna Deaton Bertram, Yash Chitalia

机构 * Telesurgery (HeaRT) Laboratory, J. B. Speed School of Engineering, University of Louisville, Louisville, Kentucky, USA.(远程手术(HeaRT)实验室,J. B. Speed工程学院,路易斯维尔大学,路易斯维尔,肯塔基州,美国。) Department of Mechanical Engineering and Materials Science, Duke University, Durham, NC, USA.(机械工程与材料科学系,杜克大学,杜克斯,北卡罗来纳州,美国。) Surgical Education and Activities Lab (SEAL), Duke University Department of Surgery, Durham, NC, USA.(手术教育与活动实验室(SEAL),杜克大学外科系,杜克斯,北卡罗来纳州,美国。) Department of Radiation Oncology, University of Louisville School of Medicine, Louisville, KY, USA.(放射肿瘤学系,路易斯维尔大学医学院,路易斯维尔,肯塔基州,美国。) Department of Radiation Oncology, Duke University School of Medicine, Durham, NC, USA.(放射肿瘤学系,杜克大学医学院,杜克斯,北卡罗来纳州,美国。)

专题命中 Agent评测 :planning(abstract)

AI总结 本文提出OncoReach可操控导管,通过优化设计参数提升弯曲顺应性并保持轴向刚性,通过实验验证其在宫颈癌放疗中的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏