arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2605.15581 2026-05-18 cs.AI 77%

STAR: A Stage-attributed Triage and Repair framework for RCA Agents in Microservices

STAR: 一种针对微服务中RCA代理的阶段属性分诊与修复框架

Junle Wang, Xingchuang Liao, Wenjun Wu

机构 * School of Artificial Intelligence, Beihang University Beijing, China(人工智能学院,北京航空航天大学,北京,中国)

专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出STAR框架,通过将RCA流程分解为四个阶段,提升微服务中RCA代理的可靠性与自修复能力。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10779 2026-05-12 cs.CR cs.CL 77%

LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments

LITMUS:在真实操作系统环境中评估LLM代理行为越狱的基准测试

Chiyu Zhang, Huiqin Yang, Bendong Jiang, Xiaolei Zhang, Yiran Zhao, Ruyi Chen, Lu Zhou, Xiaogang Xu, Jiafei Wu, Liming Fang, Zhe Liu

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 LITMUS通过语义-物理双重验证机制和操作系统级状态回滚,解决现有基准测试在物理层危害评估和测试隔离上的不足,揭示LLM代理在行为安全方面的缺陷和漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10286 2026-05-12 cs.AI 77%

AgentRx: A Benchmark Study of LLM Agents for Multimodal Clinical Prediction Tasks

AgentRx: 一种针对多模态临床预测任务的LLM代理基准研究

Baraa Al Jorf, Farah E. Shamout

机构 * New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文研究了LLM代理在多模态临床预测任务中的表现,发现单代理框架在处理多模态数据和校准方面优于多代理系统,强调了改进多代理协作的重要性。

Comments Accepted at the AHLI Conference on Health, Inference, and Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09679 2026-05-12 cs.CV cs.AI 77%

DeepTumorVQA: A Hierarchical 3D CT Benchmark for Stage-Wise Evaluation of Medical VLMs and Tool-Augmented Agents

DeepTumorVQA: 一种分层的3D CT基准,用于分阶段评估医学视觉语言模型和工具增强代理

Yixiong Chen, Wenjie Xiao, Pedro R. A. S. Bassi, Boyan Wang, Liang He, Xinze Zhou, Sezgin Er, Ibrahim Ethem Hamamci, Zongwei Zhou, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Bologna(博洛尼亚大学) Istanbul Medipol University(伊斯坦布尔梅迪波尔大学) Center for Biomolecular Nanotechnologies, Istituto Italiano di Tecnologia(生物分子纳米技术中心,意大利技术研究院) The First Affiliated Hospital, Sun Yat-Sen University(中山大学第一附属医院) Tongji University(同济大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 DeepTumorVQA通过分阶段证据链分解3D CT推理为四个阶段,提供工具交互环境,揭示医疗VLMs的瓶颈并展示工具增强的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06584 2026-05-08 cs.AI 77%

NeuroAgent: LLM Agents for Multimodal Neuroimaging Analysis and Research

NeuroAgent:用于多模态神经影像分析和研究的LLM代理

Lujia Zhong, Yihao Xia, Jianwei Zhang, Shuo huang, Jiaxin Yue, Mingyang Xia, Yonggang Shi

机构 * Stevens Neuroimaging and Informatics Institute, Keck School of Medicine, University of Southern California(史蒂文斯神经影像与信息学研究所,凯克医学院,南加州大学) Viterbi School of Engineering, University of Southern California(维特比工程学院,南加州大学) Alfred E. Mann Department of Biomedical Engineering, Viterbi School of Engineering, University of Southern California(阿尔弗雷德·E·曼生物医学工程部门,维特比工程学院,南加州大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI

AI总结 NeuroAgent通过LLM驱动的代理框架自动化多模态神经影像预处理与分析,支持自然语言查询,提升神经影像研究的自动化与可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01338 2026-05-05 cs.AI 77%

DiagramNet: An End-to-End Recognition Framework and Dataset for Non-Standard System-Level Diagrams

DiagramNet: 一种面向非标准系统级图表的端到端识别框架和数据集

Jincheng Lou, Ruohan Xu, Jiapeng Li, Junyin Pi, Runzhe Tao, Weijian Fan, Xiao Tan, Guojie Luo, Yibo Lin

机构 * School of IC, Peking University, Beijing, China(北京大学信息科学技术学院) College of Artificial Intelligence, Xi'an Jiaotong University, Xi'an, China(西安交通大学人工智能学院) Department of Precision Instruments, Tsinghua University, Beijing, China(清华大学精密仪器系) School of Software and Microelectronics, Peking University, Beijing, China(北京大学软件与微电子学院) School of Computer Science, Peking University, Beijing, China(北京大学计算机科学系) Institute of EDA, Peking University, Beijing, China(北京大学EDA研究院) Beijing Advanced Innovation Center for IC, Beijing, China(北京集成电路先进创新中心)

专题命中 Agent评测 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出DiagramNet数据集和训练框架,通过端到端方法在系统级图表识别中超越现有模型,提升多模态大语言模型的图表理解能力。

Comments 13 pages, 7 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14240 2026-04-21 cs.AI 77%

LiveResearchBench: A Live Benchmark for User-Centric Deep Research in the Wild

LiveResearchBench: 一个用于真实世界中以用户为中心的深度研究的实时基准

Jiayu Wang, Yifei Ming, Riya Dulepet, Qinglin Chen, Austin Xu, Zixuan Ke, Frederic Sala, Aws Albarghouthi, Caiming Xiong, Shafiq Joty

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Stanford University(斯坦福大学) Salesforce AI Research(Salesforce AI研究院)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出LiveResearchBench,一个包含100个专家精选任务的实时基准,涵盖日常生活、企业与学术领域,要求进行广泛、动态的实时网络搜索与综合。通过DeepEval评估17个前沿深度研究系统,揭示其优势、失败模式及关键组件。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14683 2026-04-17 cs.AI 77%

DR$^{3}$-Eval: Towards Realistic and Reproducible Deep Research Evaluation

DR$^{3}$-Eval: 向真实和可重复的深度研究评估迈进

Qianqian Xie, Qingheng Xiong, He Zhu, Tiantian Xia, Xueming Han, Fanyu Meng, Jiakai Wang, Zhiqi Bai, Chengkang Jiang, Zhaohui Wang, Yubin Guo, Yuqing Wen, Jiayang Mao, Zijie Zhang, Shihao Li, Yanghai Wang, Yuxiang Ren, Junlan Feng, Jiaheng Liu

机构 * Nanjing University(南京大学) M-A-P Jiutian Research(九天研究) National University of Singapore(新加坡国立大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出DR$^{3}$-Eval基准,用于评估多模态多文件报告生成的深度研究代理,通过真实用户材料和静态研究沙盒语料结合,引入多维评估框架,验证其与人类判断的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07733 2026-04-10 cs.AI 77%

CivBench: Progress-Based Evaluation for LLMs' Strategic Decision-Making in Civilization V

CivBench:基于进展的评估用于LLM在文明V中的战略决策

John Chen, Sihan Cheng, Can Gurkan, Mingyi Lin

机构 * University of Arizona(亚利桑那大学) Northwestern University(西北大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI

AI总结 CivBench通过训练模型在回合级游戏状态上估计胜利概率,评估LLM在文明V多玩家中的战略决策能力,揭示代理设置对模型的影响及不同战略特征。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01221 2026-04-02 cs.AI cs.CV 77%

HippoCamp: Benchmarking Contextual Agents on Personal Computers

HippoCamp:在个人电脑上对上下文代理进行基准测试

Zhe Yang, Shulin Tian, Kairui Hu, Shuai Liu, Hoang-Nhat Nguyen, Yichi Zhang, Zujin Guo, Mengying Yu, Zinan Zhang, Jingkang Yang, Chen Change Loy, Ziwei Liu

机构 * S-Lab, Nanyang Technological University, Singapore(新加坡南洋理工大学S-Lab)

专题命中 Agent评测 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 HippoCamp是一个新的基准,用于评估代理在多模态文件管理中的能力,通过用户为中心的环境建模个体用户档案并搜索大规模个人文件进行上下文感知推理,揭示了当前代理在真实环境中的局限性。

Comments Project Page: https://hippocamp-ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28063 2026-03-31 cs.AI cs.GT 77%

Reward Hacking as Equilibrium under Finite Evaluation

奖励黑客行为作为有限评估下的均衡

Jiacheng Wang, Jinbin Huang

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文基于五个公理证明优化AI代理在未被评估系统覆盖的质量维度上会系统性地减少努力,揭示奖励黑客行为为结构性均衡而非可修复错误,并提出可计算的扭曲指数预测黑客行为。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23660 2026-03-26 cs.AI 77%

GTO Wizard Benchmark

GTO Wizard 评估基准

Marc-Antoine Provost, Nejc Ilenic, Christopher Solinas, Philippe Beardsell

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出GTO Wizard基准,用于评估HUNL算法,通过与GTO Wizard AI对比,发现现有模型在推理和规划方面仍有较大提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02960 2026-03-24 cs.AI 77%

Architecting Trust in Artificial Epistemic Agents

在人工智能认知代理中构建信任

Nahema Marchal, Stephanie Chan, Matija Franklin, Manon Revel, Geoff Keeling, Roberta Fischli, Bilva Chandra, Iason Gabriel

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文探讨了大规模语言模型作为认知代理的影响,提出通过构建信任、对齐人类认知目标和加强社会认知基础设施,确保AI系统的可靠性与包容性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10971 2026-03-20 cs.CR cs.CL 77%

AJAR: Adaptive Jailbreak Architecture for Red-teaming

AJAR:适应性突破架构用于红队测试

Yipu Dou, Wang Yang

机构 * School of Cyber Science and Engineering(网络安全科学与工程学院)

专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.CL

AI总结 AJAR框架通过可调用MCP服务实现多轮突破算法,提升X-Teaming攻击成功率至76.0%,并在工具访问下优化攻击面。

Comments 7 pages, 3 figures. Code and data available at https://github.com/douyipu/ajar

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17170 2026-03-19 cs.CR cs.AI cs.PL 77%

PAuth - Precise Task-Scoped Authorization For Agents

PAuth - 精确任务范围授权 for 代理

Reshabh K Sharma, Linxi Jiang, Zhiqiang Lin, Shuo Chen

机构 * University of Washington(华盛顿大学) The Ohio State University(俄亥俄州立大学) Microsoft Research(微软研究院)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 PAuth通过隐式授权模型精确控制代理执行任务所需的操作权限,通过NL切片和信封结构确保操作合法性,实验表明其在安全和性能上均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22680 2026-03-17 cs.AI 77%

Toward Personalized LLM-Powered Agents: Foundations, Evaluation, and Future Directions

迈向个性化大语言模型驱动的代理:基础、评估与未来方向

Yue Xu, Qian Chen, Zizhan Ma, Dongrui Liu, Wenxuan Wang, Xiting Wang, Li Xiong, Wenjie Wang

专题命中 Agent评测 :agent(abstract);planning(abstract);agentic(abstract);分类 cs.AI

AI总结 本文探讨个性化LLM代理的基础、评估及未来方向,分析了四个核心能力:用户画像建模、记忆、规划与行动执行,并总结了评估指标和应用场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15112 2026-03-13 cs.AI 77%

ResearchGym: Evaluating Language Model Agents on Real-World AI Research

ResearchGym: 在真实世界人工智能研究中评估语言模型代理

Aniketh Garikaparthi, Manasi Patwardhan, Arman Cohan

专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 ResearchGym通过重新利用学术论文中的任务环境,评估语言模型代理在真实世界AI研究中的能力,发现其在复杂任务中存在可靠性不足的问题,但偶尔能实现前沿性能。

Comments ICLR 2026 Agents in the Wild Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09827 2026-03-12 cs.CV cs.AI 77%

MA-EgoQA: Question Answering over Egocentric Videos from Multiple Embodied Agents

MA-EgoQA:多智能体视角下的眼动视频问答

Kangsan Kim, Yanlai Yang, Suji Kim, Woongyeong Yeo, Youngwan Lee, Mengye Ren, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) New York University(纽约大学) Samsung Electronics(三星电子) ETRI(电子技术研究所)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 MA-EgoQA旨在解决多智能体视角下的眼动视频问答问题,通过引入多代理眼动问答基准和EgoMAS模型,评估现有方法在处理多眼动流中的不足。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08738 2026-03-11 cs.AR cs.SE 77%

FormalRTL: Verified RTL Synthesis at Scale

FormalRTL: 在大规模上实现验证的RTL综合

Kezhi Li, Min Li, Xiangyu Wen, Shibo Zhao, Jieying Wu, Junhua Huang, Qiang Xu

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.SE

AI总结 FormalRTL通过整合软件参考模型,实现了大规模、验证的RTL综合,解决了工业级硬件设计中的规范模糊和正确性保证问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07391 2026-03-10 cs.AI cs.MA 77%

NAAMSE: Framework for Evolutionary Security Evaluation of Agents

NAAMSE:用于智能体进化安全评估的框架

Kunal Pai, Parth Shah, Harshil Patel

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 NAAMSE通过进化框架提升智能体的安全评估,利用遗传突变和探索发现隐藏漏洞,提供更真实鲁棒性评估。

Comments Published at ICLR 2026 Workshop on Agents in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06541 2026-03-09 cs.DB cs.AI cs.MA 77%

KramaBench: A Benchmark for AI Systems on Data-to-Insight Pipelines over Data Lakes

KramaBench:一个用于数据湖上数据到洞察流程的AI系统基准测试

Eugenie Lai, Gerardo Vitagliano, Ziyu Zhang, Om Chabra, Sivaprasad Sudhir, Anna Zeng, Anton A. Zabreyko, Chenning Li, Ferdi Kossmann, Jialin Ding, Jun Chen, Markos Markakis, Matthew Russo, Weiyang Wang, Ziniu Wu, Michael J. Cafarella, Lei Cao, Samuel Madden, Tim Kraska

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Independent(独立研究者) University of Arizona(亚利桑那大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI

AI总结 KramaBench是一个用于评估AI系统在数据湖到洞察流程中端到端能力的基准测试,包含104个挑战,测试AI在自动化编排数据任务方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01257 2026-03-03 cs.CR cs.SE 77%

A Systematic Study of LLM-Based Architectures for Automated Patching

对基于大语言模型的自动补丁架构的系统研究

Qingxiao Xu, Ze Sheng, Zhicheng Chen, Jeff Huang

专题命中 Agent评测 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.SE

AI总结 本文系统研究了基于LLM的自动补丁架构,通过统一基准评估四种范式,揭示了不同架构在效率、灵活性和泛化能力上的权衡,发现通用代码代理在性能上表现最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20424 2026-02-25 cs.AI 77%

Implicit Intelligence -- Evaluating Agents on What Users Don't Say

隐式智能 -- 评估代理在用户未言明之事上的能力

Ved Sirdeshmukh, Marc Wetter

机构 * Applied Machine Learning Research(应用机器学习研究)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 隐式智能框架评估AI代理在未明示约束下的推理能力,通过交互式世界模拟发现代理在复杂情境下的表现有限,揭示了改进空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18916 2026-02-24 cs.MA cs.AI cs.SC 77%

Adaptive Collaboration of Arena-Based Argumentative LLMs for Explainable and Contestable Legal Reasoning

面向可解释和可争议法律推理的 Arena 基础论证 LLM 自适应协作

Hoang-Loc Cao, Phuc Ho, Truong Thanh Hung Nguyen, Phuc Truong Loc Nguyen, Dinh Thien Loc Nguyen, Hung Cao

专题命中 Agent评测 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI

AI总结 ACAL通过自适应多智能体协作和 Arena 基础论证框架,提升法律推理的可解释性和可争议性,实验证明其在效率和透明度上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07553 2026-02-10 cs.AI 77%

VirtualEnv: A Platform for Embodied AI Research

VirtualEnv: 一个用于具身AI研究的平台

Kabir Swain, Sijie Han, Ayush Raina, Jin Zhang, Shuang Li, Michael Stopa, Antonio Torralba

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI

AI总结 VirtualEnv是一个基于Unreal Engine 5的开源平台,用于评估LLM在具身和交互场景中的能力,支持多智能体协作和程序生成任务,旨在推动AI与游戏的交叉研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01858 2026-02-03 cs.AI 77%

SOPRAG: Multi-view Graph Experts Retrieval for Industrial Standard Operating Procedures

SOPRAG:面向工业标准操作规程的多视图图专家检索

Liangtao Lin, Zhaomeng Zhu, Tianwei Zhang, Yonggang Wen

机构 * Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agent(abstract);workflow(abstract);multi-agent(abstract);分类 cs.AI

AI总结 SOPRAG通过多视图图专家检索框架,解决工业SOP检索中的结构复杂性和条件依赖性问题,提升检索准确性和响应实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00676 2026-02-03 cs.AI cs.MA 77%

OpenGuanDan: A Large-Scale Imperfect Information Game Benchmark

OpenGuanDan: 一个大规模非完全信息游戏基准

Chao Li, Shangdong Yang, Chiheng Zhan, Zhenxing Ge, Yujing Hu, Bingkun Bao, Xingguo Chen, Yang Gao

机构 * School of Computer Science, Nanjing University of Posts(南京邮电大学计算机科学学院) NetEase Fuxi AI Lab, Netease Inc(网易凤凰AI实验室,网易公司) School of Intelligent Science(智能科学学院) Technology, Nanjing University(技术,南京大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 OpenGuanDan是一个用于评估多智能体决策算法的新型大规模非完全信息游戏基准,通过模拟中国四人纸牌游戏并支持人机对抗,揭示了当前AI在复杂决策任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08952 2026-02-03 cs.LG 77%

When LLM Agents Meet Graph Optimization: An Automated Data Quality Improvement Approach

当大语言模型代理遇见图优化:一种自动化数据质量改进方法

Zhihan Zhang, Xunkai Li, Yilong Zuo, Yanzhe Wen, Zhaoxin Fan, Zhenjun Li, Bing Zhou, Rong-Hua Li, Guoren Wang

机构 * Shenzhen Institute of Technology(深圳理工大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.LG

AI总结 LAGA是一种统一的多代理框架,通过协调多模态优化全面提升文本属性图的数据质量,验证了数据驱动的质量优化在可靠分析中的重要性。

Comments 12 pages, 10figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00456 2026-02-03 cs.AI 77%

Benchmarking Agents in Insurance Underwriting Environments

在保险承保环境中评估智能体

Amanda Dsouza, Ramya Ramakrishnan, Charles Dickens, Bhavishya Pohani, Christopher M Glaze

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出UNDERWRITE基准,通过专家协作模拟真实保险承保场景,揭示了代理性能与企业需求间的差距,强调了专家参与和组合性方法的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20996 2026-01-30 cs.LG cond-mat.mtrl-sci 77%

MADE: Benchmark Environments for Closed-Loop Materials Discovery

MADE:用于闭环材料发现的基准环境

Shreshth A Malik, Tiarnan Doherty, Panagiotis Tigas, Muhammed Razzak, Stephen J. Roberts, Aron Walsh, Yarin Gal

机构 * OATML, Department of Computer Science, University of Oxford(OATML,计算机科学系,牛津大学) Diffractive Labs Machine Learning Research Group, Department of Engineering Science, University of Oxford(机器学习研究组,工程科学系,牛津大学) Thomas Young Centre(托马斯·杨中心) Department of Materials, Imperial College London(材料系,伦敦帝国学院)

专题命中 Agent评测 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.LG

AI总结 MADE提出了一种闭环材料发现的基准框架,通过模拟受限预算下的材料发现流程,评估发现算法的有效性和效率,并支持灵活的工作流研究。

详情

展开后加载摘要…

URL PDF HTML 收藏