arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-09 至 2026-03-09 共收录 19 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 19 篇

2603.04756 2026-03-09 cs.AI cs.CE cs.SE 90%

MOOSEnger -- a Domain-Specific AI Agent for the MOOSE Ecosystem

MOOSEnger -- 一个针对MOOSE生态系统的领域特定AI代理

Mengnan Li, Jason Miller, Zachary Prince, Alexander Lindsay, Cody Permann

机构 * Idaho National Laboratory(爱达荷国家实验室)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 MOOSEnger 是一个专为MOOSE生态系统的AI代理,通过检索增强生成和领域特定工具提升多物理场仿真效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01203 2026-03-09 cs.AI 83%

How Well Does Agent Development Reflect Real-World Work?

代理开发是否能反映现实世界的工作?

Zora Zhiruo Wang, Sanidhya Vijayvargiya, Aspen Chen, Hanmo Zhang, Venu Arvind Arangarajan, Jett Chen, Valerie Chen, Diyi Yang, Daniel Fried, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 本文研究了代理开发与现实工作分布的匹配程度,揭示了代理开发与人类劳动力分布的不匹配,并提出了三个原则以改进基准设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05578 2026-03-09 cs.SE cs.AI 81%

Tool-Genesis: A Task-Driven Tool Creation Benchmark for Self-Evolving Language Agent

Tool-Genesis: 一种以任务为导向的工具创建基准,用于自进化语言代理

Bowei Xia, Mengkang Hu, Shijian Wang, Jiarui Jin, Wenxiang Jiao, Yuan Lu, Kexin Li, Ping Luo

机构 * The University of Hong Kong(香港大学) Xiaohongshu Inc.(小红书公司)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 Tool-Genesis提出一种任务驱动的工具创建基准,用于评估自进化语言代理在无预定义规范下构建任务相关工具的能力及下游性能。

Comments 25 pages, 10 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06541 2026-03-09 cs.DB cs.AI cs.MA 77%

KramaBench: A Benchmark for AI Systems on Data-to-Insight Pipelines over Data Lakes

KramaBench:一个用于数据湖上数据到洞察流程的AI系统基准测试

Eugenie Lai, Gerardo Vitagliano, Ziyu Zhang, Om Chabra, Sivaprasad Sudhir, Anna Zeng, Anton A. Zabreyko, Chenning Li, Ferdi Kossmann, Jialin Ding, Jun Chen, Markos Markakis, Matthew Russo, Weiyang Wang, Ziniu Wu, Michael J. Cafarella, Lei Cao, Samuel Madden, Tim Kraska

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Independent(独立研究者) University of Arizona(亚利桑那大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);multi-agent(abstract);分类 cs.AI

AI总结 KramaBench是一个用于评估AI系统在数据湖到洞察流程中端到端能力的基准测试,包含104个挑战,测试AI在自动化编排数据任务方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06314 2026-03-09 physics.med-ph 71%

Sparse probabilistic evaluation for treatment planning: a feasibility study in IMPT head & neck patients

稀疏概率评估用于治疗计划:一项在IMPT头颈患者中的可行性研究

Jenneke I. de Jong, Steven J. M. Habraken, Albin Fredriksson, Johan Sundström, Erik Engwall, Sebastiaan Breedveld, Mischa S. Hoogeman

专题命中 Agent评测 :planning(title)

AI总结 本研究提出稀疏概率评估方法,用于提高IMPT治疗计划中目标覆盖与器官保护的平衡,通过优化网格设置实现高效计算,验证了其在头颈癌患者中的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06422 2026-03-09 cs.CR 67%

Before You Hand Over the Wheel: Evaluating LLMs for Security Incident Analysis

在交出轮子之前:评估LLMs用于安全事件分析

Sourov Jajodia, Madeena Sultana, Suryadipta Majumdar, Adrian Taylor, Grant Vandenberghe

专题命中 Agent评测 :agent(abstract);agentic(abstract)

AI总结 本文提出SIABENCH框架,通过构建首个涵盖安全事件分析两大类任务的数据集,并实现自主执行SIA任务的代理,对11种LLM进行基准测试,以评估其在动态安全事件分析中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10735 2026-03-09 cs.AI cs.CL cs.CY cs.LG 67%

Transforming Agency. On the mode of existence of Large Language Models

代理的转变。大型语言模型的存在模式

Xabier E. Barandiaran, Lola S. Almendros

机构 * IAS-Research Centre for Life, Mind, and Society, Dept. Philosophy UPV/EHU, University of the Basque Country(生命、心灵与社会研究所,哲学系,巴斯克大学) Institute for Science and Technology Studies, University of Salamanca (Spain)(科学与技术研究所,萨拉曼卡大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文探讨了大型语言模型作为代理的本体特征,指出其缺乏自主代理的必要条件,但能通过文本和计算躯体影响人类代理形式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05764 2026-03-09 cs.LG cs.AI 62%

TML-Bench: Benchmark for Data Science Agents on Tabular ML Tasks

TML-Bench:用于表格机器学习任务的数据科学代理基准

Mykola Pinchuk

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 TML-Bench评估10个开源LLM在Kaggle竞赛中的表现,揭示不同时间预算下模型性能的差异及稳定性。

Comments 19 pages, 16 tables and figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22266 2026-03-09 cs.LG cs.AI 62%

LLMTM: Benchmarking and Optimizing LLMs for Temporal Motif Analysis in Dynamic Graphs

LLMTM:动态图中基于时间 motif 分析的 LLM 评估与优化

Bing Hao, Minglai Shao, Zengyi Wo, Yunlong Chu, Yuhang Liu, Ruijie Wang

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出 LLMTM 基准测试,评估 LLM 在动态图时间 motif 分析中的性能,并开发结构感知调度器以优化效率与精度的平衡。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06252 2026-03-09 cs.LG stat.ML 57%

Synthetic Monitoring Environments for Reinforcement Learning

强化学习的合成监控环境

Leonard Pleiss, Carolin Schmidt, Maximilian Schiffer

机构 * Technical University Munich(慕尼黑技术大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出合成监控环境(SMEs),通过可配置的任务特征和已知最优策略,为强化学习提供精确评估框架,用于分析算法在分布内和分布外性能的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06025 2026-03-09 cs.IR cs.AI 57%

Sensitivity-Aware Retrieval-Augmented Intent Clarification

敏感性感知的检索增强意图澄清

Maik Larooij

机构 * ICAI OpenGov Lab x IRLab, University of Amsterdam, The Netherlands(ICAI开放政府实验室 x IRLab,阿姆斯特丹大学,荷兰)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种敏感性感知的检索增强意图澄清方法,旨在保护敏感信息的同时提升对话系统的性能。

Comments Accepted to CoSCIN@ECIR2026 (Workshop on Conversational Search for Complex Information Needs)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22773 2026-03-09 cs.SE 57%

A Structured Approach to Safety Case Construction for AI Systems

面向AI系统的安全案例构建的结构化方法

Sung Une Lee, Liming Zhu, Md Shamsujjoha, Liming Dong, Qinghua Lu, Jieshan Chen, Lionel Briand

专题命中 Agent评测 :agentic(abstract);分类 cs.SE

AI总结 本文提出了一种面向AI系统的结构化安全案例构建方法,通过定义特定于AI的声明类型、论点类型和证据家族,提供可重用的模板以应对AI系统动态变化的风险特征。

Comments 45 pages, 8 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06406 2026-03-09 cs.GT 50%

Temporal Network Creation Games: The Impact of Flexible Labels

时间网络创建博弈:灵活标签的影响

Hans Gawendowicz, Nicolas Klodt, Aleksandrs Morgensterns, George Skretas

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了时间网络创建博弈中灵活标签的影响,通过扩展现有模型允许代理决定边出现时间,并分析了两种可达性模型和多种成本函数下的纳什均衡存在性及价格无序和稳定性价格的上下界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14625 2026-03-09 cs.DC 50%

A Systematic Evaluation of the Potential of Carbon-Aware Execution for Scientific Workflows

对碳感知执行在科学工作流中潜力的系统评估

Kathleen West, Youssef Moawad, Fabian Lehmann, Vasilis Bountris, Ulf Leser, Yehia Elkhatib, Lauritz Thamsen

专题命中 Agent评测 :workflow(abstract)

AI总结 本研究系统评估了碳感知执行在科学工作流中的潜力,通过量化碳排放问题并展示时间偏移和资源扩展对减排的显著影响,提出更可持续的执行模型。

Comments This is a pre-print of our paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21835 2026-03-09 cs.CV 50%

UniVBench: Towards Unified Evaluation for Video Foundation Models

UniVBench:迈向统一评估视频基础模型

Jianhui Wei, Xiaotian Zhang, Yichen Li, Yuan Wang, Yan Zhang, Ziyi Chen, Zhihang Tang, Wei Xu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) ByteDance(字节跳动) Zhejiang Lab(浙江实验室)

专题命中 Agent评测 :agentic(abstract)

AI总结 UniVBench通过统一评估系统和多任务视频任务,首次提供衡量视频基础模型综合能力的框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17932 2026-03-09 cs.CY 50%

Operational Agency: A Permeable Legal Fiction for Tracing Culpability in AI Systems

可操作代理:一种渗透性法律虚构,用于追踪AI系统中的过失

Anirban Mukherjee, Hannah Hanwen Chang

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出可操作代理(OA)和可操作代理图(OAG)作为追踪AI系统过失的法律框架,通过分析AI的操作特征和因果关系,为法院和立法提供证据方法,确保人类问责制与技术自主性同步。

Comments Forthcoming, SMU Science and Technology Law Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16078 2026-03-09 econ.GN q-fin.EC 50%

AI as Coordination-Compressing Capital: Task Reallocation, Organizational Redesign, and the Regime Fork

人工智能作为协调压缩资本:任务再分配、组织重构与制度分支

Alex Farach

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出人工智能作为协调压缩资本的概念,通过降低协调成本促进任务创造,并揭示技术在不同受益者下产生不同制度结果的机制。

Comments v3: Tightened Gini proof (explicit Lorenz quotient-rule argument), qualified economy-wide claims to within-firm scope, added L_eff cancellation at capacity discussion, corrected negative-beta analysis, added proportional allocation definition, expanded PAM robustness discussion, clarified CES limitation, style edits. 23 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15625 2026-03-09 cs.CV 50%

EarthScape: A Multimodal Dataset for Surficial Geologic Mapping and Earth Surface Analysis

EarthScape:一种用于地表地质制图和地表分析的多模态数据集

Matthew Massey, Nusrat Munia, Abdullah-Al-Zubaer Imran

机构 * Kentucky Geological Survey(肯塔基地质调查局) University of Kentucky(肯塔基大学) Department of Computer Science(计算机科学系)

专题命中 Agent评测 :planning(abstract)

AI总结 EarthScape是一种用于地表地质制图和地表分析的多模态数据集,通过整合多种数据源提供统一的基准测试平台,提升多模态融合和领域适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10880 2026-03-09 cond-mat.soft 50%

Chaos-generating periodic orbits of topological defects in confined active nematics

拓扑缺陷在受限主动向列体中的混沌生成周期轨道

Brandon Klein, Alejandro J. Soto Franco, Md Mainul Hasan Sabbir, Matthew J. Deutsch, Ross Kliegman, Robin L. B. Selinger, Kevin A. Mitchell, Daniel A. Beller

专题命中 Agent评测 :agent(abstract)

AI总结 研究揭示了主动向列体中受限条件下,缺陷的周期轨道生成机制及有序流的设计原理。

Comments 24 pages, 8 figures, plus 6 pages of supplementary information with 1 supplementary figure. Supplementary videos can be viewed at https://pages.jh.edu/dbeller3/resources/SI-Videos/Klein-arXiv-2025/

详情

展开后加载摘要…

URL PDF HTML 收藏