arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-16 至 2026-04-16 共收录 159 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 28 篇

2412.09819 2026-04-16 cs.LG cs.SY eess.SY 57%

FDM-Bench: A Comprehensive Benchmark for Evaluating Large Language Models in Additive Manufacturing Tasks

FDM-Bench:用于评估大型语言模型在增材制造任务中的综合基准

Ahmadreza Eslaminia, Adrian Jackson, Beitong Tian, Avi Stern, Hallie Gordon, Rajiv Malhotra, Klara Nahrstedt, Chenhui Shao

机构 * Department of Mechanical Science and Engineering, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校机械科学与工程系) Coordinated Science Laboratory, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校协调科学实验室) Department of Mechanical and Aerospace Engineering, Rutgers University(罗格斯大学机械与航空航天工程系) Department of Mechanical Engineering, University of Michigan(密歇根大学机械工程系)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 本文提出FDM-Bench基准,用于评估大型语言模型在增材制造任务中的能力,通过用户查询和G代码样本评估不同模型的性能,发现闭源模型在检测G代码异常方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13909 2026-04-16 quant-ph 50%

dqc_simulator: an easy-to-use distributed quantum computing simulator

dqc_simulator: 一个易于使用的分布式量子计算模拟器

Kenny Campbell

专题命中 Agent评测 :workflow(abstract)

AI总结 本文提出dqc_simulator,一个Python编写的新型模拟工具,自动化了分布式量子计算模拟的关键步骤,便于创建可靠的全栈测试和基准。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20515 2026-04-16 q-fin.CP econ.EM q-fin.RM 50%

Modeling Bank Systemic Risk of Emerging Markets under Geopolitical Shocks: Empirical Evidence from BRICS Countries

新兴市场银行系统性风险建模:地缘政治冲击下的实证研究——以金砖国家为例

Haibo Wang

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出BRIDGES框架,通过动态图和事件模拟分析金砖国家银行系统性风险,揭示最大银行失败和地缘政治冲击对系统稳定性的影响。

Comments 22 pages and 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.13159 2026-04-16 econ.EM 50%

Nonparametric mixed logit model with market-level parameters estimated from market share data

非参数混合逻辑模型:基于市场份额数据估计的市场级参数

Xiyuan Ren, Joseph Y. J. Chow, Prateek Bansal

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种非参数混合逻辑模型,利用市场级选择份额数据估计,通过多代理逆效用最大化问题解决现有市场级选择模型的参数估计局限。实证研究显示该模型在估计精度和预测准确性上优于传统模型。

Journal ref Transportation Research Part B 196 (2025) 103220

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13121 2026-04-16 cs.RO 50%

Olfactory pursuit: catching a moving odor source in complex flows

嗅觉追逐:在复杂的流体中捕捉移动的气味源

Maurizio Carbone, Lorenzo Piro, Robin A. Heinonen, Luca Biferale, Massimo Cencini, Antonio Celani

机构 * Istituto dei Sistemi Complessi, CNR(复杂系统研究所,国家研究 council) Department of Physics & INFN, Tor Vergata University of Rome(罗马 Tor Vergata 大学物理系及 INFN)

专题命中 Agent评测 :agent(abstract)

AI总结 研究提出了一种基于部分可观测马尔可夫决策过程的嗅觉追逐方法,结合信息获取与贪心策略,有效应对目标持续运动的挑战,提升在信息贫乏环境中的搜索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07043 2026-04-16 cond-mat.mtrl-sci 50%

Uni2D: A Universal Machine Learning Interatomic Potential for Two-Dimensional Materials

Uni2D:一种适用于二维材料的通用机器学习交互势能模型

Haidi Wang, Yufan Yao, Haonan Song, Huimiao Wang, Xiaofeng Liu, Zhao Chen, Weiwei Chen, Weiduo Zhu, Zhongjun Li, Jinlong Yang

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出Uni2D,一种针对二维材料设计的交互势能模型,通过大规模数据训练实现了对能量、力和应力的可靠预测,支持高通量筛选和计算探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01858 2026-04-16 math.OC q-fin.PM 50%

Mean Field Game of Optimal Tracking Portfolio

均场博弈中的最优跟踪投资组合

Lijun Bo, Yijie Huang, Xiang Yu

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了由大量基金管理人员竞争产生的均场博弈问题,引入了基于基准跟踪的相对绩效。通过连续代理模型,建立带有反射状态过程的均场博弈问题,并利用PDE方法证明了均场均衡的存在性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.10000 2026-04-16 q-bio.PE cond-mat.stat-mech nlin.CG 50%

Universal principles of cell population growth follow from local contact inhibition

细胞群体增长的普遍原理源于局部接触抑制

Gregory J. Kimmel, Sadegh Marzban, Mehdi Damaghi, Arne Traulsen, Alexander R. A. Anderson, Jeffrey West, Philipp M. Altrock

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过研究微观假设与接触抑制的联系,统一了五种经典肿瘤生长定律,揭示了接触抑制与其他假设对癌症细胞生长定量理解的影响。

Comments 41 pages, 6 main figures, 2 tables, 67 references, 4 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 1 篇

2604.13849 2026-04-16 cs.CR cs.AI 70%

MCPThreatHive: Automated Threat Intelligence for Model Context Protocol Ecosystems

MCPThreatHive:面向模型上下文协议生态系统的自动化威胁情报

Yi Ting Shen, Kentaroh Toyoda, Alex Leung

机构 * Vulcan Research(Vulcan研究)

专题命中 其他Agent :agentic(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出MCPThreatHive平台,通过AI驱动威胁提取与分类,解决MCP安全威胁建模不完整、威胁情报不连续及分类不统一的问题。

Comments A white paper of our presentation at DEFCON SG 2026 (Demo Labs) https://defcon.org/html/defcon-singapore/dc-singapore-demolabs.html

详情

展开后加载摘要…

URL PDF HTML 收藏