arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-08 至 2026-05-08 共收录 163 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 29 篇

2510.16811 2026-05-08 cs.LG 57%

Graph Learning Is Suboptimal in Causal Bandits

图学习在因果老虎机中是次优的

Mohammad Shahverdikondori, Jalal Etesami, Negar Kiyavash

机构 * College of Management of Technology, EPFL(EPFL技术管理学院) Department of Computer Science, TU Munich(慕尼黑技术大学计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文研究了在因果充分性条件下因果老虎机的 regrets 最小化问题,发现学习父集并非最优策略,并提出无需图学习的近优算法。

Comments 32 pages, accepted at AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05726 2026-05-08 cs.AI 57%

SkillRet: A Large-Scale Benchmark for Skill Retrieval in LLM Agents

SkillRet:一种大规模技能检索基准,用于LLM代理

Hongcheol Cho, Ryangkyung Kang, Youngeun Kim

机构 * ThakiCloud

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出SkillRet基准,用于评估LLM代理中的技能检索。该基准包含17810个公开技能,提供63259个训练样本和4997个评估查询,通过任务特定微调显著提升了检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05280 2026-05-08 cs.LG 57%

Forecasting Green Skill Demand in the Automotive Industry: Evidence from Online Job Postings

预测汽车行业的绿色技能需求:来自在线招聘信息的证据

Sabur Butt, Joshua N. Arrazola E., Hector G. Ceballos, Patricia Caratozzolo

机构 * Institute for the Future of Education, Tecnológico de Monterrey(教育未来研究所,蒙特雷理工大学)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 本文通过分析墨西哥汽车行业的在线招聘信息,构建计算框架预测绿色技能需求,识别出274种绿色技能,并利用时间序列模型预测未来趋势,发现可再生能源、回收和氢能技术需求增长最快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06486 2026-05-08 cs.CR 50%

Autonomous Adversary: Red-Teaming in the age of LLM

自主对抗者:在LLM时代进行红队测试

Mohammad Mamun, Mohamed Gaber, Scott Buffett, Sherif Saad

专题命中 Agent评测 :planning(abstract)

AI总结 本文探讨了语言模型代理在红队操作中的应用,通过MITRE ATT&CK框架分析其与核心进攻功能的交集,并评估LLM代理在治理和现实评估中的优缺点。研究通过两个横向移动场景对比三种操作模式,发现专家定义的行动计划任务完成率最高,但所有模式均存在频繁失败问题。

Comments Accepted at ACISP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06451 2026-05-08 cs.GT econ.TH 50%

Counterexamples to EFX for Submodular and Subadditive Valuations

对子模和子加性估值的EFX的反例

Simon Mackenzie, Mashbat Suzuki

专题命中 Agent评测 :agent(abstract)

AI总结 本文构造了三个代理人八个物品的实例,证明在单调子加性估值下,不存在满足α-EFX的分配,且提供了子模(实际上加权覆盖)估值下的相关反例,展示了对称性对EFX存在的阻碍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06393 2026-05-08 cs.CR 50%

Constraining Host-Level Abuse in Self-Hosted Computer-Use Agents via TEE-Backed Isolation

通过TEE后置隔离约束自托管计算机使用代理的主机级滥用

Di Lu, Bo Zhang, Xiyuan Li, Yongzhi Liao, Xuewen Dong, Yulong Shen, Zhiquan Liu, Jianfeng Ma

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出基于操作的风险约束模型,通过TEE后置可信操作平面保护关键安全功能,实现对自托管计算机使用代理操作的安全限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05901 2026-05-08 cs.CE 50%

Duplicate-Aware Shift-and-Lift Carleman Linearization:Structure, Complexity, and Comparative Evaluation

具有重复意识的移位-提升Carleman线性化:结构、复杂性和比较评估

Takaki Akiba, Youhi Morii

专题命中 Agent评测 :workflow(abstract)

AI总结 本文提出一种移位-提升架构以消除Carleman线性化中因状态维度和截断阶数增加而产生的重复单项式贡献,通过移动中心扩展提高高阶截断的实用性,并通过对比实验验证了该方法在双线性驱动和逻辑交互等基准测试中的收敛性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05752 2026-05-08 stat.ME stat.AP 50%

Generative AI-Based Monte Carlo Simulation for Method Evaluation Using Synthetic Multilevel Data

基于生成AI的蒙特卡洛模拟用于方法评估的合成多级数据

Youmi Suk, Chenguang Pan, Weixuan Xiao

专题命中 Agent评测 :workflow(abstract)

AI总结 本文提出一种基于生成AI的多级数据模拟框架,用于评估定量方法的预测性能和参数恢复能力,通过改进扩散模型和GANs提升数据真实性,并系统评估模拟设计的可靠性。

Comments 31 pages for the main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05448 2026-05-08 cond-mat.soft cond-mat.stat-mech 50%

Breakdown of Emergent Chiral Order and Defect Chaos in Nonreciprocal Flocks

非互易鸟群中涌现手性秩序的崩溃与缺陷混沌

Charlotte Myin, Suropriya Saha, Benoît Mahault

专题命中 Agent评测 :agent(abstract)

AI总结 研究揭示非互易鸟群中手性秩序易崩溃,通过模拟与连续描述显示拓扑缺陷导致旋转手性态破坏,产生时空混沌并具有有限相关长度。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26808 2026-05-08 cs.GT cs.IT math.IT 50%

MISES: Minimal Information Sufficiency for Effective Service

MISES: 最小信息充分性以实现有效服务

Joss Armstrong

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了基于类别的协调机制,通过将声明的服务类别映射到固定资源配置来分配资源,不观察个体需求类型。研究发现,相对福利差距Delta在聚合类内分配方差epsilon的范围内有紧致的双侧界,并证明了需求衍生的类别同时最小化福利损失和误报激励。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 3 篇

2605.05696 2026-05-08 cs.DC cs.AI cs.LG 81%

Irminsul: MLA-Native Position-Independent Caching for Agentic LLM Serving

Irminsul:基于MLA的原生位置无关缓存用于代理LLM服务

Bole Ma, Jan Eitzinger, Harald Köstler

机构 * Erlangen National High Performance Computing Center(埃朗根国家高性能计算中心)

专题命中 其他Agent :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Irminsul,一种基于MLA的原生位置无关缓存,通过内容哈希键和δ旋转规则提升代理LLM服务性能,实现高达83%的提示词恢复率和63%的预填能量节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06522 2026-05-08 cs.LG cs.CV 79%

Agentic AIs Are the Missing Paradigm for Out-of-Distribution Generalization in Foundation Models

代理AI是基础模型在分布外泛化中的缺失范式

Xin Wang, Haibo Chen, Wenxuan Liu, Wenwu Zhu

机构 * Tsinghua University(清华大学)

专题命中 其他Agent :agentic(title,abstract);分类 cs.LG

AI总结 本文提出代理系统是解决基础模型分布外泛化问题的必要范式,通过四个步骤论证代理系统在结构上超越了传统模型中心范式,提出了参数覆盖上限的理论,并反驳了七项反论点。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05307 2026-05-08 cs.HC 78%

When Should Users Check? Modeling Confirmation Frequency inMulti-Step Agentic AI Tasks

用户何时应检查?在多步骤代理AI任务中建模确认频率

Jieyu Zhou, Aryan Roy, Sneh Gupta, Daniel Weitekamp, Christopher J. MacLellan

专题命中 其他Agent :agentic(title);AI agent(abstract)

AI总结 本文提出了一种基于时间调度的模型,用于确定多步骤AI任务中最佳的确认点位置,通过实验发现用户更倾向于中间确认而非终点确认,从而减少任务完成时间。

Comments Accepted by Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26), April 13--17, 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏