arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-22 至 2026-05-22 共收录 160 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 35 篇

2605.22505 2026-05-22 cs.AI 57%

Towards Direct Evaluation of Harness Optimizers via Priority Ranking

通过优先级排名直接评估Harness优化器

Kai Tzu-iunn Ong, Minseok Kang, Dongwook Choi, Junhee Cho, Seungju Kim, Seungwon Lim, Geunha Jang, Minwoo Oh, Bogyung Jeong, Sunghwan Kim, Taeyoon Kwon, Jinyoung Yeo

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出通过优先级排名直接评估Harness优化器,以解决传统方法中因缺乏oracle harness而无法有效评估优化器中间步骤的问题,展示了该方法在多步骤优化中的可靠性。

Comments Preprint. Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22387 2026-05-22 cs.LG cs.CE 57%

Hybrid Kolmogorov-Arnold Network and XGBoost Framework for Week-Ahead Price Forecasting in Australia's National Electricity Market

混合 Kolmogorov-Arnold 网络与 XGBoost 框架用于澳大利亚国家电力市场的周 ahead 电价预测

Houxuan Zhou, Sriram Prasad, Chenghao Huang, Jiajie Feng, Hao Wang

机构 * Department of Data Science and AI, Faculty of IT, Monash University, Australia(数据科学与人工智能系,IT学院,墨尔本大学,澳大利亚) School of Electrical Engineering and Computer Science, University of Queensland, Australia(电气工程与计算机科学学院,昆士兰大学,澳大利亚) Monash Energy Institute, Monash University, Australia(墨尔本能源研究所,墨尔本大学,澳大利亚)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 本文提出了一种混合 KAN+XGBoost 框架,用于预测澳大利亚国家电力市场的周 ahead 电价,该框架结合了 Kolmogorov-Arnold 网络的全局非线性表示能力和 XGBoost 的局部鲁棒性,以捕捉长期依赖和短期价格波动,实验表明该模型在 MAE 上比 XGBoost 和 naive 基线模型分别减少了 12% 和 50% 以上。

Comments The 24th IEEE International Conference on Industrial Informatics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22306 2026-05-22 cs.MA cs.AI 57%

ACCoRD: Actor-Critic Conflict Resolution with Deep learning for O-RAN xApps

ACCoRD:基于深度学习的O-RAN xApps中的Actor-Critic冲突解决

Cezary Adamczyk, Adrian Kliks

机构 * Institute of Radiocommunications(无线电通信研究所) Poznan University of Technology(波兹南技术大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种基于深度学习的Actor-Critic冲突解决方法ACCoRD,用于在O-RAN xApps中实时解决控制冲突,通过强化学习算法PPO-Clip训练人工神经网络,提高了规则方法在中高流量场景下的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22291 2026-05-22 cs.LG 57%

Long-term Fairness with Selective Labels

长期公平性与选择性标签

Giovani Valdrighi, Isabel Valera, Marcos Medeiros Raimundo

机构 * Department of Computer Science, Saarland University, Saarbrücken, Germany(萨尔布吕肯大学计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文研究了在选择性标签设置下长期公平性的问题,提出了一种新的框架,通过结合观测数据和标签预测模型来估计真实的公平性度量,并提出了一种新的强化学习算法以实现有效长期公平决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21958 2026-05-22 cs.CL 57%

Diagnosis Is Not Prescription: Linguistic Co-Adaptation Explains Patching Hazards in LLM Pipelines

诊断并非处方:语言共适应解释了LLM流水线中的修补危害

Yoon Jeonghun, Kim Dongchan

机构 * KAIST (Korea Advanced Institute of Science and Technology)(韩国科学技术院) NAVER Corp.(NAVER公司)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文研究了多模块LLM代理失败时,诊断与修补之间的矛盾,发现路由模块虽为瓶颈,但注入修正示例反而降低性能,而修正查询重写模块则更有效,提出了语言合同假说解释这种现象。

Comments Preprint. Under review at EMNLP 2026 (ARR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21800 2026-05-22 cs.LG cs.RO 57%

stable-worldmodel: A Platform for Reproducible World Modeling Research and Evaluation

stable-worldmodel: 一个用于可重复世界建模研究和评估的平台

Lucas Maes, Quentin Le Lidec, Luiz Facury, Nassim Massaudi, Ayush Chaurasia, Francesco Capuano, Richard Gao, Taj Gillin, Dan Haramati, Damien Scieur, Yann LeCun, Randall Balestriero

机构 * Mila & Université de Montréal(Mila与蒙特利尔大学) New York University(纽约大学) Universidade Federal de Minas Gerais(巴西联邦大学矿务学院) Independent Researcher(独立研究者) LanceDB University of Oxford(牛津大学) Brown University(布朗大学)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 本文提出stable-worldmodel平台,旨在解决世界建模研究中代码库、数据管道和评估协议碎片化的问题,通过提供高性能的数据层、现代世界模型基线和规划求解器的实现,以及扩展的环境和任务,实现标准化和可重复的世界建模研究和评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21694 2026-05-22 cs.CR cs.AI 57%

PocketAgents: A Manifest-Driven Library of Autonomous Defense Agents

PocketAgents: 一种基于manifest的自主防御代理库

Sidnei Barbieri, Ágney Lopes Roth Ferraz, Lourenço Alves Pereira Júnior

机构 * Aeronautics Institute of Technology(航空技术研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出PocketAgents,一种基于manifest的自主防御代理库,通过定义代理的manifest、prompt和运行时上下文,实现了对大型语言模型驱动的防御系统进行可测量、可扩展和可追溯的防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21844 2026-05-22 nlin.AO cond-mat.stat-mech physics.soc-ph 50%

A Utility-Driven Bounded-Confidence Model for Opinion Dynamics

基于效用的有界信心意见动力学模型

Alex Siebenmorgen, Juan G. Restrepo

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种基于效用的有界信心模型,研究意见动态中的社会影响,通过效用景观和学习率确定有效势能,并展示多模态效用函数下的意见状态切换和集群合并。

Comments 5 pages with 4 figures plus Supplementary Material

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15537 2026-05-22 physics.soc-ph econ.GN q-fin.EC 50%

Can Rising Consumption Deepen Inequality?

消费增长是否会加剧不平等?

Jhordan Silveira de Borba, Celia Anteneodo, Sebastian Gonçalves

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了消费增长对财富不平等的影响,扩展并检验了Ian Wright提出的资本主义社会架构代理模型,发现不平等程度主要受平均人均财富与平均工资比值R的影响,即使在放松假设后,结果仍保持稳健。

Comments 21 pages, 8 figures

Journal ref The European Physical Journal Special Topics (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 1 篇

2605.21792 2026-05-22 cs.CL cs.AI cs.DB cs.LG 67%

Residual Skill Optimization for Text-to-SQL Ensembles

残差技能优化用于文本到SQL集成

Jiongli Zhu, Haoquan Guan, Parjanya Prajakta Prashant, Nikki Lijing Kuang, Seyedeh Baharan Khatami, Canwen Xu, Xiaodong Yu, Yingyu Lin, Zhewei Yao, Yuxiong He, Babak Salimi

机构 * University of California, San Diego(加州大学圣地亚哥分校) Snowflake AI Research(Snowflake人工智能研究)

专题命中 其他Agent :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出DivSkill-SQL,一种残差技能优化框架,通过在当前技能集成失败的示例上优化新技能,从而构建互补的文本到SQL集成,提升Pass@K性能,在Spider2-Lite上实现了显著的准确性提升,同时在不同方言和任务上表现出一致的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏