arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-12 至 2026-05-12 共收录 408 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 72 篇

2605.08687 2026-05-12 cs.DB cs.AI 57%

PrepBench: How Far Are We from Natural-Language-Driven Data Preparation?

PrepBench: 我们距离自然语言驱动的数据准备还有多远?

Jingzhe Xu, Rui Wang, Jiannan Wang, Guoliang Li

机构 * Department of Computer Science and Technology, BNRist, Tsinghua University(计算机科学与技术系,BNRist,清华大学)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 PrepBench评估自然语言驱动的数据准备能力,涵盖交互澄清、代码生成和代码到工作流翻译三项核心能力,通过爬取数据挑战并设计系统性基准,揭示当前LLM在实现该范式转变中的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12606 2026-05-12 cs.LG 57%

RelBench v2: A Large-Scale Benchmark and Repository for Relational Data

RelBench v2:关系数据的大型基准和存储库

Justin Gu, Rishabh Ranjan, Charilaos Kanatsoulis, Haiming Tang, Martin Jurkovic, Valter Hudovernik, Mark Znidar, Pranshu Chaturvedi, Parth Shroff, Fengyu Li, Jure Leskovec

机构 * Stanford University(斯坦福大学) National University of Singapore(新加坡国立大学) University of Ljubljana(卢布尔雅那大学) Kumo AI University of Oxford(牛津大学)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 RelBench v2引入了四个大规模关系数据集,扩展了基准测试,并引入了自动补全任务,展示了关系学习模型在多表预测中的优势。

Comments Published at ICLR 2026. Website: https://relbench.stanford.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06286 2026-05-12 cs.AI 57%

When Agents Say One Thing and Do Another: Validating Elicited Beliefs from LLMs

当代理人言辞与行为不一致时:从LLMs中验证提取的信念

Khurram Yamin, Jingjing Tang, Santiago Cortes-Gomez, Amit Sharma, Eric Horvitz, Bryan Wilder

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Research(微软研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出一种决策理论框架,通过提取概率判断和决策并检验其一致性,验证LLMs的信念是否合理,发现最强模型的不一致程度较小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01022 2026-05-12 econ.GN cs.AI q-fin.EC 57%

Calibrating Behavioral Parameters with Large Language Models

用大语言模型校准行为参数

Brandon Yee, Pairie Koh

机构 * Management Sciences Lab(管理科学实验室) Yee Collins Research Group(Yee Collins研究组)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文利用大语言模型校准行为参数,发现其存在系统性理性偏差,并通过校准方法提升参数稳定性与理论一致性,验证了校准参数在资产定价模型中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22449 2026-05-12 cs.AI 57%

Emergence of Physical Intelligence via Controllable Information Production

通过可控信息生成实现物理智能的涌现

Tristan Shah, Stas Tiomkin

机构 * Department of Computer Science(计算机科学系) Texas Tech University(德克萨斯技术大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出可控信息生成框架,将内在动机与最优控制统一,揭示价值函数结构与柯莫哥罗夫-辛恩熵的联系,展现物理智能源于可控混沌边缘的驱动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08113 2026-05-12 cs.LG cs.CV 57%

Do Foundation Model Embeddings Improve Cross-Country Crop Yield Generalisation? A Leave-One-Country-Out Evaluation in Sub-Saharan Africa

基础模型嵌入是否能提升跨国家作物产量泛化?一种留一国家法的撒哈拉以南非洲评估

Yaw Osei Adjei

机构 * Department of Computer Science, Kwame Nkrumah University of Science and Technology(计算机科学系,库马西技术科学大学)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 本文评估了地理空间基础模型嵌入在留一国家法交叉验证中的表现,发现跨国家预测效果不佳,主要受限于产量分布差异。

Comments 9 pages, 10 figures, appendix, code and processed results released publicly

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10530 2026-05-12 cs.IR 50%

Personalized Deep Research: A User-Centric Framework, Dataset, and Hybrid Evaluation for Knowledge Discovery

个性化深度研究:以用户为中心的框架、数据集和混合评估方法用于知识发现

Xiaopeng Li, Wenlin Zhang, Yingyi Zhang, Pengyue Jia, Yejing Wang, Yichao Wang, Yong Liu, Huifeng Guo, Xiangyu Zhao

专题命中 Agent评测 :planning(abstract)

AI总结 本文提出PDR框架,结合用户上下文动态调整检索深度和广度,通过混合评估方法提升检索效用和报告相关性,验证了个性化知识获取的可行性。

Comments Accepted to SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03772 2026-05-12 physics.soc-ph cs.MA nlin.AO 50%

Cooperation in public goods game on square lattices with agents changing interaction groups

在正方形晶格上相互作用代理群体中的合作

Jarosław Adam Miszczak

专题命中 Agent评测 :agent(abstract)

AI总结 研究探讨了在无外部机制情况下,正方形晶格上代理群体中合作的形成机制,通过交互网络多样性促进合作,并发现代理切换交互邻域会抑制合作形成。

Comments 18 pages, 8 figures, code available at https://github.com/jmiszczak/pgg_group_diversity

Journal ref Physica A: Statistical Mechanics and its Applications, Volume 694, pp. 131613 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09988 2026-05-12 cs.GT 50%

A Resource Allocation Game and its Equilibrium Strategies

资源分配博弈及其均衡策略

Duan-Shin Lee

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一个贝叶斯博弈用于资源分配,分析了两玩家和大规模玩家的均衡策略函数,采用交替身份-平坦函数进行数学分析,并提出构造算法以获得纳什均衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09799 2026-05-12 eess.SY cs.SY 50%

Dynamic Scheduling of a Parallel-Server Queueing System: A Computational Method for High-Dimensional Problems

并行服务器排队系统的动态调度:一种用于高维问题的计算方法

Baris Ata, Ebru Kasikaralar

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一种计算方法,用于解决高维问题中的并行服务器排队系统调度问题,通过深度神经网络技术构建策略,并在大量客户类别下保持计算可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09185 2026-05-12 cs.CE 50%

AutoRedTrader: Autonomous Red Teaming of Trading Agents through Synthetic Misinformation Injection

AutoRedTrader: 通过合成虚假信息注入实现交易代理的自主红队测试

Zhiwei Liu, Yangyang Yu, Yupeng Cao, Yuechen Jiang, Haohang Li, Zhuoran Lu, Yuyan Wang, Yixiang Zheng, Xiaorui Guo, Calvin Yixiang Cheng, Sophia Ananiadou

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出AutoRedTrader框架,通过行为偏差操控、微小文本扰动和重写策略生成金融领域虚假信息,评估其对交易代理的影响及历史市场证据的稳定性。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08989 2026-05-12 econ.TH math.OC 50%

Aggregating Elo Ratings: An Axiomatization

聚合Elo评分:一个公理化研究

Mehmet Mars Seven

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过公理化方法研究如何将多个Elo评分聚合为单一标量评分,提出了一种基于Elo尺度的聚合规则,证明其满足三个核心公理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08859 2026-05-12 cs.GT 50%

On MMS, APS and XOS

关于MMS、APS和XOS

Uriel Feige, Vadim Grinberg

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了在XOS估值下,如何为n个享有同等权利的代理人分配m个不可分割物品,提出改进的MMS近似比方法,适用于足够大的n。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12194 2026-05-12 cs.CR 50%

MalTool: Malicious Tool Attacks on LLM Agents

MalTool:针对LLM代理的恶意工具攻击

Yuepeng Hu, Yuqi Jia, Mengyuan Li, Dawn Song, Neil Gong

专题命中 Agent评测 :agent(abstract)

AI总结 研究提出MalTool框架,系统分析恶意工具代码实现,展示恶意行为分类及生成方法,揭示现有检测方法对恶意工具的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27157 2026-05-12 cs.IR 50%

A Survey on Generative Recommendation: Data, Model, and Tasks

生成推荐的综述:数据、模型与任务

Min Hou, Le Wu, Yuxin Liao, Yonghui Yang, Zhen Zhang, Yu Wang, Changlong Zheng, Han Wu, Richang Hong

专题命中 Agent评测 :agent(abstract)

AI总结 本文综述生成推荐领域,探讨数据、模型与任务维度,分析生成模型在推荐中的应用与挑战,提出智能推荐助手的发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.16376 2026-05-12 physics.flu-dyn physics.app-ph physics.comp-ph 50%

Acoustics-based Active Control of Unsteady Flow Dynamics using Reinforcement Learning Driven Synthetic Jets

基于声学的主动控制不稳流动力学使用强化学习驱动的合成喷嘴

Siddharth Rout, Khai Phan, Chao-An Lin

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出利用声学观测作为主要控制信号,通过深度强化学习与合成喷嘴驱动的主动控制方法,有效抑制圆柱后方涡街结构,降低噪声和阻力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 2 篇

2605.09889 2026-05-12 cs.MA 50%

Skill Description Deception Attack against Task Routing in Internet of Agents

针对物联网代理中任务路由的技能描述欺骗攻击

Jiayi He, Xiaofeng Luo, Jiawen Kang, Ruichen Zhang, Jianhang Tang, Dong In Kim

专题命中 其他Agent :agentic(abstract)

AI总结 本文提出技能描述欺骗攻击模型,通过生成虚假技能描述影响任务路由决策,实验显示攻击成功率高达98%,揭示了物联网代理系统的新安全漏洞。

Comments Submitted to IEEE Globecom 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09647 2026-05-12 cs.SI 50%

Modeling Implicit Conflict Monitoring Mechanisms against Stereotypes in LLMs

对LLMs中隐含冲突监控机制对抗刻板印象的建模

Jingshen Zhang, Bo Wang, Yanlin Fu, Dongming Zhao, Ruifang He, Yuexian Hou, Zifei Yu

专题命中 其他Agent :AI agent(abstract)

AI总结 本文提出COCO方法,通过对比因果机制识别高内在一致性且强跨对比差异的神经元,提升模型公平性并对抗对抗性劫持攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏