arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-27 至 2026-05-27 共收录 204 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 35 篇

2601.05899 2026-05-27 cs.AI 77%

TowerMind: A Tower Defence Game Learning Environment and Benchmark for LLM as Agents

TowerMind: 一个用于LLM作为智能体的塔防游戏学习环境与基准

Dawei Wang, Chengming Zhou, Di Zhao, Xinyuan Liu, Marci Chi Ma, Gary Ushaw, Richard Davison

机构 * Newcastle University(新castle大学) University of Auckland(奥克兰大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出TowerMind,一个基于塔防子类型的轻量级、多模态游戏环境,用于评估大语言模型在长期规划和决策中的能力,并揭示其与人类专家的性能差距及关键局限性。

Comments AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19667 2026-05-27 cs.CL cs.AI cs.CV cs.LG cs.MA 75%

Chat2Workflow: A Benchmark for Generating Executable Visual Workflows with Natural Language

Chat2Workflow: 用自然语言生成可执行可视化工作流的基准

Yi Zhong, Buqiang Xu, Yijun Wang, Zifei Shan, Shuofei Qiao, Guozhou Zheng, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Tencent(腾讯)

专题命中 Agent评测 :workflow(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出Chat2Workflow基准,用于评估大语言模型从自然语言生成可执行可视化工作流的能力,并设计了一个智能体基线以提升性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23149 2026-05-27 cs.CL 74%

AlignEvoSkill: Towards Knowledge-Aware and Task-Aligned Agent Skill Evolution

AlignEvoSkill: 迈向知识感知与任务对齐的智能体技能进化

Dingzirui Wang, Xuanliang Zhang, Keyan Xu, Qingfu Zhu, Wanxiang Che, Yang Deng

机构 * Singapore Management University(新加坡国立大学)

专题命中 Agent评测 :agent(title);分类 cs.CL

AI总结 提出AlignEvoSkill框架,通过联合建模知识覆盖和任务对齐,从失败轨迹中识别知识标签、检索并适配候选技能,再基于知识覆盖和任务对齐分数筛选高质量技能,在3个基准和4个LLM骨干上相对提升34.7%,实现技能进化新SOTA且成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27141 2026-05-27 cs.AI 70%

VitaBench 2.0: Evaluating Personalized and Proactive Agents in Long-Term User Interactions

VitaBench 2.0:评估长期用户交互中的个性化与主动型代理

Yuxin Chen, Yi Zhang, Zhengzhou Cai, Yaorui Shi, Zhiyuan Yao, Chenhang Cui, Jingnan Zheng, Yaqi Huo, Xi Su, Qi Gu, Xunliang Cai, Xiang Wang, An Zhang, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Meituan(美团) University of Science and Technology of China(中国科学技术大学) Beijing University of Posts and Telecommunications(北京邮电大学) Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.AI

AI总结 针对现有代理基准忽视用户偏好推断与利用的问题,提出VitaBench 2.0基准,通过时间序列任务和可扩展记忆接口评估代理在长期交互中的个性化与主动性,实验表明最先进模型仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20530 2026-05-27 cs.AI cs.CL cs.LG cs.SE 70%

AgentAtlas: Beyond Outcome Leaderboards for LLM Agents

AgentAtlas:超越LLM智能体的结果排行榜

Parsa Mazaheri, Kasra Mazaheri

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出AgentAtlas框架,通过控制决策分类法和轨迹故障词汇表,将智能体评估从结果成功分离为控制决策质量和轨迹质量,并揭示仅依赖结果排行榜的测量风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26448 2026-05-27 cs.MA cs.GT cs.NE 67%

Constitutional Arms Races in the Public Goods Game: Co-Evolving LLM Constitutions Under Cooperation-Defection Pressure

公共物品博弈中的宪法军备竞赛:合作-背叛压力下共进化的大语言模型宪法

Ujwal Kumar, Arth Singh, Hershraj Niranjani, Machiko Hirota, Takehiro Takayanagi, Alice Saito, Eiji Kamioka, Phan Xuan Tan

专题命中 Agent评测 :agent(abstract);agentic(abstract)

AI总结 研究在公共物品博弈中,通过LLM引导的进化搜索,发现对抗性宪法共进化在耦合适应度和足够评估预算下可行,并产生可解释的红队测试工件。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27068 2026-05-27 cs.CL cs.AI cs.MA 62%

QUACK: Questioning, Understanding, and Auditing Communicated Knowledge in Multimodal Social Deduction Agents

QUACK: 多模态社交推理智能体中的沟通知识质疑、理解与审计

Ye Yuan, Rui Song, Weien Li, Zeyu Li, Haochen Liu, Xiangyu Kong, Changjiang Han, Yonghan Yang, Zichen Zhao, Zixuan Dong, Fuyuan Lyu, Bowei He, Haolun Wu, Jikun Kang, Xue Liu

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所) University of Cambridge(剑桥大学) MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(MBZUAI - 摩苏尔·本·扎耶德人工智能大学) University of Toronto(多伦多大学) Salesforce

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出QUACK框架,通过游戏结果、行为轨迹和话语一致性三级评估,自动审计多模态社交推理智能体语言与感知行为的一致性,发现最强智能体仍有15.1%的空间幻觉和过半无据指控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26438 2026-05-27 cs.CL cs.AI 62%

LURE: Live-Usage Replay Evaluations for Reducing Evaluation Awareness

LURE: 减少评估感知的实时使用回放评估

Igor Ivanov, David Demitri Africa

机构 * Meridian Cambridge(梅里登剑桥)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出LURE方法,通过回放真实代理交互轨迹并附加评估提示来构建类似部署的评估,以减少大语言模型的评估感知,并引入自动化评估真实性流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12564 2026-05-27 cs.CL cs.AI 62%

Sell Me This Stock: Unsafe Recommendation Drift in LLM Agents

卖给我这支股票:LLM智能体中的不安全推荐漂移

Zekun Wu, Adriano Koshiyama, Sahan Bulathwela, Maria Perez-Ortiz

机构 * Centre for Artificial Intelligence, University College London(人工智能研究中心,伦敦大学学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究LLM智能体在多轮金融推荐中因工具输出被操纵而产生风险不匹配推荐的问题,通过实验揭示评估盲区并分析机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01668 2026-05-27 cs.CL cs.AI 62%

EHRSummarizer: A Privacy-Aware, FHIR-Native Reference Architecture for Source-Grounded EHR Summarization

EHRSummarizer:一种隐私感知、FHIR原生的源接地EHR摘要参考架构

Houman Kazemzadeh, Nima Minaifar, Kamyar Naderi, Sho Tabibzadeh

机构 * MedLedger365 MedConnect365 Xylemed Kypath Associates Inc.

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 提出一种隐私感知、FHIR原生的参考架构EHRSummarizer,通过检索HL7 FHIR R4资源并约束生成源接地摘要,以支持临床病历审查。

Comments 15 pages, 2 figures, 2 tables. Version 2 clarifies missing-data status handling, medication-status ambiguity, controlled narrative-document handling, source-grounded resource grouping, and future source-to-summary traceability

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26539 2026-05-27 cs.SE cs.CR 61%

FuzzPilot: Plateau-Triggered Recipe Validation for Structured Text Fuzzing

FuzzPilot: 用于结构化文本模糊测试的高原触发式配方验证

Zhiyi Yao

专题命中 Agent评测 :agent(abstract,comments);分类 cs.SE

AI总结 FuzzPilot 通过高原触发式配方验证,在覆盖率停滞时利用快照和微测试评估变异配方,以提升 AFL++ 的模糊测试效率。

Comments 41 pages, 7 figures, 7 tables. Preliminary cJSON-only evaluation (N=5 main, N=3 ablation; descriptive statistics, no significance claims). Code and 25-run artifacts at https://github.com/Qiao-Zhiyi/fuzz_agent (tag paper01-arxiv-v1). Venue-version Stage-1 pilot on libxml2, sqlite3, openssl_x509 currently in flight; v2 will report those results

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26394 2026-05-27 cs.CL 57%

Memory Architectures for Multi-Turn Text-to-SQL: A Benchmark and Empirical Study

多轮文本到SQL的记忆架构:基准测试与实证研究

Ravi Kumar Tummalapenta, Suman Addanki

机构 * LLM Suite Engineering Team, JP Morgan Chase & Co.(JP摩根大通公司LLM套件工程团队)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 针对多轮Text-to-SQL任务,提出EnterpriseMem-Bench基准并评估五种前沿模型,发现无状态方法在第三轮后执行准确率归零,且记忆架构复杂度并不单调提升准确率。

Comments 18 pages, 4 figures, 14 tables; includes appendices with verbatim prompts, example session, and full ablation tables; prepared by the LLM Suite Engineering Team, JP Morgan Chase & Co

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22834 2026-05-27 cs.CL cs.IR 57%

Query-Adaptive Semantic Chunking for Retrieval-Augmented Generation: A Dynamic Strategy with Contextual Window Expansion

查询自适应语义分块用于检索增强生成:一种具有上下文窗口扩展的动态策略

Mudit Rastogi

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :agentic(abstract);分类 cs.CL

AI总结 提出查询自适应语义分块(QASC)方法,通过将查询融入分块过程,利用句子-查询嵌入余弦相似度、上下文窗口扩展和分块级分数聚合,动态构建相关且连贯的文档块,在F1分数上比固定分块提升18-27%,比语义和智能体分块提升8-12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27146 2026-05-27 cs.CL 57%

Learning to Predict Future-Aligned Research Proposals with Language Models

学习用语言模型预测未来对齐的研究提案

Heng Wang, Pengcheng Jiang, Jiashuo Sun, Zhiyi Shi, Haofei Yu, Jiawei Han, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出将研究提案生成重构为时间切片科学预测问题,通过未来对齐分数(FAS)评估模型能否预测截止时间后发表的论文方向,并构建时间一致数据集和推理轨迹进行训练,实验表明未来对齐微调显著提升提案质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11790 2026-05-27 cs.LG 57%

Disentangled Representation Learning through Unsupervised Symmetry Group Discovery

通过无监督对称群发现实现解缠表示学习

Barthélémy Dang-Nhu, Louis Annabi, Sylvain Argentieri

机构 * Sorbonne Université, CNRS, Institut des Systèmes Intelligents et de Robotique, ISIR(索邦大学,国家科学研究中心,智能系统与机器人研究所,ISIR)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出一种具身智能体通过与环境的无监督交互自主发现动作空间的群结构的方法,证明了在最小假设下真实对称群分解的可识别性,并推导出两种算法以学习线性对称基解缠表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15787 2026-05-27 cs.CL cs.IR 57%

Interactive Agents: Simulating Counselor-Client Psychological Counseling via Role-Playing LLM-to-LLM Interactions

交互式智能体:通过角色扮演的LLM-LLM交互模拟咨询师-来访者心理咨询

Huachuan Qiu, Zhenzhong Lan

机构 * School of Engineering, Westlake University(西lake大学工程学院)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出Interactive Agents框架,通过LLM-LLM角色扮演生成高质量心理咨询对话数据,解决隐私、成本和扩展性问题,并验证其治疗有效性和模型性能。

Comments Accepted to *SEM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26948 2026-05-27 econ.TH 50%

Integrating Proportionality and Egalitarianism in Claims Problems

整合比例性与平等主义:索赔问题中的分配规则

Anisha Bandyopadhyay, Sinan Ertemel, Rajnish Kumar, Saptarshi Mukherjee

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出P-CEA妥协规则族,通过基线参数在比例规则与约束平等奖励规则之间插值,并基于无优势再分配和可持续下界两个阈值依赖原则进行公理化刻画。

Comments JEL Classifications: C71; D63; D61; H23. Keywords: Claims problem; Fair division; Resource allocation; Compromise rules; Proportionality; Constrained equal awards; Axiomatic foundations; Inequality measures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24750 2026-05-27 cs.GT 50%

Facility Location Mechanism Design: Breaking The Deterministic Barrier

设施选址机制设计:突破确定性障碍

Zohar Barak

专题命中 Agent评测 :agent(abstract)

AI总结 针对欧几里得空间中最小化社会成本的设施选址问题,提出随机策略证明机制RR-CWM,在R²上达到4/π≈1.27的期望近似比,突破确定性机制的下界,并扩展至学习增强场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26604 2026-05-27 cs.GT cs.DC cs.NI econ.TH 50%

Credibility Trilemma in Polymatroidal Service Markets

多拟阵服务市场中的可信度三难困境

Lauri Lovén, Sujit Gujar, Kalle Timperi, Hassan Mehmood, Praveen Kumar Donta, Sasu Tarkoma, Schahram Dustdar

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究多拟阵服务市场中市场运营者的策略行为,证明在非模多拟阵上不存在同时满足收益最优、激励兼容和可信的静态密封投标机制,并引入不可信成本度量该困境的福利损失。

Comments 75 pages, 3 figures. Prepared for submission to the ACM Transactions on Economics and Computation (TEAC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26367 2026-05-27 econ.TH 50%

Random Matching with Minimums

具有最小值的随机匹配

Will Sandholtz, Andrew Tai

专题命中 Agent评测 :agent(abstract)

AI总结 针对具有最小和最大需求的对象随机分配问题(如课程上下限选课),提出最小概率序列机制(MPS),推广了Bogomolnaia和Moulin(2001)的概率序列机制,并证明其帕累托有效、无嫉妒和弱防策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04993 2026-05-27 cs.GT 50%

On the Coordination of Value-Maximizing Bidders

关于价值最大化投标者的协调问题

Yanru Guan, Jiahao Zhang, Zhe Feng, Tao Lin

专题命中 Agent评测 :agent(abstract)

AI总结 研究在线广告平台中多个自动投标者的协调问题,提出仅最高价值投标者与外部投标者竞争、其他协调投标者不参与的协调机制,证明该机制优于独立投标,能提高支出回报合规性和总价值。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14519 2026-05-27 math.OC 50%

On the optimal portfolio problem with partial information and related mean field games with relative performance criteria

部分信息下的最优投资组合问题及具有相对绩效准则的均值场博弈

Panagiotis Souganidis, Thaleia Zariphopoulou

专题命中 Agent评测 :agent(abstract)

AI总结 研究股票漂移部分信息下的最优投资组合选择,通过新方法求解单代理问题并推广到N人博弈的均值场极限,得到显式解和正则性结果。

Comments 48 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17071 2026-05-27 cond-mat.mtrl-sci 50%

Medium-Throughput Evaluation of Quantum Geometry-Driven Topological Transports in Altermagnets

中等通量评估交变磁体中量子几何驱动的拓扑输运

Fu Li, Bo Zhao, Vikrant Chaudhary, Shengqiao Wang, Chen Shen, Hao Wang, Hongbin Zhang

专题命中 Agent评测 :workflow(abstract)

AI总结 通过中等通量第一性原理工作流,评估MAGNDATA数据库中135种交变磁体的量子几何拓扑输运性质,包括反常霍尔效应、磁光克尔效应和体光伏效应,并建立对称性引导的计算路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20246 2026-05-27 math.OC 50%

Convergence Analysis of Noisy Distributed Gradient Descent for Non-convex Optimization -- Saddle Point Escape

非凸优化中带噪分布式梯度下降的收敛性分析——鞍点逃逸

Lei Qin, Michael Cantoni, Ye Pu

专题命中 Agent评测 :agent(abstract)

AI总结 研究基于共识的分布式梯度下降变体,通过随机扰动局部梯度项使每个智能体以高概率收敛到公共二阶驻点(局部极小点)的邻域,收敛速率与集中式一阶算法相当。

详情

展开后加载摘要…

URL PDF HTML 收藏