arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-21 至 2026-05-21 共收录 161 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 2 篇

2605.21082 2026-05-21 cs.AI 57%

AutoRPA: Efficient GUI Automation through LLM-Driven Code Synthesis from Interactions

AutoRPA: 通过基于LLM的代码合成实现高效的GUI自动化

Minghao Chen, Xinyi Hu, Zhou Yu, Yufei Yin

机构 * Zhejiang Key Laboratory of Space Information Sensing and Transmission(浙江空间信息感知与传输重点实验室) School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机科学学院)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出AutoRPA框架,通过将ReAct风格代理的决策逻辑自动转化为鲁棒的RPA功能,提高GUI自动化效率和可重用性,同时减少82%到96%的token使用量。

Comments Accepted in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 记忆与上下文管理 13 篇

2605.20189 2026-05-21 cs.AI cs.LG 88%

SOLAR: A Self-Optimizing Open-Ended Autonomous Agent for Lifelong Learning and Continual Adaptation

SOLAR:一种自优化的开放式自主代理,用于终身学习和持续适应

Nitin Vetcha, Dianbo Liu

机构 * Department of Ophthalmology, Yong Loo Lin School of Medicine, National University of Singapore, Singapore(眼科学系,Yong Loo Lin医学院,新加坡国立大学,新加坡) Department of Computational and Data Sciences, Indian Institute of Science, Bangalore, Karnataka, India(计算与数据科学系,印度科学研究院,班加罗尔,卡纳塔克邦,印度)

专题命中 记忆与上下文管理 :agent(title,abstract);autonomous agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出SOLAR,一种自优化的开放式自主代理,通过参数级元学习实现自我改进,解决了动态真实世界中概念漂移和梯度基适应成本高的问题,展示了在常识、数学、医学、编程、社交和逻辑推理任务上的优越性能。

Comments Accepted at "Association for the Advancement of Artificial Intelligence 2026 Conference" in Streaming Continual Learning Bridge. Published in CEUR Workshop Proceedings (Original version at https://ceur-ws.org/Vol-4183/paper2.pdf)

Journal ref CEUR Workshop Proceedings, Vol. 4183, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19320 2026-05-21 cs.CL cs.AI 81%

Anatomy of Agentic Memory: Taxonomy and Empirical Analysis of Evaluation and System Limitations

代理记忆的解剖结构:评估和系统限制的分类与实证分析

Dongming Jiang, Yi Li, Songtao Wei, Jinxin Yang, Ayushi Kishore, Alysa Zhao, Dingyi Kang, Xu Hu, Feng Chen, Qiannan Li, Bingzhe Li

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) University of California Davis(加州大学戴维斯分校) Texas A&M University(德克萨斯农工大学)

专题命中 记忆与上下文管理 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 本文通过分类和实证分析,探讨了代理记忆系统的架构和系统限制,揭示了现有系统在基准饱和效应、指标有效性、模型依赖性和内存维护开销等方面的问题,并提出了更可靠的评估方法和可扩展的系统设计方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21463 2026-05-21 cs.CL cs.AI 79%

Mem-$π$: Adaptive Memory through Learning When and What to Generate

Mem-$π$: 通过学习何时以及生成什么来实现自适应记忆

Xiaoqiang Wang, Chao Wang, Hadi Nekoei, Christopher Pal, Alexandre Lacoste, Spandana Gella, Bang Liu, Perouz Taslakian

机构 * ServiceNow AI Research(ServiceNow AI研究院) Mila -- Quebec AI Institute(魁北克AI研究所) McGill University(麦吉尔大学) CIFAR AI Chair(CIFAR人工智能主席)

专题命中 记忆与上下文管理 :agent(abstract);tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 Mem-$π$ 通过学习在何时以及生成什么来实现自适应记忆,利用专门的语言或视觉-语言模型生成上下文特定的指导,从而在多种代理任务中优于基于检索和先前RL优化的记忆基线。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20616 2026-05-21 cs.CL 70%

Auto-Dreamer: Learning Offline Memory Consolidation for Language Agents

Auto-Dreamer:学习离线记忆巩固用于语言智能体

Chongrui Ye, Yuxiang Liu, Yu Wang, Haofei Yu, Yining Zhao, Ge Liu, Julian McAuley, Jiaxuan You

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California San Diego(加州大学圣地亚哥分校)

专题命中 记忆与上下文管理 :agent(abstract);tool-use(abstract);分类 cs.CL

AI总结 本文提出Auto-Dreamer,一种学习离线记忆巩固方法,用于语言智能体,通过分离快速会话记忆获取与慢速跨会话巩固过程,提升智能体在多个任务流中的记忆整合与知识复用能力。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20906 2026-05-21 cs.OS 67%

ParaCell: Paravirtualized Secure Containers with Lightweight Intra-Container Isolation and Intent-Driven Memory Management

ParaCell: 基于轻量级容器内隔离和意图驱动内存管理的虚拟化安全容器

Yiyang Wu, Xunjie Wang, Jinyu Gu, Haibo Chen

专题命中 记忆与上下文管理 :agent(abstract);agentic(abstract)

AI总结 ParaCell通过引入轻量级容器内隔离和意图驱动内存管理,解决了传统容器系统中隔离与性能之间的根本性权衡问题,提升了容器运行效率和内存弹性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20668 2026-05-21 cs.CL cs.AI cs.LG 67%

On the limits and opportunities of AI reviewers: Reviewing the reviews of Nature-family papers with 45 expert scientists

人工智能审稿人的局限与机遇:对Nature系列论文审稿的45位专家科学家的审查

Seungone Kim, Dongkeun Yoon, Kiril Gashteovski, Juyoung Suk, Jinheon Baek, Pranjal Aggarwal, Ian Wu, Viktor Zaverkin, Spase Petkoski, Daniel R. Schrider, Ilija Dukovski, Francesco Santini, Biljana Mitreska, Yong Jeong, Kyeongha Kwon, Young Min Sim, Dragana Manasova, Arthur Porto, Biljana Mojsoska, Makoto Takamoto, Marko Shuntov, Ruoqi Liu, Hyunjoo Jenny Lee, Niyazi Ulas Dinç, Yehhyun Jo, Sunkyu Han, Chungwoo Lee, Huishan Li, Esther H. R. Tsai, Ergun Simsek, Khushboo Shafi, Yeonseung Chung, Jihye Park, Aleksandar Shulevski, Henrik Christiansen, Yoosang Son, Elly Knight, Amanda Montoya, Jeongyoun Ahn, Christian Langkammer, Heera Moon, Changwon Yoon, Nikola Stikov, Mooseok Jang, Edward Choi, Junhan Kim, Yeon Sik Jung, Woo Youn Kim, Jae Kyoung Kim, Ishraq Md Anjum, Hyun Uk Kim, Drew Bridges, Carolin Lawrence, Xiang Yue, Alice Oh, Akari Asai, Sean Welleck, Graham Neubig

机构 * Nature(自然)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文通过大规模专家标注研究,探讨了AI审稿人在科学同行评审中的能力与局限,发现AI审稿在准确性、显著性和证据充分性方面表现优异,但存在领域知识有限、上下文管理不足等弱点,表明AI审稿是人类审稿的补充而非替代。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21420 2026-05-21 cs.LG cs.AI q-bio.MN 62%

HiRes: Inspectable Precedent Memory for Reaction Condition Recommendation

HiRes: 反应条件推荐的可检查先例记忆

Shreyas Vinaya Sathyanarayana, Raja Sekhar Pappala, Deepak Warrier

机构 * Mstack AI

专题命中 记忆与上下文管理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 HiRes通过结合图编码器、变换感知交叉注意力、多流反应融合和k-NN检索层,实现了反应条件推荐的高准确率和可解释性,其在催化剂、溶剂和试剂的Top-1准确率分别达到0.929、0.534和0.530,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20706 2026-05-21 cs.DC cs.AI cs.LG 62%

Llamas on the Web: Memory-Efficient, Performance-Portable, and Multi-Precision LLM Inference with WebGPU

网络上的Llamas:基于WebGPU的内存高效、性能可移植和多精度LLM推理

Reese Levine, Rithik Sharma, Nikhil Jain, Abhijit Ramesh, Zheyuan Chen, Neha Abbas, James Contini, Tyler Sorensen

机构 * Microsoft Research(微软研究院) UC Santa Cruz(加州大学圣克鲁兹分校)

专题命中 记忆与上下文管理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LlamaWeb,一种基于WebGPU的LLM推理框架,通过静态内存规划和高效模型加载减少内存开销,支持多种模型权重格式,实现了内存高效、性能可移植的LLM推理。

Comments 19 pages, 11 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20272 2026-05-21 cs.LG cs.AI 62%

Smaller Abstract State Spaces Enable Cross-Scale Generalization in Reinforcement Learning

更小的抽象状态空间在强化学习中实现跨尺度泛化

Nasehatul Mustakim, Lucas Lehnert

机构 * Department of Computer Science(计算机科学系) University of Saskatchewan(萨斯喀彻温大学) Saskatoon, Saskatchewan, Canada(加拿大萨斯喀彻温省萨斯喀彻温市)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种理论模型,通过扩展POMDP中的状态抽象框架,定义了 successor-weighted model reduction,从而在强化学习代理中实现跨尺度泛化,并分析了抽象状态空间大小对泛化能力的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20979 2026-05-21 physics.soc-ph cond-mat.stat-mech 50%

Equilibrium and dynamics of a three-state opinion model on a network of networks

网络中的网络上三状态意见模型的平衡与动态

Irene Ferri, Albert Díaz-Guilera, Hiroki Sayama

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文研究了在由网络组成的网络上的一种三状态意见模型,探讨了个体内部相互关联的信念如何影响集体结果,通过分析方法和蒙特卡洛模拟发现,随着星型代理内部信念的增加,极化共识崩溃的临界温度增加,而在环形和聚类状内部拓扑中趋于饱和。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20760 2026-05-21 cs.CV 50%

SpineContextResUNet: A Computationally Efficient Residual UNet for Spine CT Segmentation

SpineContextResUNet: 一种计算高效的残差U-Net用于脊柱CT分割

K S Nithurshen, Saurabh J. Shigwan

机构 * Shiv Nadar University(施瓦德纳大学)

专题命中 记忆与上下文管理 :planning(abstract)

AI总结 本文提出SpineContextResUNet,一种高效的3D残差U-Net,用于快速脊柱定位,通过轻量级的上下文块在不牺牲性能的情况下减少了计算资源需求,适用于资源受限环境。

Comments 2 Figures, 3 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20724 2026-05-21 cs.IR 50%

CALMem : Application-Layer Dual Memory for Conversational AI

CALMem : 会话AI的应用层双记忆

Rajendra Narayan Jena, Rajan Padmanabhan, Sankar Arumugam

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 针对大型语言模型固定上下文窗口限制会话连续性的问题,CALMem提出了一种应用层双记忆架构,通过结合事件记忆层和语义记忆层,实现无限制的有效上下文容量,无需修改底层模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20223 2026-05-21 cs.CV 50%

Why Latent Actions Fail, and How to Prevent It

为何潜在动作失效,以及如何防止它

Jung Min Lee, Taehyun Cho, Li Zhao, Jungwoo Lee

机构 * Seoul National University(首尔国立大学) Microsoft Research(微软研究院)

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文研究了潜在动作模型中外部状态对动作学习的干扰问题,并提出通过聚焦内生成分来缓解噪声干扰的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. Agent评测 26 篇

2605.20742 2026-05-21 cs.AI 90%

VBFDD-Agent for Electric Vehicle Battery Fault Detection and Diagnosis: Descriptive Text Modeling of Battery Digital Signals

VBFDD-Agent 用于电动汽车电池故障检测与诊断:电池数字信号的描述性文本建模

Joey Chan, Zhen Chen, Ershun Pan

机构 * Department of Industrial Engineering and Management, School of Mechanical Engineering, Shanghai Jiao Tong University, Shanghai 200240, China(工业工程与管理系,机械工程学院,上海交通大学,上海200240,中国)

专题命中 Agent评测 :agent(title,title_cn);分类 cs.AI

AI总结 本研究提出了一种基于描述性文本建模的电池信号报告方法,用于解决开放源代码电池故障报告数据集稀缺和缺乏统一维护知识表示的问题,通过构建语言语料库来改进电池健康诊断和维护,提出了VBFDD-Agent,整合了描述性电池状态文本、历史案例检索、本地维护手册和大语言模型推理,生成结构化的诊断结果和维护建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01712 2026-05-21 cs.AI cs.LG 85%

FT-Dojo: Towards Autonomous LLM Fine-Tuning with Language Agents

FT-Dojo: 向自主LLM微调迈进的语言代理

Qizheng Li, Yifei Zhang, Xiao Yang, Xu Yang, Zhuo Wang, Weiqing Liu, Jiang Bian

机构 * Peking University(北京大学) Nanjing University(南京大学) Microsoft Research Asia(微软亚洲研究院) The University of Chicago(芝加哥大学)

专题命中 Agent评测 :agent(summary_cn,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FT-Dojo交互式基准环境,用于研究自主LLM微调,通过标准化任务接口、共享数据仓库、沙盒执行环境和反馈协议,开发了FT-Agent框架,实现了结构化迭代规划和多级反馈分析,实验显示FT-Agent在13个任务中表现优异,且展示了代理在故障恢复和长期规划中的能力。

Comments 26 pages, 6 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18991 2026-05-21 cs.CR cs.AI 83%

Agent Security is a Systems Problem

智能体安全是系统问题

Mihai Christodorescu, Earlence Fernandes, Ashish Hooda, Somesh Jha, Johann Rehberger, Kamalika Chaudhuri, Xiaohan Fu, Khawaja Shams, Guy Amir, Jihye Choi, Sarthak Choudhary, Nils Palumbo, Andrey Labunets, Nishit V. Pandya

机构 * Google(谷歌) University of California San Diego(加州大学圣地亚哥分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) EmbraceTheRed Gray Swan AI Cornell University(康奈尔大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出智能体安全应作为系统问题来解决,强调通过系统层面的安全不变量来保障AI模型的安全性,而非仅仅依赖模型鲁棒性。文章基于系统安全领域的技术,提出了设计可预测安全保证的智能体系统的核心原则,并分析了实际攻击案例和实现这些原则面临的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21404 2026-05-21 cs.LG 80%

What Twelve LLM Agent Benchmark Papers Disclose About Themselves: A Pilot Audit and an Open Scoring Schema

十二篇LLM代理基准测试论文披露了什么:一项初步审计和开放评分方案

Mahdi Naser Moghadasi, Faezeh Ghaderi

机构 * Research Division, BrightMind AI(BrightMind AI研究部) Texas Tech University(德克萨斯理工大学) University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 本文通过分析十二篇知名LLM代理基准测试论文,揭示了这些论文在评估方法披露方面的不足,设计了一种开放评分方案以提高透明度和可重复性。

Comments Pilot audit of 12 LLM agent benchmark papers; schema, codebook, and per-paper scoring sheet released. Submission to IEEE Big Data 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19362 2026-05-21 cs.HC cs.AI 80%

Toward User Comprehension Supports for LLM Agent Skill Specifications

向LLM代理技能规范提供用户理解支持

Zikai Alex Wen

机构 * University of Washington, Tacoma School of Engineering \& Technology Tacoma, Washington, USA University of Washington, Tacoma School of Engineering \& Technology

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 研究探讨了技能规范是否有助于用户形成对技能消耗、产生和覆盖范围的有限预期,并通过分析878个网络安全技能的文本线索,发现仅少数规范包含必要的提示,强调应将规范视为面向用户的能劾示范而非仅执行指令的容器。

Comments To appear at ACM CAIS Workshop Agent Skill 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20204 2026-05-21 cs.HC cs.AI 79%

RealUserSim: Bridging the Reality Gap in Agent Benchmarking via Grounded User Simulation

RealUserSim: 通过基于现实的用户模拟弥合代理评估中的现实差距

Ming Zhu, Juntao Tan, Rithesh Murthy, Jielin Qiu, Liangwei Yang, Wenting Zhao, Silvio Savarese, Shelby Heinecke, Huan Wang

机构 * Salesforce AI Research(Salesforce AI研究院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出RealUserSim,一种基于真实行为数据的用户模拟框架,通过提取大量真实人类与LLM对话数据,提升模拟用户与真实人类的匹配率,从而改进代理评估的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20744 2026-05-21 cs.LG cs.AI 73%

Hack-Verifiable Environments: Towards Evaluating Reward Hacking at Scale

可验证的环境:面向大规模评估奖励黑客的尝试

Amit Roth, Ankur Samanta, Matan Halevy, Yoav Levine, Yonathan Efroni

机构 * Tel Aviv University(特拉维夫大学) Columbia University(哥伦比亚大学) Taso Labs(Taso实验室)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种新的评估方法来衡量奖励黑客,通过在环境中嵌入可检测的奖励黑客机会,使评估更加可靠和自动化,通过TextArena测试床分析了不同语言模型在多样化环境中的奖励黑客行为。

Comments Project Page - https://majoroth.github.io/hack-verifiable-environments/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16217 2026-05-21 cs.CL cs.AI cs.IR 73%

Argus: Evidence Assembly for Scalable Deep Research Agents

Argus:可扩展深度研究代理的证据组装

Zhen Zhang, Liangcai Su, Zhuo Chen, Xiang Lin, Haotian Xu, Simon Shaolei Du, Kaiyu Yang, Bo An, Lidong Bing, Xinyu Wang

机构 * MiroMind AI

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 Argus通过将深度研究视为拼图碎片的组装过程,而非并行暴力求解整个答案,提高了大规模信息检索任务的效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08023 2026-05-21 cs.CR cs.AI cs.MA 70%

CTFExplorer: Evaluating LLM Offensive Agents Through Multi-Target Web CTF Benchmarking

CTFExplorer: 通过多目标网络CTF基准测试评估LLM进攻性代理

Nanda Rani, Kimberly Milner, Minghao Shao, Meet Udeshi, Haoran Xi, Venkata Sai Charan Putrevu, Saksham Aggarwal, Sandeep K. Shukla, Prashanth Krishnamurthy, Farshad Khorrami, Muhammad Shafique, Ramesh Karri

机构 * CISPA - Helmholtz Center for Information Security(CISPA-海德堡信息安全研究中心) NYU Tandon School of Engineering(纽约大学坦顿工程学院) NYU Abu Dhabi(纽约大学阿布扎克分校) IIIT Hyderabad(海得拉巴印度理工学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出CTFExplorer基准测试,通过多目标网络CTF基准测试评估LLM进攻性代理,研究问题是如何在不确定环境下评估代理的战术推理能力,核心方法是引入多目标环境测试代理的探索、优先级和攻击链能力,主要贡献是开发了可评估代理行为的框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20729 2026-05-21 cs.CL 70%

MTR-Suite: A Framework for Evaluating and Synthesizing Conversational Retrieval Benchmarks

MTR-Suite: 一个用于评估和合成对话检索基准的框架

Junhao Ruan, Abudukeyumu Abudula, Bei Li, Yongjing Yin, Xinyu Liu, Kechen Jiao, Xin Chen, Jingang Wang, Xunliang Cai, Tong Xiao, Jingbo Zhu

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Meituan Inc.(美团公司) NiuTrans Research(牛译研所) Tsinghua University(清华大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文提出MTR-Suite框架,通过LLM审计、多智能体系统生成和通用领域基准,解决对话检索基准评估和合成中的成本高、标注稀疏和自动化方法僵化的问题。

Comments Accepted to ACL 2026 (main conference). 28 pages. Code and data: https://github.com/rangehow/mtr-suite

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20520 2026-05-21 cs.AI 70%

Open-World Evaluations for Measuring Frontier AI Capabilities

面向前沿AI能力的开放世界评估

Sayash Kapoor, Peter Kirgis, Andrew Schwartz, Stephan Rabanser, J. J. Allaire, Rishi Bommasani, Harry Coppock, Magda Dubois, Gillian K Hadfield, Andrew B. Hall, Sara Hooker, Seth Lazar, Steve Newman, Dimitris Papailiopoulos, Shoshannah Tekofsky, Helen Toner, Cozmin Ududec, Arvind Narayanan

机构 * Princeton University(普林斯顿大学) Cornflower Labs(Cornflower实验室) Meridian Labs(Meridian实验室) Stanford University(斯坦福大学) UK AI Security Institute(英国人工智能安全研究所) Johns Hopkins University(约翰霍普金斯大学) Adaption Labs(Adaption实验室) Australian National University(澳大利亚国立大学) Golden Gate Institute for AI(金门人工智能研究所) UW Madison(威斯康星大学麦迪逊分校) Microsoft Research(微软研究院) AI Digest(AI摘要) Georgetown University (CSET)(乔治城大学(CSET))

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出开放世界评估作为一种补充方法,通过小样本定性分析来评估长期、复杂、现实世界任务,以更准确地衡量AI能力,并介绍了CRUX项目作为定期进行此类评估的尝试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20911 2026-05-21 cs.AI cs.LG 62%

For How Long Should We Be Punching? Learning Action Duration in Fighting Games

我们应该持续打击多久?在格斗游戏中学习动作持续时间

Hoang Hai Nguyen, Kurt Driessens, Dennis J. N. J. Soemers

机构 * Department of Advanced Computing Sciences, Maastricht University(马斯特里赫特大学高级计算科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在格斗游戏中如何通过学习动作持续时间来提高强化学习代理的决策能力,探讨了动态调整反应时间的方法及其对性能和行为模式的影响。

Comments Accepted at Computers and Games 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20767 2026-05-21 cs.CL cs.LG stat.ME 62%

The Illusion of Intervention: Your LLM-Simulated Experiment is an Observational Study

干预的幻觉:你的LLM模拟实验实际上是一个观察性研究

Victoria Lin, Taedong Yun, Maja Matarić, John Canny, Arthur Gretton, Alexander D'Amour

机构 * Google DeepMind(谷歌DeepMind) Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了大型语言模型在模拟人类行为中的潜在作用,指出在LLM模拟的合成用户中进行干预可能引起潜在用户属性的意外变化,从而导致用户漂移,影响效果估计。本文提出了使用负对照结果来检测分布变化的方法,并通过调整角色描述以减少偏倚来缓解漂移问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14654 2026-05-21 cs.CV cs.AI cs.CL 62%

Beyond Words: Multimodal LLM Knows When to Speak

超越词语:多模态大语言模型何时说话

Zikai Liao, Yi Ouyang, Yi-Lun Lee, Chen-Ping Yu, Yi-Hsuan Tsai, Zhaozheng Yin

机构 * Department of Computer Science, Stony Brook University(石溪大学计算机科学系) Atmee AI

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出了一种多模态策略,通过同步视频、音频和文本线索提高对话中的响应时机意识,从而提升大语言模型在对话中的响应准确性。

Comments Project page: https://github.com/lzk901372/MM-When2Speak

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21482 2026-05-21 cs.AI 57%

DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation

DeepWeb-Bench: 一个要求大规模跨源证据和长周期推导的深度研究基准

Sixiong Xie, Zhuofan Shi, Haiyang Shen, Jiuzheng Wang, Siqi Zhong, Mugeng Liu, Chongyang Pan, Peilun Jia, Baoqing Sun, Xiang Jing, Yun Ma

机构 * Peking University(北京大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出DeepWeb-Bench基准,通过要求大规模证据收集、跨源验证和长周期推导,评估前沿语言模型在深度研究任务中的能力,揭示检索并非瓶颈,强弱模型失败方式不同,且模型在不同领域表现出专业性。

Comments Work in Progress. 27 pages, 10 figures, 4 tables. Project page: https://sixiongxie1001-dot.github.io/deep-research-benchmark2.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20609 2026-05-21 cs.LG 57%

Compositional Transduction with Latent Analogies for Offline Goal-Conditioned Reinforcement Learning

基于潜在类比的组合转导用于离线目标条件强化学习

Junseok Kim, Dohyeong Kim, Mineui Hong, Songhwai Oh

机构 * Department of Electrical and Computer Engineering and ASRI, Seoul National University(电气与计算机工程系和首尔国立大学ASRI) Independent researcher(独立研究者) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种基于潜在类比的组合转导方法,用于解决离线目标条件强化学习中面对新情境时的目标泛化问题,通过引入新的类比表示方法,提升了在不同情境下的目标达到能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏