arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-21 至 2026-05-21 共收录 161 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 26 篇

2604.24697 2026-05-21 cs.AI 57%

Can Current Agents Close the Discovery-to-Application Gap? A Case Study in Minecraft

当前智能体能否缩小发现到应用的差距?Minecraft中的一个案例研究

Zhou Ziheng, Huacong Tang, Jinyuan Zhang, Haowei Lin, Bangcheng Yang, Qian Long, Fang Sun, Yizhou Sun, Yitao Liang, Ying Nian Wu, Demetri Terzopoulos, Xiaofeng Gao

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Peking University(北京大学) Amazon(亚马逊)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文通过Minecraft中的SciCrafter基准测试,探讨了智能体在发现因果规律并将其应用于构建功能系统(发现-应用循环)方面的能力,发现前沿模型在该任务中的成功率约为26%,揭示了知识识别和问题提出能力成为当前AI的瓶颈。

Comments Preprint, under review. 41 pages. Project page: https://scicrafter-bench.github.io/. Code: https://github.com/scicrafter-bench/scicraft-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27747 2026-05-21 cs.CV cs.AI 57%

AI-Powered Facial Mask Removal Is Not Suitable For Identification

基于AI的面部遮挡去除并不适合识别

Emily A Cooper, Hany Farid

机构 * Herbert Wertheim School of Optometry & Vision Science University of California, Berkeley(赫伯特·韦瑟姆视觉科学学院,加州大学伯克利分校) School of Information University of California, Berkeley(信息学院,加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文研究了基于AI的面部遮挡去除技术的有效性和风险,探讨其在真实身份匹配中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20510 2026-05-21 cs.CV cs.AI cs.CY 57%

ShadeBench: A Benchmark Dataset for Building Shade Simulation in Sustainable Society

ShadeBench: 一个用于可持续社会建筑阴影模拟的基准数据集

Longchao Da, Mithun Shivakoti, Xiangrui Liu, T Pranav Kutralingam, Yezhou Yang, Hua Wei

机构 * School of Computing and Augmented Intelligence, Arizona State University(计算与增强智能学院,亚利桑那州立大学) Global Futures Laboratory, Arizona State University(全球未来实验室,亚利桑那州立大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本文提出ShadeBench,一个用于城市阴影理解的综合数据集和基准,通过多模态数据支持阴影生成、分割和3D建筑重建,并提供标准化评估协议和基线方法,为数据驱动的城市气候研究和热适应城市规划提供基础。

Comments 12 pages, 13 figures, 2 tables. Accepted by KDD 2026 AI for Sciences Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20423 2026-05-21 cs.AI 57%

OSCToM: RL-Guided Adversarial Generation for High-Order Theory of Mind

OSCToM: 用于高阶理论之心的强化学习引导对抗生成

Sharmin Sultana Srishty, Kazi Mahathir Rahman, Malaika Parizat Sakkhi, Samia Shahid Prianna, Shaikhul Islam Sinat

机构 * Department of Computer Science(计算机科学系) BRAC University(布拉克大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出OSCToM,一种结合强化学习、领域特定语言和组合替代模型的方法,用于建模LLM中的嵌套信念冲突,通过生成观察者-自我冲突来提升复杂社会场景下的理论之心推理能力。

Comments 15 pages, 12 figures containing 15 images, 3 tables. Code available at https://github.com/sharminsrishty/osct

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20200 2026-05-21 cs.HC cs.AI 57%

Evaluating multimodal emotion recognition in proactive conversational agents: A user study

评估主动对话代理中的多模态情绪识别:一项用户研究

Adnana Dragut, Raquel Lacuesta, F. Xavier Gaya-Morey, Jose M. Buades-Rubio

机构 * I3A (Institute of Engineering Research of Aragon)(阿拉贡工程研究院) Universidad de Zaragoza(萨拉戈塔大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文研究了多模态情绪识别在主动对话代理中的应用,通过用户研究验证了视觉和语言分析模块的有效性,发现语言分析比视觉线索更可靠,并探讨了SIAs在情绪引导中的潜力与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16359 2026-05-21 cs.SE 57%

LLM4Log: A Systematic Review of Large Language Model-based Log Analysis

LLM4Log: 大型语言模型基于日志分析的系统综述

Zeyang Ma, Jinqiu Yang, Tse-Hsun Chen

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 本文系统综述了基于大型语言模型的日志分析,涵盖从日志生成维护到解析结构化及下游任务如异常检测、故障预测、根本原因分析和日志摘要的全流程,总结了常见设计模式和评估实践,并指出可靠实际应用中的关键挑战和开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21448 2026-05-21 cs.GT 50%

A Note on EFX Inapproximability for Chores

关于 chores 的 EFX 近似性的一则注记

Vasilis Christoforidis

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了在无互补成本函数下 indivisible chores 的 EFX 分配近似性,证明了对于子模和子可加函数,不存在 α-EFX 分配,其中 1 ≤ α < 2^{1/3},并给出了子模成本下的更严格的下界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21111 2026-05-21 cs.RO cs.SY eess.SY 50%

Benchmarking Empirical and Learning-Based Approaches for Feedforward Steering Control in Autonomous Racing

为自动驾驶赛车中的前馈转向控制评估经验方法和学习方法

Georg Jank, Mattia Piccinini, Sebastian Wenk, Phillip Pitschi, Johannes Betz, Boris Lohmann

机构 * Chair of Automatic Control, Department of Engineering Physics and Computation, Technical University of Munich(慕尼黑技术大学自动控制系) Professorship of Autonomous Vehicle Systems (AVS), Department of Mobility Systems Engineering, Technical University of Munich(慕尼黑技术大学移动系统工程系自动驾驶车辆系统教授职位)

专题命中 Agent评测 :planning(abstract)

AI总结 本文通过系统评估两种学习方法和两种经验方法的前馈转向控制器,发现学习方法在开环评估中预测误差最小,但在闭环测试中路径跟踪性能和圈速并不优于所提出的方法,表明在完整轨迹规划和控制软件栈中评估前馈策略的必要性。

Comments 8 pages, 12 figures, Accepted to be published as part of the 2026 IEEE International Conference on Intelligent Transportation Systems (ITSC 2026), Naples, Italy, September 15-18, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21095 2026-05-21 cs.CY cs.CR 50%

Backchaining Loss of Control Mitigations from Mission-Specific Benchmarks in National Security

从国家安全部署中的任务特定基准中回溯控制丧失缓解措施

Matteo Pistillo, Samantha Faraone, Joshua Herman

专题命中 Agent评测 :agentic(abstract)

AI总结 本文提出了一种基于现有用例特定基准的实证方法,通过回溯AI系统在国家安全基准上犯错时所导致的控制丧失缓解措施,帮助部署者优先考虑安全措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05253 2026-05-21 cs.IR 50%

EnterpriseRAG-Bench: A RAG Benchmark for Company Internal Knowledge

EnterpriseRAG-Bench: 一个用于企业内部知识的RAG基准测试

Yuhong Sun, Joachim Rahmfeld, Chris Weaver, Weijia Chen, Roshan Desai, Wenxi Huang, Mark H. Butler

专题命中 Agent评测 :AI agent(abstract)

AI总结 本文提出EnterpriseRAG-Bench,一个包含50万文档和500个问题的基准测试,用于评估和比较基于检索增强生成(RAG)方法在企业内部知识处理中的性能。

Comments Code and dataset available at https://github.com/onyx-dot-app/EnterpriseRAG-Bench or https://huggingface.co/datasets/onyx-dot-app/EnterpriseRAG-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 1 篇

2507.11521 2026-05-21 physics.soc-ph cond-mat.stat-mech 50%

Opinion dynamics: Statistical physics and beyond

意见动力学:统计物理与更广泛的领域

Michele Starnini, Fabian Baumann, Tobias Galla, David Garcia, Gerardo Iñiguez, Márton Karsai, Jan Lorenz, Katarzyna Sznajd-Weron

专题命中 其他Agent :AI agent(abstract)

AI总结 本文综述了意见动力学的研究进展,探讨了意见演变的微观和宏观动力学,介绍了个体模型、分析工具以及新兴前沿,旨在为该领域提供理论基础和未来研究方向。

Comments Accepted by Reviews of Modern Physics

详情

展开后加载摘要…

URL PDF HTML 收藏