arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-05-28 至 2026-05-28 共收录 234 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. GUI与网页智能体 9 篇

2605.25010 2026-05-28 cs.RO cs.AI 57%

Performance Comparison of Classical and Neural Sampling Algorithms for Robotic Navigation

经典与神经采样算法在机器人导航中的性能比较

Hichem Cheriet, Badra Khellat Kihel, Samira Chouraqui

机构 * dept. of Economics Oran2 Mohamed BenAhmed University(经济系奥兰2莫哈梅德·本·阿赫迈德大学)

专题命中 GUI与网页智能体 :planning(abstract);分类 cs.AI

AI总结 本文在含凸凹障碍物的环境中比较了RRT*、Neural RRT*和Neural Informed RRT*三种算法,发现神经引导规划器能生成更短(最多14%)和更平滑(55-75%)的路径,其中Neural Informed RRT*综合性能最优。

Journal ref Presented at The 3rd Edition of National Conference on Applications of Artificial Intelligence A2I' 26. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27761 2026-05-28 cs.CV cs.SE 57%

AndroidDaily: A Verifiable Benchmark for Mobile GUI Agents on Real-World Closed-Source Applications

AndroidDaily: 面向真实世界闭源应用的可验证移动GUI智能体基准

Yifan Sui, Xin Huang, Hongbing Li, Fang Xu, Jiahe Lv, Haolong Yan, Yeqing Shen, Litao Liu, Zhimin Fan, Ziyang Meng, Jia Wang, Junbo Qi, Kaijun Tan, Zheng Ge, Xiangyu Zhang, Daxin Jiang, Osamu Yoshie

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) StepFun Waseda University(早稻田大学)

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.SE

AI总结 针对闭源应用无法获取内部状态导致自动验证困难的问题,提出AndroidDaily基准(350个日常任务)和GRADE评估器(基于可观察外部指南的三层系统),实现无需内部状态的可验证评估,最强模型成功率为62.0%。

Comments 11 pages, 6 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27725 2026-05-28 physics.flu-dyn cs.LG 57%

CFDTwin: An open-source GUI and Python toolkit for POD-NN surrogate modeling of ANSYS Fluent simulations

CFDTwin:用于ANSYS Fluent模拟的POD-NN代理建模的开源GUI和Python工具包

Daniel Curl, Han Hu

机构 * Department of Mechanical Engineering, University of Arkansas(阿肯色大学机械工程系)

专题命中 GUI与网页智能体 :workflow(abstract);分类 cs.LG

AI总结 本文介绍CFDTwin,一个开源Python包和桌面GUI,将参数采样、Fluent自动化、数据提取、降阶模型构建、神经网络训练、验证和预测封装为可重用工作流,用于ANSYS Fluent模拟的POD-NN代理建模。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05673 2026-05-28 cs.RO cs.AI 57%

Rectified Schrödinger Bridge Matching for Few-Step Visual Navigation

整流薛定谔桥匹配用于少步视觉导航

Wuyang Luan, Junhui Li, Weiguang Zhao, Wenjian Zhang, Tieru Wu, Rui Ma

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) College of Computer Science, Chongqing University(重庆大学计算机学院) Department of Computer Science, University of Liverpool(利物浦大学计算机科学系) Changchun GenY Technology Co., Ltd.(长春GenY科技有限公司)

专题命中 GUI与网页智能体 :autonomous agent(abstract);分类 cs.AI

AI总结 提出整流薛定谔桥匹配(RSBM)框架,利用速度场结构不变性和线性方差减少,在仅3步积分中实现高保真生成策略,满足具身AI低延迟需求。

Comments 18 pages, 7 figures, 10 tables. Code available at https://github.com/WuyangLuan/RSBM

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 记忆与上下文管理 13 篇

2605.28424 2026-05-28 cs.CL 85%

Skill0.5: Joint Skill Internalization and Utilization for Out-of-Distribution Generalization in Agentic Reinforcement Learning

Skill0.5:面向智能体强化学习中分布外泛化的联合技能内化与利用

Jiapeng Zhu, Jianxiang Yu, Yibo Zhao, Chengcheng Han, Qi Gu, Xunliang Cai, Xiang Li, Weining Qian

机构 * East China Normal University(华东师范大学) Meituan Longcat Team(美团Longcat团队)

专题命中 记忆与上下文管理 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.CL

AI总结 提出Skill0.5框架,通过区分通用技能内化与任务特定技能利用,结合动态难度感知路由器,在ALFWorld和WebShop上提升了分布内和分布外场景的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06025 2026-05-28 cs.CL cs.AI cs.LG 82%

Learning Query-Aware Budget-Tier Routing for Runtime Agent Memory

学习面向运行时智能体记忆的查询感知预算层级路由

Haozhen Zhang, Haodong Yue, Tao Feng, Quanyu Long, Jianzhu Bao, Bowen Jin, Weizhi Zhang, Xiao Li, Jiaxuan You, Chengwei Qin, Wenya Wang

机构 * Nanyang Technological University(南洋理工大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Illinois Chicago(伊利诺伊大学香槟分校) Tsinghua University(清华大学) Sun Yat-sen University(中山大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出 BudgetMem 框架,通过强化学习训练的轻量级路由器实现查询感知的预算层级路由,以在运行时平衡任务性能与记忆构建成本。

Comments Accepted by ICML 2026. Code is available at https://github.com/ViktorAxelsen/BudgetMem

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27760 2026-05-28 cs.AI 79%

SkillGrad: Optimizing Agent Skills Like Gradient Descent

SkillGrad: 像梯度下降一样优化智能体技能

Hanyu Wang, Yifan Lan, Bochuan Cao, Lu Lin, Jinghui Chen

机构 * College of Information Sciences and Technology(信息科学与技术学院) The Pennsylvania State University(宾夕法尼亚州立大学) University Park, PA, USA

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI

AI总结 提出SkillGrad框架,将技能包视为结构化参数,通过轨迹级损失、文本梯度诊断和动量记忆覆盖进行类梯度下降优化,在表格问答任务上平均提升6.7个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27690 2026-05-28 cs.CL cs.LG 73%

TRACES: Proactive Safety Auditing for Multi-Turn LLM Agents via Trajectory-State Modeling

TRACES: 通过轨迹状态建模实现多轮LLM智能体的主动安全审计

Jiaqian Li, Yanshu Li, Boxuan Zhang, Ruixiang Tang, Kuan-Hao Huang

机构 * Brown University(布朗大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Rutgers University(罗格斯大学) Texas A&M University(德克萨斯阿姆斯特朗大学)

专题命中 记忆与上下文管理 :agent(abstract);tool use(abstract);分类 cs.CL、cs.LG

AI总结 提出TRACES方法,通过观察LLM的隐藏表示学习前缀级轨迹风险状态,实现多轮工具使用环境下的主动安全审计,提升全轨迹安全预测和主动风险判别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28201 2026-05-28 cs.AI 70%

Plant, Persist, Trigger: Sleeper Attack on Large Language Model Agents

种植、持久化、触发:针对大语言模型智能体的潜伏攻击

Yongxiang Li, Moxin Li, Zhixin Ma, Fengbin Zhu, Dongrui Liu, Wenjie Wang, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Singapore Management University(新加坡管理学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 记忆与上下文管理 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出潜伏攻击(Sleeper Attack),即攻击者将对抗性内容注入智能体状态并持久化,在后续交互中被良性用户查询触发,导致有害行为;构建包含1896个实例的基准测试,实验表明当前最强LLM智能体仍易受此类攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28773 2026-05-28 cs.CL cs.AI cs.LG cs.MA cs.MM 67%

Rethinking Memory as Continuously Evolving Connectivity

重新思考记忆作为持续演化的连接性

Jizhan Fang, Buqiang Xu, Zhixian Wang, Haoliang Cao, Xinle Deng, Baohua Dong, Hangcheng Zhu, Ruohui Huang, Gang Yu, Ying Wei, Guozhou Zheng, Feiyu Xiong, Haofen Wang, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) MemTensor Tongji University(同济大学)

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出 FluxMem 框架,将记忆建模为异构图并通过三个阶段(初始连接形成、反馈驱动优化、长期巩固)动态演化拓扑结构,以解决现有记忆增强型 LLM 代理在动态环境中的脆弱性问题。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28046 2026-05-28 cs.AI cs.CL 62%

MemCog: From Memory-as-Tool to Memory-as-Cognition in Conversational Agents

MemCog: 从记忆即工具到记忆即认知的对话代理

Zihan Li, Xingyu Fan, Feifei Li, Wenhui Que

机构 * WeChat, Tencent Inc.(腾讯公司)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出MemCog系统,通过可导航记忆存储、跨维度导航接口和主动推理协议,将记忆访问融入推理过程,在被动问答和主动记忆触发基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27825 2026-05-28 cs.CR cs.LG 61%

MRMMIA: Membership Inference Attacks on Memory in Chat Agents

MRMMIA:聊天代理中记忆的成员推断攻击

Kai Chen, Yan Pang, Tianhao Wang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 记忆与上下文管理 :agent(abstract,comments);分类 cs.LG

AI总结 针对聊天代理记忆系统,提出一种利用多次召回探针的统一成员推断攻击方法MRMMIA,在黑盒、灰盒和白盒设置下均优于基线,揭示了代理中的隐私风险。

Comments This work investigates the MIA on chat agent memory

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28806 2026-05-28 cs.CV cs.CL cs.IR 57%

Personal Visual Memory from Explicit and Implicit Evidence

来自显式和隐式证据的个人视觉记忆

Viet Nguyen, Thao Nguyen, Vishal M. Patel, Yuheng Li

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Adobe Research(Adobe研究)

专题命中 记忆与上下文管理 :AI agent(abstract);分类 cs.CL

AI总结 本文提出个人视觉记忆基准和VisualMem混合架构,通过显式与隐式视觉证据增强AI代理的长期记忆,显著提升个性化任务性能。

Comments Project Page: https://viettmab.github.io/visualmem-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27403 2026-05-28 cs.CY cs.AI 57%

LLM-assisted sentiment analysis for integrated computational and qualitative mixed methods education research: A case study of students' written reflection assignments

LLM辅助情感分析在综合计算与定性混合方法教育研究中的应用:学生书面反思作业案例研究

Xiomara Gonzalez, Gabriella Coloyan Fleming, Andrew Katz, Maya Denton, Jessica Deters

机构 * Chandra Family Department of Electrical and Computer Engineering, University of Texas at Austin(德克萨斯大学奥斯汀分校电子与计算机工程系) Department of Engineering Education, Virginia Polytechnic Institute and State University(弗吉尼亚理工大学工程教育系) Gallogly College of Engineering, University of Oklahoma(俄克拉荷马大学加洛格利工程学院) Department of Mechanical and Materials Engineering, University of Nebraska-Lincoln(内布拉斯加大学林肯分校机械与材料工程系)

专题命中 记忆与上下文管理 :workflow(abstract);分类 cs.AI

AI总结 本研究通过纵向案例,利用LLM辅助情感分析结合统计检验与主题分析,探讨学生身份变量对留学期间语言交流情感的影响,发现海外生活经历是唯一显著变量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28097 2026-05-28 cs.RO 50%

ICAN-Deploy: Identity-Stable Canary Deployment for Safety-Critical Embodied Agents

ICAN-Deploy:面向安全关键具身智能体的身份稳定金丝雀部署

Xue Qin, Simin Luan, John See, Zeyd Boukhers, Cong Yang, Zhijun Li

机构 * Harbin Institute of Technology(哈尔滨工业大学) Heriot-Watt University, Malaysia Campus(赫瑞-沃德大学马来西亚分校) Fraunhofer Institute for Applied Information Technology(弗劳恩霍夫应用信息技术研究所) Soochow University(苏州大学)

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 提出ICAN-Deploy中间件,通过分离能力名称与版本,在安全关键具身智能体的金丝雀部署中保持身份哈希不变,避免重新认证。

Comments 14 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27419 2026-05-28 cs.MA cs.CY 50%

APS: Bias-Controlled Adaptive Prototype Simulation for Population-Scale LLM Agents

APS:面向群体规模LLM智能体的偏差控制自适应原型模拟

Quan Zheng, Yan Gao, Shaobin He, Haoxiang Guan, Yuanhe Tian, Jie Feng, Ming Wang, Shuxin Zheng, Zhen Liu

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 提出自适应原型模拟(APS)框架,通过原型响应、影子审计和尾部保护机制减少在线LLM调用,实现群体规模多轮模拟的高效近似,并在千万级智能体模拟中实现381倍加速且保持低分布差异。

Comments 32 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08412 2026-05-28 cs.GT econ.TH 50%

Non-Monetary Mechanism Design without Priors: Achieving Efficiency via Adaptive Costly Audits

无先验的非货币机制设计:通过自适应代价高昂审计实现效率

Yan Dai, Moise Blanchard, Patrick Jaillet

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 针对无货币转移且无先验信息的多轮资源分配问题,提出一种通过自适应代价高昂审计激励真实报告并实现社会福利遗憾O(K^2)的机制。

Comments A preliminary version was accepted to the 38th Annual Conference on Learning Theory (COLT 2025). This version includes two key extensions to imperfect audit models, thoroughly revised main body and technical sections, and a refined literature review to include costly state verification (CSV)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. Agent评测 32 篇

2605.27705 2026-05-28 cs.CR cs.MM 90%

AgenticVBench: Can AI Agents Complete Real-World Post-Production Tasks?

AgenticVBench: AI代理能否完成真实的后期制作任务?

Zongheng Cao, Yi Zheng, Rui Song, Xinyu Hu

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);tool use(abstract);tool-use(abstract)

AI总结 本文提出AgenticVBench基准,包含100个来自真实后期制作流程的代理任务,评估多模态AI代理的复合能力,发现最佳代理栈性能仅略超30%,远低于人类专家。

Comments 22 pages, 6 figures. Benchmark website: https://agenticvbench.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27428 2026-05-28 cs.LG 90%

$E^3$-Agent: An Executable and Evolving Agent for Resource Management of Edge Generative Inference

$E^3$-Agent: 一种用于边缘生成式推理资源管理的可执行且可演化智能体

Rui Bao, Yaping Sun, Zhiyong Chen, Feng Yang, Meixia Tao, Nan Li, Wenjun Zhang

机构 * Cooperative Medianet Innovation Center, Shanghai Jiao Tong University, Shanghai 200240, China(上海交通大学合作中位网创新中心,上海,中国) Department of Broadband Communication, Pengcheng Laboratory, Shenzhen 518000, China(鹏城实验室宽带通信部门,深圳,中国) China Mobile Research Institute, Beijing 100053, China(中国移动研究院,北京,中国)

专题命中 Agent评测 :agent(title,title_cn);分类 cs.LG

AI总结 针对边缘生成式推理中设备性能未知且时变的问题,提出一种可执行且可演化的智能体$E^3$-Agent,通过分离快速路径路由器和慢速路径大语言模型元控制器,实现在线学习与自适应资源管理,在动态场景下平均延迟降低65%-73%。

Comments 13 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28683 2026-05-28 cs.AI 85%

VeriTrip: A Verifiable Benchmark for Travel Planning Agents over Unstructured Web Corpora

VeriTrip: 面向非结构化网络语料的旅行规划智能体可验证基准

Yuting Xu, Jiayi Tian, Jian Liang, Xin Xiong, Hang Zhang, Mu Xu, Xiao-Yu Zhang

机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) School of Cyber Security, UCAS(中国科学技术大学网络安全学院) Amap, Alibaba Group(阿里巴巴集团阿地图) NLPR & MAIS, Institute of Automation, CAS(中国科学院自动化研究所神经信息处理实验室及机器智能研究所) School of Artificial Intelligence, UCAS(中国科学技术大学人工智能学院)

专题命中 Agent评测 :planning(title,abstract);agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 提出VeriTrip基准,通过多模态检索库和可验证知识库,评估智能体在非结构化网络语料中基于证据推理的旅行规划能力,揭示检索-推理权衡问题。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28371 2026-05-28 cs.AI cs.LG cs.SE 85%

From paper to benchmark: agentic, framework-based reproduction of under-specified methods in machine health intelligence

从论文到基准测试:基于智能体和框架的机器健康智能中欠规范方法复现

Raffael Theiler, Ludovico Comito, David Leko, Leandro Von Krannichfeldt, Lev Telyatnikov, Olga Fink

机构 * EPFL(苏黎世联邦理工学院)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 提出一种基于智能体和共享框架的方法,通过槽绑定接口将论文转化为可执行、可比较的基准测试实现,解决工业预测与健康管理中方法复现的困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12015 2026-05-28 cs.CR cs.AI cs.CL cs.LG cs.MA 85%

SkillSafetyBench: Evaluating Agent Safety under Skill-Facing Attack Surfaces

SkillSafetyBench:在技能面攻击表面下评估智能体安全性

Chang Jin, An Wang, Zeming Wei, Kai Wang, Biaojie Zeng, Qiaosheng Zhang, Chao Yang, Jingjing Qu, Xia Hu, Xingcheng Xu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) East China Normal University(华东师范大学)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 提出SkillSafetyBench基准,通过155个对抗案例评估大语言模型智能体在技能、本地工件和执行环境文件等非用户攻击下的安全失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27984 2026-05-28 cs.CL cs.AI 81%

KVoiceBench, KOpenAudioBench, and KMMAU: Agent-Driven Korean Speech Benchmarks for Evaluating SpeechLMs

KVoiceBench, KOpenAudioBench 和 KMMAU:用于评估语音语言模型的智能体驱动的韩语语音基准

Haechan Kim, Seungjun Chung, Inkyu Park, Jihoo Lee, Jonghyun Lee

机构 * KRAFTON Graduate School of AI, KAIST(韩国科学技术院人工智能研究生院) Department of Mathematical Sciences, Seoul National University(首尔国立大学数学科学系)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 针对语音语言模型评估中英语中心化的问题,提出两种智能体驱动的基准构建框架,构建并发布了三个韩语语音基准(KVoiceBench、KOpenAudioBench、KMMAU),通过评估八个最新模型揭示了英语-韩语性能差距和不同任务间的互补性弱点。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27922 2026-05-28 cs.AI 79%

Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows

Harness-Bench: 在真实智能体工作流中测量不同模型的框架效应

Yilun Yao, Xinyu Tan, Chao-Hsuan Liu, Yaoming Li, Zhengyang Wang, Wenhan Yu, Zhewen Tan, Yuxuan Tian, Guangxiang Zhao, Lin Sun, Xiangzheng Zhang, Tong Yang

机构 * Peking University(北京大学) Qiyuan Tech(启元科技)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出Harness-Bench基准,通过106个沙盒离线任务评估不同模型与框架配置组合下的执行性能,发现智能体能力应归因于模型-框架配置而非基础模型。

Comments 16 pages, 4 figures, 11 tables. The first three authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27879 2026-05-28 cs.AI 79%

Towards Faithful Agentic XAI: A Verification Method and an Open-World Benchmark for Better Model Faithfulness

迈向忠实代理式XAI:一种验证方法和一个用于更好模型忠实度的开放世界基准

Jaechang Kim, Sunung Mun, Seungjoon Lee, Jaewoong Cho, Jungseul Ok

机构 * Graduate School of AI, POSTECH(POSTECH人工智能研究生院) Department of Computer Science and Engineering, POSTECH(POSTECH计算机科学与工程系) Krafton

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 提出FAX框架,通过显式验证分解解释声明并交叉检查忠实工具,以及CRAFTER-XAI-Bench开放世界基准,在强化学习环境中将模拟忠实度从0.20提升至0.46。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02503 2026-05-28 cs.AI 79%

DataClawBench: An Agent Benchmark for Exploratory Real-World Financial Data Analysis

DataClawBench: 面向探索性真实世界金融数据分析的智能体基准

Qiaohong Zhang, Weihao Ye, Jialong Chen, Yi Luo, BoYuan Li, Bowen Deng, Zibin Zheng, Jianhao Lin, Wei-Shi Zheng, Chuan Chen

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) School of Software Engineering, Sun Yat-sen University(中山大学软件学院) Lingnan College, Sun Yat-sen University(中山大学岭南学院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 提出DataClawBench基准,通过金融智库场景评估智能体在无先验指导下的探索性数据分析能力,包含约206万条跨领域真实噪声数据及492个多步任务,实验发现探索行为与任务进展及正确性不呈正相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27820 2026-05-28 cs.AI 77%

EgoBench: An Interactive Egocentric Multimodal Benchmark for Tool-Using Agents

EgoBench:面向工具使用智能体的交互式自我中心多模态基准

Yunqi Liu, Tong Niu, Zitong Wang, Zhenlong Dai, Yuqi Qing, Weiqiang Wang, Jian Liu

机构 * Ant Group(蚂蚁集团)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 提出EgoBench,首个交互式自我中心多模态基准,通过1045个自我中心视频任务和用户-智能体-工具交互环境,联合评估视觉感知、工具增强多跳推理和动态交互能力,揭示当前最先进模型性能上限(平均准确率19.43%)。

Comments 68 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05333 2026-05-28 cs.AI 74%

Graph-of-Skills: Dependency-Aware Structural Retrieval for Massive Agent Skills

技能图谱:面向大规模智能体技能的依赖感知结构检索

Dawei Liu, Zongxia Li, Hongyang Du, Xiyang Wu, Shihang Gui, Yongbei Kuang, Lichao Sun

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Maryland(马里兰大学) Brown University(布朗大学) Carnegie Mellon University(卡内基梅隆大学) Lehigh University(莱斯大学)

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 提出技能图谱(GoS),一种推理时的结构检索层,通过构建可执行技能图并利用混合语义-词汇种子、反向感知个性化PageRank和上下文预算水合,实现依赖感知的技能束检索,在SkillsBench和ALFWorld上显著提升奖励并节省令牌。

Comments 11 pages of main text, 12 pages of appendix. Core contribution by Dawei Liu and Zongxia Li. Project page: https://github.com/davidliuk/graph-of-skills

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17654 2026-05-28 cs.CL cs.AI 73%

EVADE-Bench: Multimodal Benchmark for Evaluating and Enhancing Evasive Content Detection

EVADE-Bench:用于评估和增强规避性内容检测的多模态基准

Ancheng Xu, Zhihao Yang, Jingpeng Li, Guanghu Yuan, Longze Chen, Liang Yan, Jiehui Zhou, Zhen Qin, Hengyu Chang, Yukun Chen, Hamid Alinejad-Rokny, Min Yang

机构 * SIAT, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团) University of New South Wales(新南威尔士大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 针对电商平台中LLM/VLM易受规避性内容攻击的问题,提出首个专家标注的中文多模态基准EVADE-Bench,评估26个模型并发现规则分类可提升检测一致性,多智能体分解策略能显著提高准确率。

Comments SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27452 2026-05-28 cs.CV 71%

Fine-Tuning Vision-Language Models for Understanding Current Damage and Scoring Priority with Quality Guard Agent

微调视觉语言模型以理解当前损伤并使用质量卫士代理进行优先级评分

Takato Yasuno

专题命中 Agent评测 :agent(title)

AI总结 本文通过微调LLaVA-1.5-7B视觉语言模型,结合规则引擎和质量卫士代理,实现了桥梁损伤自动理解与修复优先级评分,有效降低了评分变异并提升了效率。

Comments 23 pages, 11 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏