arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15616 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15616 篇

2606.26552 2026-06-26 cs.CV cs.AI 新提交 83%

Perception, Verdict, and Evolution: Hindsight-Driven Self-Refining Forensics Agent for AI-Generated Image Detection

感知、判断与进化:基于事后洞察的自优化取证智能体用于AI生成图像检测

Yangjun Wu, Keyu Yan, Yu Liu, Jingren Zhou, Fei Huang, Rong Zhang, Zhou Zhao, Fei Wu

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 提出ForeAgent框架,采用感知-判断架构融合多视图线索,并引入事后洞察驱动的自优化策略,通过采样-反思-进化范式持续提升检测能力,在多个基准上达到最优性能。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14117 2026-06-24 cs.NI cs.AI 版本更新 83%

Toward Autonomous O-RAN: A Multi-Scale Agentic AI Framework for Real-Time Network Control and Management

迈向自主O-RAN:一种用于实时网络控制与管理的多尺度智能体AI框架

Hojjat Navidan, Mohammad Cheraghinia, Jaron Fontaine, Mohamed Seif, Eli De Poorter, H. Vincent Poor, Ingrid Moerman, Adnan Shahid

机构 * IDLab, Department of Information Technology at Ghent University - imec(IDLab,格鲁特大学信息科技系 - imec) Department of Electrical and Computer Engineering, Princeton University(电气与计算机工程系,普林斯顿大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 提出一种多尺度智能体AI框架,通过非实时、近实时和实时控制环的协调层次结构,实现O-RAN的自主网络控制与管理,并在非平稳条件下和意图驱动的切片资源控制场景中验证了其有效性。

Comments Accepted for publication in the IEEE Network magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23416 2026-06-23 cs.CR cs.AI 新提交 83%

Detecting Malicious Agent Skills in the Wild using Attention

利用注意力机制检测野外恶意智能体技能

Bacem Etteib, Daniele Lunghi, Tégawendé F. Bissyandé

机构 * University of Luxembourg(卢森堡大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 针对LLM技能市场中的恶意技能注入攻击,提出Locate-and-Judge两阶段检测器,通过注意力定位和审查实现高效全市场扫描,大幅降低成本并保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20235 2026-06-19 cs.IR cs.AI 新提交 83%

ScholarQuest: A Taxonomy-Guided Benchmark for Agentic Academic Paper Search in Open Literature Environments

ScholarQuest:开放文献环境中智能学术论文搜索的基于分类法的基准测试

Tingyue Pan, Mingyue Cheng, Daoyu Wang, Yitong Zhou, Jie Ouyang, Qi Liu, Enhong Chen

机构 * State Key Lab of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学认知智能国家重点实验室)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 提出ScholarQuest基准,基于1000多个计算机科学主题和四种研究意图,构建可扩展的答案和共享检索后端,评估LLM智能体在开放文献环境中的学术论文搜索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29483 2026-06-19 cs.AI 版本更新 83%

VitalAgent: A Tool-Augmented Agent for Reactive and Proactive Physiological Monitoring over Wearable Health Data

VitalAgent: 一种工具增强型代理,用于对可穿戴健康数据进行反应性和主动式生理监测

Di Zhu, Yu Yvonne Wu, Hong Jia, Aaqib Saeed, Vassilis Kostakos, Ting Dang

机构 * The University of Melbourne, Australia(墨尔本大学) Dartmouth College, US(达特茅斯学院) University of Auckland, New Zealand(奥克兰大学) Eindhoven University of Technology, Netherlands(埃因霍温理工大学)

专题命中 Agent评测 :agent(title);tool use(abstract);agentic(abstract);分类 cs.AI

AI总结 提出VitalAgent框架,通过工具增强推理和纵向生理记忆,实现对ECG/PPG信号的反应性问答与主动监测,在VitalBench基准上相比基线提升超30%。

Comments Minor revisions; results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08867 2026-06-16 cs.CL 新提交 83%

Building Customer Support AI Agents at 100M-User Scale: An Evaluation-Driven Framework

构建面向1亿用户规模的客户支持AI代理:一种评估驱动的框架

Aman Gupta, Kevin Rossell, Edesio Alcobaça, Jose Chrystian Lima Pacheco, Carolina Baptista de Lima, Shao Tang, Luiz Paulo Rabachini, Luis Moneda, Herbert Fei, Daniel Silva, Rohan Ramanath

机构 * Nubank

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.CL

AI总结 提出一个统一框架,通过评估驱动开发、上下文工程、人工循环提示迭代和LLM评判一致性优化,在Nubank的100M+用户规模下实现客户支持AI代理的离线开发与在线效果桥接,并在五个生产部署中验证了离线指标与在线结果的高度相关性。

Comments 12 pages. Accepted to KDD '26 (32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06738 2026-06-16 cs.CR cs.AI 版本更新 83%

Trust Without Trusting: A Recomputable Trust Protocol for Autonomous Agents

无需信任的信任:面向自主智能体的可重算信任协议

Lars Kersten Kroehl

机构 * MolTrust / CryptoKRI GmbH(MolTrust/加密KRI GmbH)

专题命中 Agent评测 :autonomous agent(title);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 提出组合证据协议(CEP),通过五条件谓词和锚定数据重算,使任何方都能独立验证边界所有者是否遵循其公开规则,解决了开放代理世界中依赖他人边界时的信任验证问题。

Comments 18 pages, 5 figures. v2: substantial revision, reframed around recomputable accountability (Combined Evidence Protocol); adds figures, code listings, and deployment evidence. Supersedes v1 (From Specification to Deployment)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12670 2026-06-16 cs.AI 版本更新 83%

SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks

SkillsBench: 基准测试智能体技能在不同任务中的有效性

Xiangyi Li, Yimin Liu, Wenbo Chen, Bingran You, Zonglin Di, Yifeng He, Shenghan Zheng, Kyoung Whan Choe, Jiankai Sun, Shuyi Wang, Chujun Tao, Binxu Li, Xuandong Zhao, Hejia Geng, Xiaojun Wu, Junwei Zhou, Xiaokun Chen, Hanwen Xing, Yubo Li, Qunhong Zeng, Di Wang, Yuanli Wang, Roey Ben Chaim, Penghao Jiang, Haotian Shen, Luyang Kong, Xinyi Liu, Runhui Wang, Xuanqing Liu, Jiachen Li, Xin Lan, Yueqian Lin, Wengao Ye, Junwei He, Songlin Li, Yue Zhang, Yipeng Gao, Yijiang Li, Ze Ma, Liqiang Jing, Tianyu Wang, Kaixin Li, Yiqi Xue, Haoran Lyu, Yizhuo He, Yuchen Tian, Shutong Wu, Bowei Wang, Yixuan Gao, Bo Chen, Litong Liu, Sikai Cheng, Jiajun Bao, Shuaicheng Tong, Shuwen Xu, Terry Yue Zhuo, Tinghan Ye, Qi Qi, Miao Li, Longtai Liao, Zelin Tan, Chang Shi, Xilin Tang, Srinath Tankasala, Boqin Yuan, Yaoyao Qian, Jianhong Tu, Chenguang Wang, Yizhou Sun, Wei Wang, Aaron Taylor, Ziyue Yang, Changkun Guan, Zhikang Dong, Xinyu Zhang, Steven Dillmann, Han-chung Lee, Dawn Song

机构 * BenchFlow OSU Amazon UC Berkeley UC Santa Cruz UC Davis Dartmouth RLWRLD Independent Princeton University Oxford University Stanford University USC CMU Foxconn Zenity UNSW UT Austin MSU Duke University ByteDance UT Dallas UC San Diego Columbia University University of Rochester Cornell Tech Georgia Tech Cornell University NEU UCLA Snap Inc. Fanshawe College University of Science and Technology of China HKUST(GZ) Anyscale

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 提出SkillsBench基准,包含8领域87个任务,通过配对评估证明技能提升平均通过率16.6个百分点,小模型配备技能可匹敌大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14219 2026-06-15 cs.RO cs.AI 新提交 83%

Selective Agentic Recovery for UAV Autonomy with a Persistent Mission Runtime

面向无人机自主性的选择性代理恢复与持久任务运行时

Taewoo Park, Kyeonghyun Yoo, Seunghyun Yoo, Hwangnam Kim

机构 * Department of Electrical and Electronic Engineering, Korea University(高丽大学电气与电子工程系)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 提出持久任务运行时(PMR)框架,通过选择性调用外部代理推理器实现无人机恢复,引入学习型调用认知价值(learned-CVI)门控机制,在Gazebo/PX4基准测试中将硬/模糊场景成功率从5.0%提升至95.0%,同时减少16.7%的远程调用和29.2%的令牌消耗。

Comments 17 pages, 2 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11378 2026-06-15 cs.CL 版本更新 83%

An Empirical Study of Automating Agent Evaluation

自动化代理评估的实证研究

Kang Zhou, Sangmin Woo, Haibo Ding, Kiran Ramnath, Subramanian Chidambaram, Aosong Feng, Vinayak Arannil, Muhyun Kim, Ishan Singh, Darren Wang, Zhichao Xu, Megha Gandhi, Nirmal Prabhu, Soumya Smruti Mishra, Vivek Singh, Gouri Pandeshwar, Lin Lee Cheong

机构 * AWS AI Labs(AWS人工智能实验室)

专题命中 Agent评测 :agent(title,abstract);tool use(abstract);分类 cs.CL

AI总结 本文研究了自动化代理评估的可行性,提出EvalAgent系统,通过编码技能和领域知识提升评估效率,实验显示其在评估准确性和人类偏好上显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11830 2026-06-11 cs.AI 新提交 83%

Skill-Augmented AI Agents for Medical Research Analysis: An Exploratory Multi-Model Human Evaluation in an NSCLC Transcriptomic Biomarker Task

面向医学研究分析的技能增强型AI代理:一项NSCLC转录组生物标志物任务中的探索性多模型人类评估

Qianyu Yao, Fei Sun, Bocheng Huang, Wei Chen, Jiarui Jiang, Shu Quan, Yifei Chen, Wenjie Xu, Bo li, Liping Su, Ruoqiong Wu, Huhai Hong, Huimei Wang

机构 * AIPOCH PTE. LTD.

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本研究通过非小细胞肺癌免疫治疗生物标志物任务,评估技能增强型AI代理相比原生AI在转录组研究分析输出质量上的提升,发现质量信号方向性但未达统计显著性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11435 2026-06-11 cs.CL 新提交 83%

Agent Skill Evaluation and Evolution: Frameworks and Benchmarks

智能体技能评估与进化:框架与基准

Kexin Ding, Yang Zhou, Can Jin, Feng Tong, Mu Zhou, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.CL

AI总结 本文系统综述了智能体技能从孤立创建到自动化评估驱动进化的范式转变,分类了四种进化范式并分析了六个技能基准类别,指出了覆盖缺口和开放方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11079 2026-06-10 cs.CL 新提交 83%

VISTA: A Versatile Interactive User Simulation Toolkit for Agent Evaluation

VISTA:用于智能体评估的多功能交互式用户模拟工具包

Yunan Lu, Ryan Shea, Yusen Zhang, Zhou Yu

机构 * Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系) Arklex.ai

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.CL

AI总结 提出VISTA工具包,通过六项指标和混合用户模拟器(UI+API)提升智能体评估的真实性与全面性,在电商和教育场景中验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10806 2026-06-10 cs.AI math.FA 新提交 83%

Moonshine: An Autonomous Mathematical Research Agent Centered on Conjecture Generation

Moonshine:一个以猜想生成为中心的自主数学研究智能体

Xiaoyang Chen, Xiang Jiang

机构 * School of Mathematical Science, Tongji University(同济大学数学科学学院)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 提出自主智能体Moonshine,通过提取经典问题结构、提炼新概念并生成数学猜想,以Jacobian猜想为例,将其转化为神经Jacobian猜想并证明部分情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08552 2026-06-09 cs.AI cs.MA cs.NE physics.data-an 新提交 83%

Quantitative Promise Theory: Intentionality and Inference in Autonomous Agents

定量承诺理论:自主智能体中的意向性与推理

Mark Burgess

机构 * ChiTek-i AS

专题命中 Agent评测 :autonomous agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出将贝叶斯概率与信息论优化(包括主动推理)融入承诺语义,以解决概率计算中的非局部协调、校准和归一化问题,并利用边界条件作为承诺约束状态与决策阈值,实现可扩展的意图定义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08285 2026-06-09 cs.AI cs.CE q-fin.CP q-fin.TR 新提交 83%

Beyond Agent Architecture: Execution Assumptions and Reproducibility in LLM-Based Trading Systems

超越智能体架构:基于LLM的交易系统中的执行假设与可复现性

Junyi Yao, Zihao Zheng

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 本文通过审计30项相关研究,发现LLM交易研究中执行假设报告不足,导致结果难以比较,提出需建立执行现实性、可复现性和评估可比性的报告标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07995 2026-06-09 cs.CL 新提交 83%

Customer-Agent: Overcoming Context Limitations in Ultra-Long Shopping Trajectories via Tool-Augmented Agents and RLVR

客户代理:通过工具增强代理和RLVR克服超长购物轨迹中的上下文限制

Hongye Liu, Rongmei Lin, Anurag Kashyap, Hejie Cui, Ricardo Henao, Besnik Fetahu, Bing Yin

机构 * Amazon(亚马逊) Duke University(杜克大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.CL

AI总结 提出ShopTrajQA基准和客户代理框架,利用RLVR训练代理通过代码解释器自主检索解析外部轨迹文件,突破LLM上下文窗口限制,在超长购物轨迹推理中取得强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07020 2026-06-08 cs.CL 新提交 83%

MADE: Beyond Scoring via a Multilingual Agentic Diagnosing Engine for Fine-Grained Evaluation Insights

MADE:超越评分——通过多语言智能诊断引擎实现细粒度评估洞察

Yilun Liu, Miao Zhang, Shimin Tao, Minggui He, Chunguang Zhao, Chenxin Liu, Li Zhang, Chen Liu, Cheng Qian, Liqun Deng, Xiaojun Meng, Daimeng Wei

机构 * Huawei(华为)

专题命中 Agent评测 :agentic(title,abstract);planning(abstract);分类 cs.CL

AI总结 提出MADE多语言智能诊断引擎,将评估后分析分解为规划、聚合分析、实例检查、多语言文化反思和报告合成,在33个模型族、11个基准、26种语言等大规模设置下,诊断报告质量提升47%,专家偏好率达87.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05525 2026-06-05 cs.AI cs.HC 83%

SciVisAgentSkills: Design and Evaluation of Agent Skills for Scientific Data Analysis and Visualization

SciVisAgentSkills:面向科学数据分析和可视化的智能体技能设计与评估

Kuangshi Ai, Haichao Miao, Kaiyuan Tang, Shusen Liu, Chaoli Wang

机构 * Univ. Notre Dame(诺丁汉大学) LLNL(劳伦斯利弗莫尔国家实验室)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 提出SciVisAgentSkills技能库,通过编码环境假设、工具使用模式和领域启发式知识增强编码智能体,在ParaView等科学工具上实现自然语言驱动的科学可视化工作流,实验表明技能可提升任务得分并影响token效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12376 2026-06-05 cs.AI 83%

ProfiliTable: Profiling-Driven Tabular Data Processing via Agentic Workflows

ProfiliTable: 通过代理工作流实现基于轮廓的表格数据处理

Wei Liu, Yang Gu, Xi Yan, Zihan Nan, Beicheng Xu, Keyao Ding, Bin Cui, Wentao Zhang

机构 * School of CS & Key Lab of High Confidence Software Technologies (MOE), Peking University(计算机科学学院及高可信软件技术重点实验室(教育部),北京大学) Academy for Advanced Interdisciplinary Studies, Peking University(先进跨学科研究学院,北京大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Software & Microelectronics, Peking University(软件与微电子学院,北京大学) School of CS & Beijing Key Laboratory of Software and Hardware Cooperative Artificial Intelligence Systems, Peking University(计算机科学学院及北京软件与硬件协同人工智能系统重点实验室,北京大学) Center for Machine Learning Research, Peking University(机器学习研究中心,北京大学)

专题命中 Agent评测 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本研究提出ProfiliTable,一种基于动态轮廓的代理工作流框架,用于解决表格数据处理中的模糊指令、复杂任务结构和缺乏结构化反馈问题,通过交互探索、知识增强合成和反馈驱动细化,实现闭环优化,实验表明其在复杂多步骤场景中优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04321 2026-06-04 cs.AI 83%

The Digital Apprentice: A Framework for Human-Directed Agentic AI Development

数字学徒:面向人类指导的自主AI开发框架

Travis Weber, Rohit Taneja

机构 * Pheo Inc(Pheo公司)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 提出数字学徒框架,通过方法论捕获、授权和持续对齐三个组件,使AI代理在人类指导下逐步获得自主权,实现可扩展且可信的自主系统。

Comments Submitted to ACM AI Leadership Summit 2026, Visionary Papers Track. 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05277 2026-06-04 cs.CV cs.AI 83%

From Segments to Scenes: Temporal Understanding for Agentic Autonomous Driving via Vision-Language Models

从片段到场景:自动驾驶中基于视觉语言模型的时间理解

Kevin Cannons, Saeed Ranjbar Alvar, Mohammad Asiful Hossain, Ahmad Rezaei, Mohsen Gholami, Alireza Heidarikhazaei, Zhou Weimin, Yong Zhang, Mohammad Akbari

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) University of Toronto(多伦多大学) ETH Zurich(苏黎世联邦理工学院) University of Washington(华盛顿大学) University of Southern California(南加州大学)

专题命中 Agent评测 :agentic(title,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 提出自动驾驶时间理解基准TAD,通过场景思维链和轨迹认知图两种无训练方法提升视觉语言模型的时间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
1709.04574 2026-06-04 cs.HC cs.AI cs.SY eess.SY stat.ML 83%

Towards personalized human AI interaction - adapting the behavior of AI agents using neural signatures of subjective interest

迈向个性化的人工智能交互 - 利用主观兴趣的神经签名来适应AI代理的行为

Victor Shih, David C Jangraw, Paul Sajda, Sameer Saproo

机构 * Department of Biomedical Engineering, Columbia University(生物医学工程系,哥伦比亚大学) Data Science Institute, Columbia University(数据科学研究所,哥伦比亚大学) National Institutes of Health(国家卫生研究院)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出通过神经签名检测用户兴趣,使深度强化学习AI代理适应个性化人类偏好,首次展示hBCI在虚拟环境中隐式强化AI控制系统的应用。

Comments 11 pages, 9 figures, 1 table, Submitted to IEEE Trans. on Neural Networks and Learning Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02060 2026-06-03 cs.AI 83%

Where Do Deep-Research Agents Go Wrong? Span-Level Error Localization in Agent Trajectories

深度研究代理在何处出错?代理轨迹中的跨度级错误定位

Jiaming Wang, Ziteng Feng, Jiangtao Wu, Ruihao Li, Qianqian Xie, Yuxiang Ren, He Zhu, Xueming Han, Fanyu Meng, Junlan Feng, Jiaheng Liu

机构 * NJU-LINK Team, Nanjing University(南京大学NJU-LINK团队) JIUTIAN Research(JIUTIAN研究院)

专题命中 Agent评测 :agent(title,abstract);tool use(abstract);分类 cs.AI

AI总结 针对深度研究代理在长轨迹中难以定位错误的问题,本文通过构建TELBench基准和提出DRIFT审计框架,实现了跨度级错误定位,将首次错误定位准确率提升高达30个百分点。

Comments 28 pages, 11 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28556 2026-06-03 cs.AI 83%

A Matter of TASTE: Improving Coverage and Difficulty of Agent Benchmarks

品味问题:提高智能体基准测试的覆盖率和难度

Tomer Keren, Nitay Calderon, Asaf Yehudai, Yotam Perlitz, Michal Shmueli-Scheuer, Roi Reichart

专题命中 Agent评测 :agent(title,abstract);tool-use(abstract);分类 cs.AI

AI总结 提出TASTE方法,通过反转任务构建流程,利用自适应对比n-gram模型和聚类自动生成覆盖广泛工具组合的高难度基准任务,以解决现有基准饱和问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20306 2026-06-03 cs.CV cs.LG 83%

WildRoadBench: A Wild Aerial Road-Damage Grounding Benchmark for Vision-Language Models and Autonomous Agents

WildRoadBench: 面向视觉语言模型与自主智能体的野外航拍道路损伤定位基准

Bingnan Liu, Chenhang Cui, Rui Huang, Jiani Luo, Zhirong Shen, Tinghao Wang, Xiande Huang, Lingbei Meng, Fei Shen, An Zhang

机构 * University of Electronic Science and Technology of China(电子科技大学) National University of Singapore(新加坡国立大学) De Artificial Intelligence Lab(德人工智能实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :autonomous agent(title,abstract);agent(abstract);分类 cs.LG

AI总结 提出WildRoadBench基准,通过VLM直接定位和LLM驱动智能体自主研究两种协议,评估模型在航拍道路损伤定位上的性能,发现现有方法在野外场景下仍不可靠。

Comments Preprint. Under review. 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02404 2026-06-02 cs.CL 83%

K-BrowseComp: A Web Browsing Agent Benchmark Grounded in Korean Contexts

K-BrowseComp:基于韩国语境的网页浏览代理基准测试

Nahyun Lee, Dongkeun Yoon, Guijin Son, Geewook Kim, Dayoon Ko, Jeonghun Park, Haneul Yoo, Jaewon Cho, Junghun Park, Changyoon Lee, Kyochul Jang, Jaeyeon Kim, Eunsu Kim, Woojin Cho, Seungone Kim

机构 * Chung-Ang University(Chung-Ang 大学) KAIST(韩国科学技术院) Seoul National University(首尔国立大学) OnelineAI NAVER Cloud AI Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.CL

AI总结 针对韩国语境,构建包含400个问题的网页浏览代理基准K-BrowseComp,评估前沿模型性能,发现其准确率显著低于BrowseComp,并公开数据与代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02302 2026-06-02 cs.CR cs.AI 83%

SeClaw: Spec-Driven Security Task Synthesis for Evaluating Autonomous Agents

SeClaw: 面向自主代理评估的规范驱动安全任务合成

Hao Cheng, Changtao Miao, Tianle Song, Yin Wu, He Liu, Erjia Xiao, Junchi Chen, Xiaoyu Shi, Yichi Wang, Jing Yang, Taowen Wang, Jinhao Duan, Mengshu Sun, Peiyan Dong, Xuan Shen, Yang Cao, Renjing Xu, Kaidi Xu, Jindong Gu, Bo Zhang, Jize Zhang, Chenhao Lin, Philip Torr, Chao Shen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部) Xi’an Jiaotong University(西安交通大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Oxford(牛津大学) City University of Hong Kong(香港城市大学) Institute of Science Tokyo(东京科学研究所) Zhejiang University(浙江大学) Massachusetts Institute of Technology(麻省理工学院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Beijing University of Technology(北京理工大学)

专题命中 Agent评测 :autonomous agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 提出SeClaw框架,通过规范驱动的安全任务合成与基于执行的安全评估,实现对自主LLM代理在状态化环境中的安全风险的可扩展、可复现评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02109 2026-06-02 cs.AI 83%

BADGER: Bridging Agentic and Deterministic Evaluation for Generative Enterprise Reasoning

BADGER:桥接生成式企业推理的自主与确定性评估

Shannon Serrao, Soumitra Chatterjee, Dorina Strori, Abhishek Sharma, Nathan Miller

机构 * Merkle Analytics

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 提出BADGER框架,统一文本到SQL评估与自主行为评估,通过混合执行准确率指标(Hybrid-EX)和自主评估套件,在工业查询上超越现有方法。

Comments 30 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00925 2026-06-02 cs.CR cs.AI 83%

Benchmarking Security Risk Detection and Verification in Open Agentic Skill Ecosystems

开放智能体技能生态系统中的安全风险检测与验证基准测试

Ismail Hossain, Sai Puppala, Zhuoran Lu, Sajedul Talukder, Nan Jiang

机构 * University of Texas at El Paso(德克萨斯理工大学) Southern Illinois University-Carbondale(南方伊利诺伊大学卡本代尔分校) Purdue University(普渡大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 提出SkillVetBench,一个两阶段安全审查基准,通过语义审查和沙箱执行检测与验证开放智能体技能生态系统中的恶意技能。

详情

展开后加载摘要…

URL PDF HTML 收藏