AgenticRAGTracer: A Hop-Aware Benchmark for Diagnosing Multi-Step Retrieval Reasoning in Agentic RAG
AgenticRAGTracer:用于诊断Agentic RAG中多步检索推理的跳数感知基准
Qijie You, Wenkai Yu, Wentao Zhang
机构
*
University of Science and Technology Beijing(北京科技大学)
;
Peking University(北京大学)
;
Zhongguancun Academy(中关村学院)
;
Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京市数据智能与安全重点实验室(北京大学))
Real-World Evaluation of an AI Agent Drafting Translational Impact Summaries
人工智能代理起草转化影响摘要的实际评估
Mohammad Arvan, Amber E. Osterholt, Bailee Rue, Yuvaneswaren R. Sureshbabu, Krishna R. Patel, Rebecca T. Feinstein, Bethany C. Bray, Niranjan S. Karnik
A Guideline-Aware AI Agent for Zero-Shot Target Volume Auto-Delineation
一种遵循指南的AI智能体用于零样本靶区自动勾画
Yoon Jo Kim, Wonyoung Cho, Jongmin Lee, Han Joo Chae, Hyunki Park, Sang Hoon Seo, Jae Myung Noh, Kyungmi Yang, Dongryul Oh, Jin Sung Kim
机构
*
Oncosoft Inc.(Oncosoft公司)
;
Department of Radiation Oncology, Samsung Medical Center, Sungkyunkwan University School of Medicine(放射肿瘤科,三星医疗中心,成均馆大学医学院)
Large Language Models for Agentic NetOps and AIOps: Architectures, Evaluation, and Safety
用于代理网络运维和AI运维的大型语言模型:架构、评估与安全
Muhammad Bilal, Jon Crowcroft, Ruizhi Wang, Xiaolong Xu, Schahram Dustdar
机构
*
School of Computing and Communications(计算与通信学院)
;
University of Cambridge(剑桥大学)
;
School of Software(软件学院)
;
Nanjing University of Information Science and Technology(南京信息科技大學)
;
TU Wien(维也纳技术大学)
;
ICREA
Comments19 pages, 9 figures, 4 tables, Proceedings of the 39th Annual ACM Symposium on User Interface Software and Technology (UIST '26), Detroit, MI, USA
A Unified Framework for the Evaluation of LLM Agentic Capabilities
LLM 代理能力评估的统一框架
Pengyu Zhu, Lijun Li, Yaxing Lyu, Qianxin Luo, Jingyi Yang, Yi Liu, Tingfeng Hui, Xinyu Yuan, Li Sun, Sen Su, Jing Shao
机构
*
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
;
Chongqing University of Posts and Telecommunications(重庆邮电大学)
;
North China Electric Power University(华北电力大学)
Comments16 pages, 3 figures, 5 tables. Accepted to the Workshop on Agent Behavior (WAB) at COLM 2026. Benchmark, environments, and evaluation harness: https://github.com/surge-ai/handbook
CommentsThis is the author's accepted version of the paper accepted to appear at IEEE AIIoT 2025. The final version will be available via IEEE Xplore. \c{opyright}2025 IEEE. Personal use of this material is permitted
OmnilingualGAIA2: Evaluating the Multilingual Gap in Frontier AI Agents
OmnilingualGAIA2:评估前沿AI智能体的多语言差距
Andrea Caciolai, Pere-Lluís Huguet Cabot, Chierh Cheng, Albert Ventayol-Boada, Gabriel Mejia Gonzalez, Christophe Ropers, Lucas Bandarkar, Sebastian Ruder, Darlene Sakakihara, Elliot Yun, Pierre Andrews, Grégoire Mialon, Romain Froger, Marta R. Costa-jussà
Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond
代理世界建模:基础、能力、定律及更远
Meng Chu, Xuan Billy Zhang, Kevin Qinghong Lin, Lingdong Kong, Jize Zhang, Teng Tu, Weijian Ma, Ziqi Huang, Senqiao Yang, Wei Huang, Yeying Jin, Zhefan Rao, Jinhui Ye, Xinyu Lin, Xichen Zhang, Qisheng Hu, Shuai Yang, Leyang Shen, Wei Chow, Yifei Dong, Fengyi Wu, Quanyu Long, Bin Xia, Shaozuo Yu, Mingkang Zhu, Wenhu Zhang, Jiehui Huang, Haokun Gui, Runyi Li, Chenyu Tang, Dong Huang, Xuhang Chen, Rui Liu, Chengzu Li, Shiyi Du, Xu Huang, Haoxuan Che, Long Chen, Qifeng Chen, Wenya Wang, Wenxuan Zhang, Xiaojuan Qi, Yang Deng, Yanwei Li, Mike Zheng Shou, Zhi-Qi Cheng, See-Kiong Ng, Ziwei Liu, Philip Torr, Jiaya Jia
机构
*
Hong Kong University of Science and Technology(香港科学与技术大学)
;
National University of Singapore(新加坡国立大学)
;
University of Oxford(牛津大学)
;
Nanyang Technological University(南洋理工大学)
;
Chinese University of Hong Kong(香港中文大学)
;
University of Hong Kong(香港大学)
;
University of Washington(华盛顿大学)
;
University of Tokyo(东京大学)
;
Carnegie Mellon University(卡内基梅隆大学)
;
University of California, Berkeley(加州大学伯克利分校)
;
University of Cambridge(剑桥大学)
;
Singapore University of Technology and Design(新加坡科技设计大学)
;
Singapore Management University(新加坡管理学院)
;
XGEN Labs(XGEN实验室)