Skill-RM: Unifying Heterogeneous Evaluation Criteria via Agent Skill
Skill-RM: 通过智能体技能统一异构评估标准
Tao Chen, Gangwei Jiang, Pengyu Cheng, Siyuan Huang, Yihao Liu, Jingwei Ni, Jiaqi Guo, Mengyu Zhou, Kai Tang, Junling Liu, Qinliang Su, Xiaoxi Jiang, Guanjun Jiang
机构
*
Qwen Large Model Application Team, Alibaba(通义千问大模型应用团队,阿里巴巴)
;
Sun Yat-sen University(中山大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
Peking University(北京大学)
;
ETH Zürich University of Zurich(苏黎世联邦理工学院)
机构
*
Gradient
;
Soochow University(苏州大学)
;
Independent Researcher(独立研究者)
;
University of Southern California(南加州大学)
;
Rice University(Rice大学)
;
Carnegie Mellon University(卡内基梅隆大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
University of California, Berkeley(加州大学伯克利分校)
;
University of the Chinese Academy of Sciences(中国科学院大学)
;
University of California, Los Angeles(加州大学洛杉矶分校)
STRUCTSENSE: A Task-Agnostic Agentic Framework for Structured Information Extraction with Human-In-The-Loop Evaluation and Benchmarking
STRUCTSENSE:一种任务无关的代理框架,用于结构化信息提取,具有人机协同评估和基准测试
Tek Raj Chhetri, Yibei Chen, Puja Trivedi, Dorota Jarecka, Saif Haobsh, Patrick Ray, Lydia Ng, Satrajit S. Ghosh
机构
*
McGovern Institute for Brain Research, Massachusetts Institute of Technology, Cambridge, MA, USA(麦戈文脑科学研究所,麻省理工学院,马萨诸塞州剑桥市)
;
Fylo Labs Inc., New York, NY, USA(Fylo实验室公司,纽约州纽约市)
;
Allen Institute for Brain Science, Seattle, WA, USA(艾伦脑科学研究所,华盛顿州西雅图市)
机构
*
School of Computer Science and Informatics, University of Liverpool(利兹大学计算机科学与信息学学院)
;
Department of Computer Science, Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学计算机科学系)
Stargazer: A Scalable Model-Fitting Benchmark Environment for AI Agents under Astrophysical Constraints
Stargazer:一种可扩展的AI代理在天体物理约束下的模型拟合基准环境
Xinge Liu, Terry Jingchen Zhang, Bernhard Schölkopf, Zhijing Jin, Kristen Menou
机构
*
University of Toronto(多伦多大学)
;
Vector Institute(向量研究所)
;
Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所)
;
ELLIS Institute Tübingen(图宾根ELLIS研究所)
Group of Skills: Group-Structured Skill Retrieval for Agent Skill Libraries
技能组:面向智能体技能库的分组结构技能检索
Kun Zeng, Yu Huo, Siyu Zhang, Zi Ye, Yuecheng Zhuo, Haoyue Liu, Yuquan Lu, Junhao Wen, Xiaoying Tang
机构
*
School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)科学与工程学院)
;
Sun Yat-sen University(孙中山大学)
;
University of California, San Diego(加州大学圣地亚哥分校)
;
Taiyuan University of Technology(太原理工大学)
Best Agent Identification for General Game Playing
多任务领域中最佳代理的识别
Matthew Stephenson, Alex Newcombe, Eric Piette, Dennis Soemers
机构
*
College of Science and Engineering, Flinders University, Adelaide, South Australia, Australia(科学与工程学院,弗林德斯大学,阿德莱德,澳大利亚,南澳大利亚州)
;
Information and Communication Technologies, Electronics, and Applied Mathematics Institute, UCLouvain, Louvain-la-Neuve, Belgium(信息与通信技术、电子学和应用数学研究所,UCLouvain,洛林-拉-纽夫,比利时)
;
Department of Advanced Computing Sciences, Maastricht University, Maastricht, the Netherlands(高级计算科学系,马斯特里赫特大学,马斯特里赫特,荷兰)
VeruSAGE: A Study of Agent-Based Verification for Rust Systems
VeruSAGE:Rust系统代理验证的研究
Chenyuan Yang, Natalie Neamtu, Chris Hawblitzel, Jacob R. Lorch, Shan Lu
机构
*
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
Carnegie Mellon University(卡内基梅隆大学)
;
Microsoft Research(微软研究院)
;
University of Chicago(芝加哥大学)
Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety
大规模安全:大型模型和智能体安全的全面综述
Xingjun Ma, Yifeng Gao, Yixu Wang, Ruofan Wang, Xin Wang, Ye Sun, Yifan Ding, Hengyuan Xu, Yunhao Chen, Yunhan Zhao, Hanxun Huang, Yige Li, Yutao Wu, Jiaming Zhang, Xiang Zheng, Yang Bai, Zuxuan Wu, Xipeng Qiu, Jingfeng Zhang, Yiming Li, Xudong Han, Haonan Li, Jun Sun, Cong Wang, Jindong Gu, Baoyuan Wu, Siheng Chen, Tianwei Zhang, Yang Liu, Mingming Gong, Tongliang Liu, Shirui Pan, Cihang Xie, Tianyu Pang, Yinpeng Dong, Ruoxi Jia, Yang Zhang, Shiqing Ma, Xiangyu Zhang, Neil Gong, Chaowei Xiao, Sarah Erfani, Tim Baldwin, Bo Li, Masashi Sugiyama, Dacheng Tao, James Bailey, Yu-Gang Jiang
机构
*
Fudan University(复旦大学)
;
The University of Melbourne(墨尔本大学)
;
Singapore Management University(新加坡国立大学)
;
Deakin University(德肯大学)
;
Hong Kong University of Science and Technology(香港科学与技术大学)
;
City University of Hong Kong(香港城市大学)
;
University of Oxford(牛津大学)
;
Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
;
Shanghai Jiao Tong University(上海交通大学)
;
Nanyang Technological University(南洋理工大学)
;
The University of Sydney(悉尼大学)
;
Griffith University(格里菲斯大学)
;
University of California, Santa Cruz(加州大学圣克鲁兹分校)
;
Sea AI Lab(Sea AI实验室)
;
Tsinghua University(清华大学)
;
Virginia Tech(弗吉尼亚理工大学)
;
CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全部)
;
University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)
;
Purdue University(普渡大学)
;
Duke University(杜克大学)
;
University of Wisconsin - Madison(威斯康星大学麦迪逊分校)
;
RIKEN(理化学研究所)
;
The University of Tokyo(东京大学)
Proactive Agent Research Environment: Simulating Active Users to Evaluate Proactive Assistants
主动代理研究环境:模拟活跃用户以评估主动助手
Deepak Nathani, Cheng Zhang, Chang Huan, Jiaming Shan, Yinfei Yang, Alkesh Patel, Zhe Gan, William Yang Wang, Michael Saxon, Xin Eric Wang
机构
*
University of California, Santa Barbara(加州大学圣塔芭芭拉分校)
;
Apple, USA(苹果公司(美国))
;
University of Washington(华盛顿大学)
;
Independent Researcher, USA(独立研究员(美国))