Herculean: An Agentic Benchmark for Financial Intelligence
Herculean: 面向金融智能的智能体基准测试
Xueqing Peng, Zhuohan Xie, Yupeng Cao, Haohang Li, Lingfei Qian, Yan Wang, Vincent Jim Zhang, Huan He, Xuguang Ai, Linhai Ma, Ruoyu Xiang, Yueru He, Yi Han, Shuyao Wang, Yuqing Guo, Mingyang Jiang, Yilun Zhao, Youzhong Dong, Xiaoyu Wang, Yankai Chen, Ye Yuan, Qiyuan Zhang, Fuyuan Lyu, Haolun Wu, Yonghan Yang, Zichen Zhao, Yuyang Dai, Fan Zhang, Rania Elbadry, Ayesha Gull, Muhammad Usman Safder, Nuo Chen, Fengbin Zhu, Tianshi Cai, Zimu Wang, Polydoros Giannouris, Yuechen Jiang, Zhiwei Liu, Mohsinul Kabir, Yuyan Wang, Yixiang Zheng, Yangyang Yu, Weijin Liu, Wenbo Cao, Anke Xu, Peng Lu, Jerry Huang, Mingquan Lin, Prayag Tiwari, Yijia Zhao, Víctor Gutiérrez-Basulto, Xiao-Yang Liu, Kaleb E Smith, Jiahuan Pei, Arman Cohan, Jimin Huang, Yuehua Tang, Alejandro Lopez-Lira, Xi Chen, Xue Liu, Junichi Tsujii, Jian-Yun Nie, Sophia Ananiadou
机构
*
The Fin AI
;
Yale University(耶鲁大学)
;
Columbia University(哥伦比亚大学)
;
Stevens Institute of Technology(史蒂文斯理工学院)
;
NVIDIA(英伟达)
;
New York University(纽约大学)
;
Georgia Institute of Technology(佐治亚理工学院)
;
University of Florida(佛罗里达大学)
;
MBZUAI
;
Université de Montréal(蒙特利尔大学)
;
University of Minnesota(明尼苏达大学)
;
University of Massachusetts Boston(马萨诸塞大学波士顿分校)
;
National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院)
;
University of Liverpool(利物浦大学)
;
Vrije Universiteit Amsterdam(阿姆斯特丹自由大学)
;
National University of Singapore(新加坡国立大学)
;
Halmstad University(哈尔姆斯塔德大学)
;
University of Manchester(曼彻斯特大学)
;
Cardiff University(卡迪夫大学)
;
McGill University(麦吉尔大学)
;
Mila – Quebec AI Institute(魁北克人工智能研究所)
Agent Tools Orchestration Leaks More: Dataset, Benchmark, and Mitigation
Agent工具编排泄露更多:数据集、基准测试与缓解措施
Yuxuan Qiao, Dongqin Liu, Hongchang Yang, Wei Zhou, Songlin Hu
机构
*
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)
DrugClaw and DrugAudit: A Primary-Source-Grounded Agent and Authority-Aware Benchmark for Drug-Information Question Answering
DrugClaw与DrugAudit:基于原始来源的智能体与权威感知基准用于药物信息问答
Qing Wang, Bo Li, Jialu Liang, Daling Shi, Bob Zhang, Qianqian Song
机构
*
Department of Health Outcomes and Biomedical Informatics, College of Medicine, University of Florida(佛罗里达大学健康结局与生物医学信息学系,医学院)
;
PAMI Research Group, Department of Computer and Information Science, Faculty of Science and Technology, University of Macau(澳门大学科学与技术学院计算机与信息科学系PAMI研究组)
TimeSage-MT: A Multi-Turn Benchmark for Evaluating Agentic Time Series Reasoning
TimeSage-MT:用于评估智能时间序列推理的多轮基准测试
Yaxuan Kong, Qingren Yao, Yuqi Nie, Yichen Li, Yilei Shao, Stefan Zohren, Anna Vettoruzzo, Joaquin Vanschoren, Ming Jin, Qingsong Wen
机构
*
University of Oxford(牛津大学)
;
VulpiVox Intelligence
;
Eindhoven University of Technology(埃因霍温理工大学)
;
Griffith University(格里菲斯大学)
;
Squirrel Ai Learning
;
East China Normal University(华东师范大学)
机构
*
Carnegie Mellon University(卡内基梅隆大学)
;
Georgia Institute of Technology(佐治亚理工学院)
;
University of Glasgow(格拉斯哥大学)
;
Independent Researcher(独立研究员)
;
Corespeed Inc.(Corespeed公司)
Aditya Kumar, Zhihan Lei, Jerry Yan, Joshua W. Momo, Lauhitya Reddy, Rafael Enrique Cabrera Jimenez, Cassandra A. Cohen, Arthur Kajiyama, William W. Cohen
K-BrowseComp: A Web Browsing Agent Benchmark Grounded in Korean Contexts
K-BrowseComp:基于韩国语境的网页浏览代理基准测试
Nahyun Lee, Dongkeun Yoon, Guijin Son, Geewook Kim, Dayoon Ko, Jeonghun Park, Haneul Yoo, Jaewon Cho, Junghun Park, Changyoon Lee, Kyochul Jang, Jaeyeon Kim, Eunsu Kim, Woojin Cho, Seungone Kim
机构
*
Chung-Ang University(Chung-Ang 大学)
;
KAIST(韩国科学技术院)
;
Seoul National University(首尔国立大学)
;
OnelineAI
;
NAVER Cloud AI
;
Carnegie Mellon University(卡内基梅隆大学)
SeClaw: Spec-Driven Security Task Synthesis for Evaluating Autonomous Agents
SeClaw: 面向自主代理评估的规范驱动安全任务合成
Hao Cheng, Changtao Miao, Tianle Song, Yin Wu, He Liu, Erjia Xiao, Junchi Chen, Xiaoyu Shi, Yichi Wang, Jing Yang, Taowen Wang, Jinhao Duan, Mengshu Sun, Peiyan Dong, Xuan Shen, Yang Cao, Renjing Xu, Kaidi Xu, Jindong Gu, Bo Zhang, Jize Zhang, Chenhao Lin, Philip Torr, Chao Shen
机构
*
The Hong Kong University of Science and Technology(香港科技大学)
;
Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部)
;
Xi’an Jiaotong University(西安交通大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
University of Oxford(牛津大学)
;
City University of Hong Kong(香港城市大学)
;
Institute of Science Tokyo(东京科学研究所)
;
Zhejiang University(浙江大学)
;
Massachusetts Institute of Technology(麻省理工学院)
;
University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
;
Beijing University of Technology(北京理工大学)
An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation
多时相指代分割的开源基准与基线
Bingyu Li, Da Zhang, Tao Huo, Zhiyuan Zhao, Junyu Gao, Xuelong Li
机构
*
University of Science and Technology of China(中国科学技术大学)
;
Institute of Artificial Intelligence (TeleAI)(人工智能研究所)
;
China Telecom(中国电信)
;
School of Artificial Intelligence, Optics and Electronics (iOPEN)(人工智能、光学与电子学院)
;
Northwestern Polytechnical University(西北工业大学)
What to Format and How: A Benchmark and Workflow Approach for Document Formatting
格式化什么以及如何格式化:文档格式化的基准与工作流方法
Shihao Rao, Liang Li, Jiapeng Liu, Tong Lin, Bing Li, Xiyan Gao, Peng Fu, Jing Huang, Can Ma
机构
*
Institute of Information Engineering, Chinese Academy of Sciences(信息工程研究所,中国科学院)
;
School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
VLAMotor: Test-Guided Enhancement of Vision-Language-Action Models via Agent-BasedData Synthesis
VLAMotor: 通过基于智能体的数据合成实现视觉-语言-动作模型的测试引导增强
Zeqin Liao, Peifan Ren, Zixu Gao, Hongyu Gong, Lianyu Hu, Wenbing Tang, Yuhong Nan, Zibin Zheng, Yang Liu
机构
*
School of computing and data science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)
;
School of Software Engineering, Sun Yat-sen University(软件工程学院,中山大学)
;
GuangDong Engineering Technology Research Center of Blockchain, China(区块链工程技术研发中心,中国)
;
Northwest A&F University(西北农林科技大学)