CryptoBench: A Dynamic Benchmark for Expert-Level Evaluation of LLM Agents in Cryptocurrency
CryptoBench: 一种动态基准,用于评估LLM代理在加密货币领域的专家级能力
Jiacheng Guo, Suozhi Huang, Zixin Yao, Yifan Zhang, Yifu Lu, Jiashuo Liu, Zihao Li, Nicholas Deng, Qixin Xiao, Jia Tian, Kanghong Zhan, Tianyi Li, Xiaochen Liu, Jason Ge, Chaoyang He, Kaixuan Huang, Lin Yang, Wenhao Huang, Mengdi Wang
机构
*
Princeton University(普林斯顿大学)
;
Zenith Lab(Zenith实验室)
;
University of California, Los Angeles(加州大学洛杉矶分校)
;
University of California, Berkeley(加州大学伯克利分校)
;
University of Michigan(密歇根大学)
BioXArena: Benchmarking LLM Agents on Multi-Modal Biomedical Machine Learning Tasks
BioXArena:在多模态生物医学机器学习任务上评估LLM代理的基准测试
Loka Li, Duzhen Zhang, Xingbo Du, Leonard Song, Zixiao Wang, Assanali Aukenov, Noel Thomas, Shakhnazar Sailaukan, Yonghan Yang, Feilong Chen, Jiahua Dong, Kun Zhang, Bin Zhang, Le Song
MyoChallenge 2025: A New Benchmark for Human Athletic Intelligence
MyoChallenge 2025: 人类运动智能的新基准
Cheryl Wang, Chun Kwang Tan, Balint K. Hodossy, Eric Lyu, Jun Guo, Wentao Zhao, Huaping Liu, Chengkun Li, Merkourios Simos, Bianca Ziliotto, Alexander Mathis, Siyuan Liu, Jiahao Chen, Shanlin Zhong, Bo Jiang, Ci Song, Yaoye Zhu, Chenhui Zuo, Yanan Sui, Mohamed Irfan Refai, Massimo Sartori, Guillaume Durandau, Vikash Kumar, Vittorio Caggiano
机构
*
McGill University(麦吉尔大学)
;
National University of Singapore(国立新加坡大学)
;
Imperial College London(伦敦帝国理工学院)
;
King’s College London(伦敦国王学院)
;
Tsinghua University(清华大学)
;
EPFL(苏黎世联邦理工学院)
;
CASIA(中国科学院自动化所)
;
University of Twente(代尔夫特理工大学)
;
MyoLab