EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation
EnvSimBench:一个评估和改进基于LLM的环境模拟的基准
Yi Liu, TingFeng Hui, Wei Zhang, Li Sun, Ningxin Su, Jian Wang, Sen Su
机构
*
Beijing University of Posts and Telecommunications(北京邮电大学)
;
The Hong Kong University of Science and Technology(香港科技大学)
;
Chongqing University(重庆大学)
An Interpretable and Scalable Framework for Evaluating Large Language Models
用于评估大语言模型的可解释且可扩展的框架
Xinhao Qu, Qiang Heng, Hao Zeng, Xiaoqian Liu
机构
*
Department of Statistics, University of California, Riverside(加州大学河滨分校统计学系)
;
School of Statistics and Data Science, Southeast University(东南大学统计与数据科学学院)
;
Department of Statistics and Data Science, Southern University of Science and Technology(南方科技大学统计与数据科学系)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG
机构
*
Renmin University of China(中国人民大学)
;
Tsinghua University(清华大学)
;
Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
;
Aalborg University(奥胡斯大学)
专题命中
评测与基准
:LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
机构
*
ETH Zurich(苏黎世联邦理工学院)
;
Forgis
;
UC3M
;
Imperial College London(帝国理工学院伦敦分校)
;
University of Berkeley(伯克利大学)
;
KTH Royal Institute of Technology(皇家理工学院)
;
University of Vienna(维也纳大学)
机构
*
National Chengchi University(国立中正大学)
;
Georgetown University(乔治城大学)
;
University of Michigan(密歇根大学)
;
Stevens Institute of Technology(史蒂文斯理工学院)
;
National Taiwan University of Science and Technology(台湾科技大学)
;
Far Eastern Memorial Hospital(东方纪念医院)