LABBench2: An Improved Benchmark for AI Systems Performing Biology Research
LABBench2:一种改进的AI系统进行生物研究的基准测试
Jon M Laurent, Albert Bou, Michael Pieler, Conor Igoe, Alex Andonian, Siddharth Narayanan, James Braza, Alexandros Sanchez Vassopoulos, Jacob L Steenwyk, Blake Lash, Andrew D White, Samuel G Rodriques
机构
*
Broad Institute, Cambridge, MA, USA(博德研究所,美国马萨诸塞州剑桥市)
Do LLMs Know Tool Irrelevance? Demystifying Structural Alignment Bias in Tool Invocations
LLMs是否了解工具无关性?解密工具调用中的结构对齐偏差
Yilong Liu, Xixun Lin, Pengfei Cao, Ge Zhang, Fang Fang, Yanan Cao
机构
*
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
School of Computer Science and Technology, Donghua University(东华大学计算机科学与技术学院)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
FORGE: Fine-grained Multimodal Evaluation for Manufacturing Scenarios
FORGE:面向制造场景的细粒度多模态评估
Xiangru Jian, Hao Xu, Wei Pang, Xinjian Zhao, Chengyu Tao, Qixin Zhang, Xikun Zhang, Chao Zhang, Guanzhi Deng, Alex Xue, Juan Du, Tianshu Yu, Garth Tarr, Linqi Song, Qiuzhuang Sun, Dacheng Tao
机构
*
University of Waterloo(滑铁卢大学)
;
University of Sydney(悉尼大学)
;
Singapore Management University(新加坡管理大学)
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
;
Hunan University(湖南大学)
;
Nanyang Technological University(南洋理工大学)
;
Royal Melbourne Institute of Technology(皇家墨尔本理工大学)
;
City University of Hong Kong(香港城市大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
City University of Hong Kong Shenzhen Research Institute(香港城市大学深圳研究院)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
EVGeoQA: Benchmarking LLMs on Dynamic, Multi-Objective Geo-Spatial Exploration
EVGeoQA:基于动态多目标地理空间探索的LLM基准测试
Jianfei Wu, Zhichun Wang, Zhensheng Wang, Zhiyu He
机构
*
School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)
;
Beijing Key Laboratory of Artificial Intelligence for Education(北京市教育人工智能重点实验室)
;
Engineering Research Center of Intelligent Technology and Educational Application, Ministry of Education(教育部智能技术与教育应用工程研究中心)
;
College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机学院)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
机构
*
Department of Computer Science, Hong Kong Baptist University(香港浸会大学计算机科学系)
;
Department of Computer Science, Guangdong University of Technology(广东工业大学计算机科学系)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.AI
Shijia Xu, Yu Wang, Xiaolong Jia, Zhou Wu, Kai Liu, April Xiaowen Dong
机构
*
Chongqing University(重庆大学)
;
Queen Mary University of London(伦敦玛丽女王大学)
;
Chongqing Key Laboratory of Big Data Intelligence and Privacy Computing(重庆市大数据智能与隐私计算重点实验室)
;
Fangda Partners(方达律师事务所)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.CL
HealthAdminBench: Evaluating Computer-Use Agents on Healthcare Administration Tasks
HealthAdminBench: 评估基于计算机使用的代理在医疗管理任务上的性能
Suhana Bedi, Ryan Welch, Ethan Steinberg, Michael Wornow, Taeil Matthew Kim, Haroun Ahmed, Peter Sterling, Bravim Purohit, Qurat Akram, Angelic Acosta, Esther Nubla, Pritika Sharma, Michael A. Pfeffer, Sanmi Koyejo, Nigam H. Shah
机构
*
Stanford University(斯坦福大学)
;
Kinetic Systems
;
Stanford Health Care(斯坦福医疗保健)
ITIScore: An Image-to-Text-to-Image Rating Framework for the Image Captioning Ability of MLLMs
ITIScore: 一种图像到文本到图像评分框架,用于评估多模态大语言模型的图像描述能力
Zitong Xu, Huiyu Duan, Shengyao Qin, Guangyu Yang, Guangji Ma, Xiongkuo Min, Ke Gu, Guangtao Zhai, Patrick Le Callet
机构
*
Shanghai Jiao Tong University(上海交通大学)
;
University of Electronic and Science Technology of China(电子科技大学)
;
Beijing University of Technology(北京工业大学)
;
Institut Universitaire de France (IUF), University of Nantes(法国大学研究院(IUF),南特大学)
专题命中
评测与基准
:large language model(abstract);language model(abstract)