机构
*
Shanghai Jiao Tong University(上海交通大学)
;
S-Lab, Nanyang Technological University(南洋理工大学S实验室)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
University of Science and Technology of China(中国科学技术大学)
;
Stanford University(斯坦福大学)
;
Shanghai Innovation Institute(上海创新研究院)
;
The Chinese University of Hong Kong(香港中文大学)
;
Fudan University(复旦大学)
;
CPII under InnoHK(InnoHK下的CPII)
;
Adobe Research(Adobe研究)
MMBU: A Massive Multi-modal Biomedical Understanding Benchmark to Probe the Perception Capabilities of Vision-Language Models
MMBU: 大规模多模态生物医学理解基准,用于探测视觉语言模型的感知能力
Ryan D'Cunha, Alejandro Lozano, Xiaoxiao Sun, Daniel Vela Jarquin, Min Woo Sun, Josiah Aklilu, James Burgess, Yuhui Zhang, Ryan Nayebi, Paola Avila, Robayo, Jin Ye, Ming Hu, Zhongying Deng, Junjun He, Xin Chen, Yue Yao, Robert Tibshirani, Jeffrey J. Nirschl, Serena Yeung-Levy
机构
*
Stanford University(斯坦福大学)
;
University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
;
Instituto Tecnológico de Monterrey(蒙特雷技术学院)
;
Monash University(墨尔本大学)
;
University of Cambridge(剑桥大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Shandong University(山东大学)
How Language Models Fail: Token-Level Signatures of Committed and Persistent Reasoning Failures
语言模型如何失败:承诺性和持续性推理错误的令牌级特征
Tanvi Thoria, Kiana Jafari, Marc R. Schlichting, Mykel J. Kochenderfer
机构
*
Department of Computer Science, Stanford University(计算机科学系,斯坦福大学)
;
Department of Aeronautics and Astronautics, Stanford University(航空航天工程系,斯坦福大学)
Elis Karcini, Faisal Mehrban, Quang Nguyen, Mac Schwager, Arash Ajoudani, Cesar Cadena, Jan Peters, Marco Hutter, Haitham Bou-Ammar
机构
*
Motoniq.ai
;
Stanford University(斯坦福大学)
;
Istituto Italiano di Tecnologia(意大利技术研究院)
;
ETH Zurich(苏黎世联邦理工学院)
;
Technical University of Darmstadt(德累斯顿技术大学)
;
UCL Centre for AI(伦敦大学学院人工智能中心)