How Can We Synthesize High-Quality Pretraining Data? A Systematic Study of Prompt Design, Generator Model, and Source Data
如何合成高质量的预训练数据?提示设计、生成模型和源数据的系统研究
Joel Niklaus, Atsuki Yamaguchi, Michal Štefánik, Guilherme Penedo, Hynek Kydlíček, Elie Bakouch, Lewis Tunstall, Edward Emanuel Beeching, Thibaud Frere, Colin Raffel, Leandro von Werra, Thomas Wolf
机构
*
Hugging Face
;
University of Sheffield(谢菲尔德大学)
;
National Institute of Informatics(日本信息处理研究所)
TokSuite: Measuring the Impact of Tokenizer Choice on Language Model Behavior
TokSuite:衡量分词器选择对语言模型行为的影响
Gül Sena Altıntaş, Malikeh Ehghaghi, Brian Lester, Fengyuan Liu, Wanru Zhao, Marco Ciccone, Colin Raffel
机构
*
University of Toronto(多伦多大学)
;
Vector Institute(向量研究所)
;
Google DeepMind(谷歌DeepMind)
;
McGill University(麦吉尔大学)
;
University of Cambridge(剑桥大学)
;
Hugging Face
Evaluation Cards: An Interpretive Layer for AI Evaluation Reporting
评估卡:AI评估报告的解释层
Avijit Ghosh, Anka Reuel, Jenny Chim, Wm. Matthew Kennedy, Srishti Yadav, Jennifer Mickel, Yanan Long, Andrew Tran, Anastassia Kornilova, Damian Stachura, Kevin Klyman, Felix Friedrich, Jeba Sania, Jan Batzner, Anoop Mishra, Eliya Habba, Yixiong Hao, Nathan Heath, Shalaleh Rismani, Usman Gohar, Andrea Loehr, David Manheim, Ruchira Dhar, Sree Harsha Nelaturu, Aarush Sinha, Leshem Choshen, Drishti Sharma, Ishan Khire, Amit Saha, Subramanyam Sahoo, Michael Hardy, Michael Alexander Riegler, Kabir Manghnani, Michelle Lin, Yanan Jiang, Yilin Huang, Asaf Yehudai, Jessica Ji, Aris Hofmann, Mubashara Akhtar, Max Lamparth, Nuno Moniz, Yacine Jernite, Stella Biderman, Zeerak Talat, Sanmi Koyejo, Mykel Kochenderfer, Irene Solaiman
机构
*
Hugging Face
;
Stanford University(斯坦福大学)
;
Queen Mary University of London(伦敦玛丽女王大学)
;
University of Copenhagen(哥本哈根大学)
;
Trustible
;
EleutherAI
;
TU Darmstadt(达姆施塔特工业大学)
;
Weizenbaum Institute & Technical University of Munich(魏森鲍姆研究所与慕尼黑工业大学)
;
Harvard University(哈佛大学)
;
The Hebrew University of Jerusalem(耶路撒冷希伯来大学)
;
Iowa State University(爱荷华州立大学)
;
IBM Research(IBM研究院)
;
University of Chicago(芝加哥大学)
;
Independent(独立)
;
Berkeley AI Safety Institute (BASIS)(伯克利人工智能安全研究所)
;
Simula
;
University of Edinburgh(爱丁堡大学)
;
ETH Zurich & ETH AI Center(苏黎世联邦理工学院与ETH AI中心)
;
Oxford Internet Institute(牛津互联网研究所)
;
Amherst College(阿默斯特学院)
;
University of Nebraska(内布拉斯加大学)
;
Syntony Research
;
McGill University(麦吉尔大学)
;
Evals Consensus
;
Israel Institute of Technology(以色列理工学院)
;
IOL.Learn & Zuse Institute Berlin(IOL.Learn与柏林祖泽研究所)
;
Georgia Institute of Technology(佐治亚理工学院)
;
Quebec AI Institute, Université de Montréal(魁北克人工智能研究所,蒙特利尔大学)
;
University of Notre Dame(圣母大学)
;
Georgetown University(乔治城大学)
;
DHBW Stuttgart(斯图加特双元制大学)
;
Massachusetts Institute of Technology(麻省理工学院)