The First ChineseBabyLM Challenge: training data-efficient and cognitively plausible language models for Chinese
首个中文BabyLM挑战:训练数据高效且认知合理的中文语言模型
机构 * Princeton University(普林斯顿大学) ; Shanghai Jiao Tong University(上海交通大学) ; Chinese Academy of Sciences(中国科学院) ; Columbia University(哥伦比亚大学) ; Beijing Normal University(北京师范大学) ; Tsinghua University(清华大学) ; University of California San Diego(加利福尼亚大学圣地亚哥分校) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL
AI总结 首个中文BabyLM挑战将在2026年自然语言处理与中文计算会议举办,要求用1亿中文词元从头训练语言模型,在自然语言理解、认知对齐和汉字知识三轨道评估,不限分词器、模型架构和训练轮数。
Comments 8 pages, 4 tables; work in progress