2602.15210
2026-02-27
cs.LG
70%
ÜberWeb: Insights from Multilingual Curation for a 20-Trillion-Token Dataset
ÜberWeb: 多语言编纂对20万亿token数据集的洞察
DatologyAI, :, Aldo Gael Carranza, Kaleigh Mentzer, Ricardo Pio Monti, Alex Fang, Alvin Deng, Amro Abbas, Anshuman Suri, Brett Larsen, Cody Blakeney, Darren Teh, David Schwab, Diego Kiner, Fan Pan, Haakon Mongstad, Haoli Yin, Jack Urbanek, Jason Lee, Jason Telanoff, Josh Wills, Luke Merrick, Maximilian Böther, Parth Doshi, Paul Burstein, Pratyush Maini, Rishabh Adiga, Siddharth Joshi, Spandan Das, Tony Jiang, Vineeth Dorna, Zhengping Wang, Bogdan Gaza, Ari Morcos, Matthew Leavitt
专题命中
预训练与数据
:foundation model(abstract);pretraining(abstract);分类 cs.LG
AI总结
通过多语言数据编纂优化20万亿token数据集,显著提升多语言模型性能并降低计算需求。