MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages
MultiSynt/MT:跨36种语言翻译的万亿Token多平行预训练数据
Maximilian Idahl, Jörg Tiedemann, Sampo Pyysalo, David Salinas, Tomasz Galica, Shenbin Qian, Tudor Nicolae Mateiu, Zihao Li, Anna Lokrantz, Fedor Vitiugin, André F. T. Martins, Jenna Kanerva, Filip Ginter, Matthias Lindemann, Tim Isbister, Birger Moell, Jonas Lindh, Jan Hajič, Jenia Jitsev, Andrey Kutuzov, Stephan Oepen, Gema Ramírez-Sánchez
机构
*
ellamind
;
Leibniz University Hannover(莱布尼茨汉诺威大学)
;
University of Helsinki(赫尔辛基大学)
;
University of Turku(图尔库大学)
;
ELLIS Institute Tübingen(ELLIS 图宾根研究所)
;
Prior Labs
;
University of Oslo(奥斯陆大学)
;
Prompsit Language Engineering(Prompsit 语言工程公司)
;
AI Sweden
;
Instituto de Telecomunicações(电信研究所)
;
Instituto Superior Técnico(高等技术学院)
;
TransPerfect
;
Charles University(查理大学)
;
Ontocord
;
LAION
;
Juelich Supercomputing Center (JSC), Research Center Juelich (FZJ)(于利希超级计算中心 (JSC), 于利希研究中心 (FZJ))
A large-scale nanocrystal database with aligned synthesis and properties enabling generative inverse design
大规模纳米晶体数据库:对齐合成与性质实现生成式逆向设计
Kai Gu, Yingping Liang, Senliang Peng, Aotian Guo, Haizheng Zhong, Ying Fu
机构
*
MIIT Key Laboratory for Low-Dimensional Quantum Structure and Devices, School of Materials Sciences & Engineering, Beijing Institute of Technology(信息产业部低维量子结构与器件重点实验室,材料科学与工程学院,北京理工大学)
;
School of Computer Science and Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学)
专题命中
预训练与数据
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
Provably Protecting Fine-Tuned LLMs from Training Data Extraction while Preserving Utility
可证明地保护微调的LLM免受训练数据提取攻击同时保持效用
Tom Segal, Asaf Shabtai, Yuval Elovici
机构
*
Department of Software and Information Systems Engineering, Ben-Gurion University of the Negev, Beer Sheva, Israel(软件与信息系统工程系,内盖夫本·古里安大学,贝尔谢巴,以色列)
专题命中
预训练与数据
:LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.LG
Mind the Gap No More: Achieving Zero-Gap Multimodal Integration via One Tokenizer
不再有间隙:通过一个分词器实现零间隙多模态整合
Yanan Li, Christina Yi Jin, Yuan Jin, Manli Luo, Tie Xu, Shuai Jiao, Wei He, Qing Zhang
机构
*
Research Center for Frontier Fundamental Studies, Zhejiang Lab(前沿基础研究研究中心,浙江实验室)
;
Research Center for Scientific Data Hub, Zhejiang Lab(科学数据枢纽研究中心,浙江实验室)
专题命中
预训练与数据
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL