An Engineering Journey Training Large Language Models at Scale on Alps: The Apertus Experience
在Alps上规模化训练大型语言模型的工程之旅:Apertus经验
Jonathan Coles, Stefano Schuppli, Lukas Drescher, Fawzi Roberto Mohamed, Elia Palme, Henrique Mendonça, Miguel Gila, Mark Klein, Maxime Martinasso, Joost VandeVondele, Torsten Hoefler, Thomas Schulthess, Josh Romero, Igor Gorodetsky, Ryan Hankins, Isa Wazirzada, Martin Jaggi, Antoine Bosselut, Imanol Schlag, Antoni-Joan Solergibert i Llaquet, Alejandro Hernández Cano, Theofilos Ioannis Manitaras, Nicholas John Browning
专题命中
后训练与偏好优化
:large language model(title,abstract);language model(title,abstract);foundation model(abstract);post-training(abstract)
SPG: Sandwiched Policy Gradient for Masked Diffusion Language Models
SPG:用于遮蔽扩散语言模型的夹心策略梯度
Chenyu Wang, Paria Rashidinejad, DiJia Su, Song Jiang, Sid Wang, Siyan Zhao, Cai Zhou, Shannon Zejiang Shen, Feiyu Chen, Tommi Jaakkola, Yuandong Tian, Bo Liu
Debate to Align: Reliable Entity Alignment through Two-Stage Multi-Agent Debate
辩论以对齐:通过双阶段多智能体辩论实现可靠的实体对齐
Cunda Wang, Ziying Ma, Po Hu, Weihua Wang, Feilong Bao
机构
*
Hubei Provincial Key Laboratory of Artificial Intelligence and Smart Learning, Central China Normal University, Wuhan, China(湖北人工智能与智能学习省级重点实验室,中央财经大学,武汉,中国)
;
School of Computer Science, Central China Normal University, Wuhan, China(中央财经大学计算机科学学院,武汉,中国)
;
National Language Resources Monitoring and Research Center for Network Media, Central China Normal University, Wuhan, China(网络媒体语言资源监测与研究中心,中央财经大学,武汉,中国)
;
College of Computer Science, Inner Mongolia University, Hohhot, China(内蒙古大学计算机学院,呼和浩特,中国)
;
National and Local Joint Engineering Research Center of Intelligent Information Processing Technology for Mongolian, Inner Mongolia University, Hohhot, China(蒙古语智能信息处理技术国家与地方联合工程研究中心,内蒙古大学,呼和浩特,中国)
;
Inner Mongolia Key Laboratory of Multilingual Artificial Intelligence Technology, Inner Mongolia University, Hohhot, China(内蒙古多语言人工智能技术重点实验室,内蒙古大学,呼和浩特,中国)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL
CommentsThis is Paper 5 in a 10-paper series on Super-Alignment via Wuxing Institutional Architecture. It shifts alignment from external behavioral correction to internal institutional design, making aligned behavior the lowest-cost equilibrium
机构
*
The Chinese University of Hong Kong(香港中文大学)
;
University of International Relations(国际关系大学)
;
Tencent Jarvis Lab(腾讯Jarvis实验室)
;
Westlake University(西湖大学)
;
Ministry of Education Key Laboratory of High Confidence Software Technologies, CUHK(教育部高可信软件技术重点实验室,香港中文大学)
专题命中
后训练与偏好优化
:large language model(abstract);language model(abstract);分类 cs.CL