HTMuon: Improving Muon via Heavy-Tailed Spectral Correction
HTMuon:通过重尾谱校正改进Muon
Tianyu Pang, Yujie Fang, Zihang Liu, Shenyang Deng, Lei Hsiung, Shuhua Yu, Yaoqing Yang
机构
*
Dartmouth College(达特茅斯学院)
;
Microsoft(微软)
;
International Computer Science Institute(国际计算机科学研究所)
;
University of California, Berkeley(加州大学伯克利分校)
;
Meta
Tom Kempton, Julia Rozanova, Parameswaran Kamalaruban, Maeve Madigan, Karolina Wresilo, Yoann L. Launay, David Sutton, Stuart Burrell
机构
*
University of Manchester, UK(曼彻斯特大学,英国)
;
Featurespace, a Visa Solution(Visa解决方案的Featurespace)
;
Risk and Security AI Lab, Visa Inc., UK(Visa公司的风险与安全AI实验室,英国)
;
University of Cambridge, UK(剑桥大学,英国)
专题命中
预训练与数据
:large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.LG
Slicing and Dicing: Configuring Optimal Mixtures of Experts
切片与切割:配置最优专家混合物
Margaret Li, Sneha Kudugunta, Danielle Rothermel, Luke Zettlemoyer
机构
*
Paul G Allen School of Computer Science(保罗·G·艾伦计算机科学学院)
;
University of Washington(华盛顿大学)
;
New York University(纽约大学)
;
Courant School of Data Science(科廷数据科学学院)
专题命中
预训练与数据
:large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG
Conditional misalignment: common interventions can hide emergent misalignment behind contextual triggers
条件性偏差:通用干预可以隐藏新兴偏差背后的情境触发
Jan Dubiński, Jan Betley, Anna Sztyber-Betley, Daniel Tan, Owain Evans
机构
*
Warsaw University of Technology(华沙技术大学)
;
NASK National Research Institute(NASK国家研究院)
;
Constellation
;
Truthful AI
;
University College London(伦敦大学学院)
;
Center on Long-Term Risk(长期风险中心)
;
UC Berkeley(伯克利大学)
Text to model via SysML: Automated generation of dynamical system computational models from unstructured natural language text via enhanced System Modeling Language diagrams
通过SysML生成动态系统模型:从无结构自然语言文本自动生成动态系统计算模型
Matthew Anderson Hendricks, Alice Cicirello
机构
*
Department of Engineering, University of Cambridge, Trumpington Street, Cambridge, UK(剑桥大学工程系,特鲁布里奇顿街,剑桥,英国)
专题命中
预训练与数据
:LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
机构
*
Yale University(耶鲁大学)
;
Broad Institute of MIT and Harvard(麻省理工学院-哈佛大学博德研究所)
;
Google DeepMind(谷歌DeepMind)
;
Stanford University(斯坦福大学)
;
Genentech(基因泰克)
;
University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
;
Cornell University(康奈尔大学)
;
Harvard University(哈佛大学)
专题命中
预训练与数据
:large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI
Augmenting Rating-Scale Measures with Text-Derived Items Using the Information-Determined Scoring (IDS) Framework
通过信息确定评分(IDS)框架用文本衍生项目增强评分尺度测量
Joe Watson, Ivan O'Connor, Chia-Wen Chen, Luning Sun, Fang Luo, David Stillwell
机构
*
Psychometrics Centre, Judge Business School, University of Cambridge(剑桥大学心理测量中心、剑桥大学商学院)
;
Faculty of Law, University of Cambridge(剑桥大学法学院)
;
School of Computer Science, University of Birmingham(伯明翰大学计算机科学学院)
;
Faculty of Psychology, Beijing Normal University(北京师范大学心理学学院)
专题命中
预训练与数据
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
机构
*
Saudi Data & AI Authority (SDAIA)(沙特数据与人工智能局)
;
Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)
;
Princess Nourah Bint Abdulrahman University (PNU)(普罗瑟·努拉·本·阿卜杜勒拉赫曼大学)
专题命中
预训练与数据
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
机构
*
Department of Jewish Literature, Bar-Ilan University(巴伊兰大学犹太文学系)
;
Department of Communication, Reichman University(雷赫曼大学传播系)
;
Faculty of Engineering, Bar-Ilan University(巴伊兰大学工程学院)
专题命中
预训练与数据
:large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI