Information-Theoretic Limits of Reliability and Scaling in Language Models
语言模型中可靠性和扩展性的信息论极限
机构 * Indian Institute of Management Bangalore(班加罗尔印度管理学院)
专题命中 预训练与数据 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI
AI总结 研究语言模型可靠性和扩展性的信息论极限,通过分析任务输出不确定性等因素得出缩放定律,指出LLM性能受训练数据或模型容量限制,还统一多种实际现象,提供生成语言模型性能极限的统一理论。
Comments 29 pages, 2 figures