Sound Probabilistic Safety Bounds for Large Language Models
大语言模型的可靠概率安全边界
机构 * University of Oxford(牛津大学) ; Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) ; University of Birmingham(伯明翰大学)
AI总结 研究提出框架计算大语言模型生成有害输出概率的严格边界,利用克洛普 - 皮尔逊置信区间,通过潜在空间特征优先探索有害分支,能高效计算可靠下界,实验验证方法有效性,为模型评估和认证提供新途径。
Comments The Initial version of this manuscript has been available on OpenReview, see https://openreview.net/forum?id=papImkPLf5