Lower-Resource, Higher Scores: Language Bias in LLM Evaluators
语言模型评估器在不同语言间存在偏差
机构 * University of Cambridge(剑桥大学) ; Language Technology Lab(语言技术实验室)
AI总结 研究发现语言模型评估器在多语言环境中存在偏差,不同语言评分差异显著,与语言资源水平相关,成对准确率无法检测到这些偏差,还探究了资源少的语言得分高的原因,揭示了语言层面的结构错位。
高校专区
语言模型评估器在不同语言间存在偏差
机构 * University of Cambridge(剑桥大学) ; Language Technology Lab(语言技术实验室)
AI总结 研究发现语言模型评估器在多语言环境中存在偏差,不同语言评分差异显著,与语言资源水平相关,成对准确率无法检测到这些偏差,还探究了资源少的语言得分高的原因,揭示了语言层面的结构错位。
重新定义AI失控:它是什么,如何拥有,如何失去
机构 * Oxford Martin AI Governance Initiative AI Standards Lab(牛津马丁人工智能治理倡议人工智能标准实验室) ; Centre for the Study of Existential Risk, University of Cambridge(存在风险研究中心,剑桥大学) ; Institute of Mathematics Education, University of Cologne(数学教育研究所,科隆大学) ; Cornell University(康奈尔大学)
AI总结 本文通过将控制锚定于“设定和获取目标”,建立控制的工作定义,探讨控制如何被失去、AI如何导致失控,并提出维持控制的建议。
Comments 64 pages
基于LLM代理的临床评分系统自动构建
机构 * DAMTP, University of Cambridge, Cambridge, UK(剑桥大学 DAMTP 实验室,剑桥,英国)
AI总结 提出AgentScore方法,利用大语言模型进行语义引导的规则搜索与验证,自动构建符合临床部署约束的加权评分系统,在多个任务上优于现有方法。
数据可靠性评分
机构 * Harvard University(哈佛大学) ; University of Cambridge(剑桥大学) ; George Mason University(乔治·梅森大学)
AI总结 研究在无法获取真实情况时评估数据集可靠性的问题,提出Gram行列式分数,通过衡量描述观测数据和实验结果的向量所跨体积来评估,实验表明该分数能有效捕捉不同观测过程中的数据质量,具有实验不可知论特性。
Comments 43 pages, 17 figures