arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Columbia University(哥伦比亚大学)

2026-06-17 至 2026-06-17 共收录 2
2606.17426 2026-06-17 stat.ML cs.LG math.PR 新提交

Bounded Difference Concentration for Infinitely Exchangeable Sequences with Applications to AI Benchmark Uncertainty

无限可交换序列的有界差分集中不等式及其在AI基准不确定性中的应用

Fangyuan Lin, Spencer Frei, Victor H. de la Pena

机构 * Department of Statistics, Columbia University(哥伦比亚大学统计系) Google DeepMind(谷歌DeepMind)

AI总结 通过de Finetti测度分解有界差分函数的偏差,提出有效方差代理的集中不等式,并证明零和线性对比中潜在混合项完全抵消,应用于AI基准如MMLU的不确定性量化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17773 2026-06-17 stat.ME cs.AI cs.LG

How Many Human Survey Respondents is a Large Language Model Worth? An Uncertainty Quantification Perspective

大型语言模型值得模拟多少人意见?从不确定性量化角度出发

Chengpiao Huang, Yuhang Wu, Kaizheng Wang

机构 * Department of IEOR, Columbia University(哥伦比亚大学工业工程与运筹学系) Decision, Risk, and Operations Division, Columbia Business School(哥伦比亚商学院决策、风险与运营分校) Department of IEOR and Data Science Institute, Columbia University(哥伦比亚大学工业工程与运筹学系及数据科学研究所)

AI总结 本文从不确定性量化角度出发,提出了一种框架,将LLM模拟的响应转换为人类响应总体参数的可靠置信集,通过量化人类-LLM不一致带来的不确定性。关键设计是模拟响应的数量:过多会导致置信集过窄且覆盖性差,过少则导致置信集过宽且信息不足。本文提出了一种数据驱动的方法,自适应选择模拟样本量以实现名义平均覆盖性,无论LLM的模拟保真度或置信集构建过程如何。所选样本量进一步反映了LLM能代表的有效人类人口规模,提供了其模拟保真度的定量度量。实验表明不同LLM和领域存在异质性模拟保真度。

Comments 63 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏