Trusted Uncertainty in Large Language Models: A Unified Framework for Confidence Calibration and Risk-Controlled Refusal
大型语言模型中的可信不确定性:置信度校准与风险控制拒绝的统一框架
Markus Oehri, Giulia Conti, Kaviraj Pather, Alexandre Rossi, Laia Serra, Adrian Parody, Rogvi Johannesen, Aviaja Petersen, Arben Krasniqi
机构
*
University of Liechtenstein(列支敦士登大学)
;
University of the Republic of San Marino(圣马尔科共和国大学)
;
University of Mauritius(毛里求斯大学)
;
International University of Monaco(摩纳哥国际大学)
;
University of Andorra(安道尔大学)
;
University of Gibraltar(直布罗陀大学)
;
University of the Faroe Islands(法罗群岛大学)
;
Ilisimatusarfik (University of Greenland)(格陵兰岛研究所(格陵兰大学))
;
University of Prizren(普里兹伦大学)
Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results
Every Eval Ever:AI评估结果的统一模式与社区仓库
Jan Batzner, Sree Harsha Nelaturu, Damian Stachura, Anastassia Kornilova, Jon Crall, Tommaso Cerruti, Yanan Long, Yifan Mai, Sanchit Ahuja, Asaf Yehudai, Marek Šuppa, John P. Lalor, Oluwagbemike Olowe, Jatin Ganhotra, Brian H. Hu, Eliya Habba, Andrew M. Bean, Chang Liu, Sander Land, Steven Dillmann, Aniketh Garikaparthi, Elron Bandel, Saki Imai, James Edgell, Wm. Matthew Kennedy, Jenny Chim, Patrick Meusling, Asteria Kaeberlein, Venkata Ramachandra Karthik Chundi, Manasi Patwardhan, Martin Ku, Austin Meek, Leon Knauer, Brian Wingenroth, Srishti Yadav, Usman Gohar, Felix Friedrich, Michelle Lin, Jennifer Mickel, Arman Cohan, Stella Biderman, Irene Solaiman, Zeerak Talat, Anka Reuel, Mubashara Akhtar, Gjergji Kasneci, Avijit Ghosh, Leshem Choshen
机构
*
Technical University Munich(慕尼黑工业大学)
;
Munich Center for Machine Learning(慕尼黑机器学习中心)
;
Weizenbaum Institute(魏岑鲍姆研究所)
;
Zuse Institute Berlin(柏林祖泽研究所)
;
Evidence Prime
;
Trustible
;
Kitware
;
ETH Zurich(苏黎世联邦理工学院)
;
StickFlux Labs
;
Stanford University(斯坦福大学)
;
Northeastern University(东北大学)
;
IBM Research(IBM研究院)
;
Comenius University Bratislava(布拉迪斯拉发夸美纽斯大学)
;
Cisco(思科)
;
University of Notre Dame(圣母大学)
;
Hebrew University of Jerusalem(耶路撒冷希伯来大学)
;
University of Oxford(牛津大学)
;
Ohio University(俄亥俄大学)
;
Writer
;
TCS Research(塔塔咨询服务研究院)
;
Oxford University Press(牛津大学出版社)
;
Queen Mary University of London(伦敦玛丽女王大学)
;
Technical University Berlin(柏林工业大学)
;
University of Delaware(特拉华大学)
;
Cinemo
;
Johns Hopkins University(约翰霍普金斯大学)
;
University of Copenhagen(哥本哈根大学)
;
ELLIS(欧洲学习与智能系统实验室)
;
Iowa State University(爱荷华州立大学)
;
Meta FAIR
;
University of Montreal(蒙特利尔大学)
;
Mila Quebec AI Institute(Mila魁北克人工智能研究所)
;
EleutherAI
;
Yale University(耶鲁大学)
;
Hugging Face
;
University of Edinburgh(爱丁堡大学)
;
Harvard University(哈佛大学)
;
ETH AI Center(ETH人工智能中心)
;
MIT(麻省理工学院)
;
MIT-IBM Watson Lab(MIT-IBM沃森实验室)
VHDLSuite: Unified Pipeline for LLM VHDL Generation with Data Synthesis and Evaluation
VHDLSuite:面向LLM VHDL生成的统一流水线,包含数据合成与评估
Yijun Shen, Minghao Shao, Yichen Zhao, Zhuoyan Yu, Boyuan Chen, Yik-Cheung Tam, Muhammad Shafique
机构
*
Center for Data Science, NYU Shanghai, China(纽约市立大学上海分校数据科学中心)
;
NYU Tandon School of Engineering, USA(纽约大学Tandon工程学院)
;
NYU Abu Dhabi, UAE(纽约大学阿布扎比分校)
Deja Vu at Scale: Paraphrase-Robust Detection of Duplicate Gherkin Steps in Behaviour-Driven Software Testing with Sentence-Transformer Embeddings and a 1.1M-Step Open Benchmark
Comments28 pages, 2 figures, 4 tables. Submitted to Information and Software Technology (Elsevier). Tool, corpus, labelled benchmark, and rubric released at https://github.com/amughalbscs16/cukereuse-release under Apache-2.0
I'm Sorry Driver, I'm Afraid I Can't Do That: Appraising the Safety of LLMs within Automotive Contexts
抱歉,司机,恐怕我不能这么做:评估LLMs在汽车环境中的安全性
Shaun Feakins, Ibrahim Habli, Kim Littler, Robert Palin
机构
*
UKRI AI Centre for Doctoral Training in Safe Artificial Intelligence Systems (SAINTS)(英国研究理事会安全人工智能系统博士培训中心(SAINTS))
;
University of York(约克大学)
;
Jaguar Land Rover(捷克·陆罗恩)