BenHalluEval: A Multi-Task Hallucination Evaluation Framework for Large Language Models on Bengali
BenHalluEval:孟加拉语大语言模型的多任务幻觉评估框架
Shefayat E Shams Adib, Ahmed Alfey Sani, Ekramul Alam Esham, Ajwad Abrar, Ishmam Tashdeed, Md Taukir Azam Chowdhury
机构
*
Department of Computer Science and Engineering, Islamic University of Technology(伊斯兰科技大学计算机科学与工程系)
;
Department of Computer Science and Engineering, University of California(加州大学计算机科学与工程系)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);prompting(abstract)
Target-Side Paraphrase Augmentation for Sign Language Translation with Large Language Models
面向手语翻译的大语言模型目标端释义增强
Pedro Dal Bianco, Jean Paul Nunes Reinhold, Oscar Stanchi, Facundo Quiroga, Franco Ronchetti, Ulisses Brisolara Corrêa
机构
*
III-LIDI Universidad Nacional de La Plata(III-LIDI国立拉普拉塔大学)
;
CDTEC, Federal University of Pelotas(CDTEC,联邦 Pelotas 大学)
;
CONICET III-LIDI
;
Comision de Investigaciones Cientificas Universidad Nacional de La Plata(科学委员会国立拉普拉塔大学)
;
Universidade Federal de Pelotas(联邦 Pelotas 大学)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
CommentsThis submission has been withdrawn because it has been superseded by a substantially revised and expanded version, available as arXiv:2607.27373. Please refer to and cite the newer version
MOSAIC: Unveiling the Moral, Social and Individual Dimensions of Large Language Models
MOSAIC:揭示大型语言模型的道德、社会和个体维度
Erica Coppolillo, Emilio Ferrara
机构
*
University of Southern California(南加州大学)
;
University of Calabria and ICAR-CNR(卡利亚里大学和ICAR-CNR)
;
Thomas Lord Department of Computer Science(托马斯·劳德计算机科学系)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI
Commentsv2: substantially revised and retitled; withdraws the variance-compression and transgender-suppression results and adds a pre-registered decoding control. 21 pages, 8 figures, 7 tables
Addressing Benchmarking Gaps in Large Language Models for Health and Medicine with Dynamic Red-Teaming
超越基准:动态、自动和系统化的红队代理用于可信的医疗语言模型
Jiazhen Pan, Bailiang Jian, Paul Hager, Yundi Zhang, Che Liu, Friederike Jungmann, Hongwei Bran Li, Julian Canisius, Chenyu You, Junde Wu, Jiayuan Zhu, Fenglin Liu, Yuyuan Liu, Niklas Bubeck, Moritz Knolle, Chen, Chen, Christian Wachinger, Zhenyu Gong, Cheng Ouyang, Georgios Kaissis, Benedikt Wiestler, Daniel Rueckert
机构
*
Technical University of Munich (TUM)(慕尼黑技术大学)
;
University of Oxford(牛津大学)
;
TUM University Hospital(慕尼黑技术大学医院)
;
Imperial College London(伦敦帝国理工学院)
;
Harvard Medical School(哈佛医学院)
;
Stony Brook University(史泰兹布鲁克大学)
;
Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)
;
University of Sheffield(谢菲尔德大学)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG
Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings
丢弃少量偏好可以改变大型语言模型的排名
Jenny Y. Huang, Yunyi Shen, Dennis Wei, Tamara Broderick
机构
*
Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology(麻省理工学院电子工程与计算机科学系)
;
MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)
;
IBM Research(IBM研究院)
专题命中
评测与基准
:LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.LG
机构
*
Independent Researcher(独立研究者)
;
Hunan University(湖南大学)
;
Shenzhen Kaihong Digital Industry Development Co., Ltd.(深圳凯鸿数字产业开发有限公司)
;
Central University of Finance and Economics(中央财经大学)
;
Chongqing University(重庆大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Stevens Institute of Technology(斯蒂文斯理工学院)
;
Cornell University(康奈尔大学)
;
Oak Ridge National Laboratory(橡树岭国家实验室)
;
Zhengzhou University of Light Industry(郑州轻工业大学)
;
Xidian University(西安电子科技大学)
;
The University of Texas at Dallas(德克萨斯大学达拉斯分校)
;
AI Safety Research Lab, Institute of Advanced Computing(高级计算研究所人工智能安全研究实验室)
;
University of Malaya(马来亚大学)
;
Emory University(埃默里大学)
;
Department of Nephrology, Affiliated Hospital of Guangdong Medical University(广东医学院附属医院肾内科)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL