Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization
通过低秩分解实现LLM评估中的最佳模型识别
Elad Tolochinsky, Yaniv Tenzer, Yaniv Romano
机构
*
Department of Computer Science, Technion – Israel Institute of Technology(计算机科学系,技术离子理工学院)
;
Department of Electrical and Computer Engineering, Technion – Israel Institute of Technology(电气与计算机工程系,技术离子理工学院)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG
ER-Reason: A Benchmark Dataset for LLM Clinical Reasoning in the Emergency Room
ER-Reason:用于急诊科大型语言模型临床推理的基准数据集
Nikita Mehandru, Niloufar Golchini, Namrata Garg, Kathy T. LeSaint, Christopher J. Nash, Anu Ramachandran, Travis Zack, Liam G. McCoy, Adam Rodman, David Bamman, Melanie Molina, Ahmed Alaa
机构
*
University of California, Berkeley(加州大学伯克利分校)
;
University of California, San Francisco(加州大学旧金山分校)
;
Duke University(杜克大学)
;
University of Alberta(阿尔伯塔大学)
;
Beth Israel Deaconess Medical Center(贝斯以色列德aconess医疗中心)
;
UC Berkeley and UCSF(伯克利大学和旧金山分校)
专题命中
评测与基准
:LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL
Can Language Models Analyze Data? Evaluating Large Language Models for Question Answering over Datasets
语言模型能分析数据吗?评估大型语言模型在数据集上的问答性能
Andreas Xenofontos, Pavlos Fafalios
机构
*
School of Production Engineering and Management, Technical University of Crete(生产工程与管理学院,希腊克里特技术大学)
;
Institute of Computer Science, Foundation for Research and Technology - Hellas(计算机科学研究所,希腊基础研究与技术研究院)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI
WaferSAGE: Large Language Model-Powered Wafer Defect Analysis via Synthetic Data Generation and Rubric-Guided Reinforcement Learning
WaferSAGE:基于大语言模型的晶圆缺陷分析:通过合成数据生成与评分引导的强化学习
Ke Xu, Zhongyuan Lian
机构
*
Shanghai Huahong Grace Semiconductor Manufacturing Corporation(上海华虹格瑞半导体制造有限公司)
;
Dept. of Automation, School of Information Science and Engineering, East China University of Science and Technology(自动化系,信息科学与工程学院,东华大学)
专题命中
评测与基准
:language model(title,abstract);large language model(title);LLM(abstract,abstract_cn);分类 cs.AI
IntroLM: Introspective Language Models via Prefilling-Time Self-Evaluation
IntroLM:通过预填充阶段自我评估实现反思语言模型
Hossein Hosseini Kasnavieh, Gholamreza Haffari, Chris Leckie, Adel N. Toosi
机构
*
DisNet Lab, School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算机与信息系统学院DisNet实验室)
;
School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算机与信息系统学院)
;
Department of Data Science & AI, Monash University, Australia(墨尔本大学数据科学与人工智能系)
专题命中
评测与基准
:language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
机构
*
Department of Computer Science, University of Texas at El Paso(德克萨斯大学埃尔帕索分校计算机科学系)
;
School of Computing, Southern Illinois University Carbondale(南方伊利诺伊大学卡罗尔丹分校计算学院)
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
Do Benchmarks Underestimate LLM Performance? Evaluating Hallucination Detection With LLM-First Human-Adjudicated Assessment
基准是否低估了大语言模型的性能?通过大语言模型优先的人类仲裁评估来评估幻觉检测
I. F. Atasoy, B. Mutlu, E. A. Sezer, A. Wahdan
机构
*
Department of Computer Engineering, Hacettepe University(哈切塔佩大学计算机工程系)
;
Department of Computer Engineering, Ankara University(安卡拉大学计算机工程系)
;
Zephlen AI and Information Technologies Inc.(泽夫伦人工智能与信息技术公司)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Bringing Multimodal Large Language Models to Infrared-Visible Image Fusion Quality Assessment
将多模态大语言模型引入红外-可见图像融合质量评估
Yuchen Guo, Junli Gong, Yao Lu, Xintong Xu, Yiuming Cheung, Weifeng Su
机构
*
Northwestern University(西北大学)
;
Northeastern University(东北大学)
;
University of Washington(华盛顿大学)
;
Hong Kong Baptist University(香港 Baptist大学)
;
Beijing Normal - Hong Kong Baptist University(北京师范大学-香港 Baptist大学)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract)
Human-LLM Dialogue Improves Diagnostic Accuracy in Emergency Care
人类与大语言模型对话提高急诊护理的诊断准确性
Burcu Sayin, Ngoc Vo Hong, Ipek Baris Schlicht, Jacopo Staiano, Pasquale Minervini, Sara Allievi, Nicola Susca, Nicola Osti, Alberto Maino, Vito Racanelli, Andrea Passerini
机构
*
Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系)
;
Department of Medicine, Azienda Sanitaria Universitaria Integrata del Trentino (ASUIT)(特伦托大学整合卫生机构医学部)
;
Center for Medical Sciences (CISMed), University of Trento(特伦托大学医学科学中心)
;
Universitat Politècnica de València(瓦伦西亚理工大学)
;
The University of Edinburgh(爱丁堡大学)