Are LLM Evaluators Really Narcissists? Sanity Checking Self-Preference Evaluations
LLM评估者真的是自恋者吗?对自我偏好评估的健全性检查
Dani Roytburg, Matthew Bozoukov, Matthew Nguyen, Jou Barzdukas, Mackenzie Puig-Hall, Narmeen Oozeer
机构
*
Department of Machine Learning, Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学机器学习系)
;
Department of Computer Science and Engineering, University of California San Diego, La Jolla, CA, USA(加州大学圣地亚哥分校计算机科学与工程系)
;
Department of Computer Science, University of Virginia, Charlottesville, VA, USA(弗吉尼亚大学计算机科学系)
;
Martian Research, San Francisco, California, USA(火星研究公司)
;
Apart Research, San Francisco, California, USA(Apart研究公司)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)
Random Rule Forest (RRF): Interpretable and Manageable Ensembles of LLM-Generated Questions for Predicting Success from Unstructured Data
随机规则森林 (RRF): 基于LLM生成问题的可解释且可控集成方法用于从非结构化数据预测成功
Ben Griffin, Aaron Ontoyin Yin, Diego Vidaurre, Ugur Koyluoglu, Joseph Ternasky, Fuat Alican, Yigit Ihlamur
机构
*
University of Oxford, United Kingdom Aarhus University, Aarhus, Denmark Centre de Recerca Matem\`atica, Barcelona, Spain Oliver Wyman, New York, United States Vela Research, San Francisco, United States
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)
Ensemble Learning for Large Language Models in Text and Code Generation: A Survey
面向文本与代码生成的大语言模型集成学习综述
Mari Ashiga, Wei Jie, Fan Wu, Vardan Voskanyan, Fateme Dinmohammadi, Paul Brookes, Jingzhi Gong, Zheng Wang
机构
*
School of Computing and Engineering, University of West London(西伦敦大学计算机与工程学院)
;
Turing Intelligence Technology Limited(图灵智能科技有限公司)
;
School of Computer Science, University of Leeds(利兹大学计算机科学学院)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI-PAVE-Br: Leveraging Large Language Models for Enhanced Product Attribute Value Extraction through a Golden Set Approach
AI-PAVE-Br:利用大语言模型通过黄金集方法增强产品属性值提取
Murilo Gazzola, Hugo Gobato Souto, Samuel Silva, Júlia Schubert Peixoto, Felipe Siqueira, André Luis Pedroso de Morais, Caio Gomes
机构
*
LuizaLabs – Center of Excellence in Artificial Intelligence(LuizaLabs人工智能卓越中心)
;
Department of Computing and Informatics – Mackenzie Presbyterian University(计算与信息学系-麦金西 Presbyterian大学)
;
Institute of Mathematics and Computer Sciences - University of São Paulo(数学与计算机科学研究所-圣保罗大学)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
Business as Rulesual: A Benchmark and Framework for Business Rule Flow Modeling with LLMs
业务即规则:面向LLM的业务规则流建模基准与框架
Chen Yang, Ruping Xu, Ruizhe Li, Bin Cao, Jing Fan
机构
*
Zhejiang University of Technology(浙江工业大学)
;
Zhejiang Key Laboratory of Visual Information Intelligent Processing(浙江省视觉信息智能处理重点实验室)
;
University of Aberdeen(阿伯丁大学)
;
University of Birmingham(伯明翰大学)
专题命中
评测与基准
:LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)
SHERLOC: Structured Diagnostic Localization for Code Repair Agents
SHERLOC: 代码修复智能体的结构化诊断定位
Hovhannes Tamoyan, Sean Narenthiran, Erik Arakelyan, Mira Mezini, Boris Ginsburg
机构
*
NVIDIA(英伟达)
;
Santa Clara, CA 95051, USA(美国加利福尼亚州圣克拉拉)
;
TU Darmstadt(达姆施塔特工业大学)
;
National Research Center for Applied Cybersecurity ATHENE(国家应用网络安全研究中心 ATHENE)