Harnessing Multiple Large Language Models: A Survey on LLM Ensemble
利用多个大语言模型:关于LLM集成的综述
Zhijun Chen, Xiaodong Lu, Jingzheng Li, Pengpeng Chen, Zhuoran Li, Kai Sun, Yuankai Luo, Qianren Mao, Ming Li, Likang Xiao, Dingqi Yang, Xiao Huang, Yikun Ban, Hailong Sun, Philip S. Yu
机构
*
State Key Laboratory of Complex & Critical Software Environment, Beihang University, Beijing, China(复杂与关键软件环境国家重点实验室,北京航空航天大学,北京,中国)
;
Zhongguancun Laboratory, Beijing, China(中关村实验室,北京,中国)
;
Aviation System Engineering Institute of China, Beijing, China(中国航空系统工程研究院,北京,中国)
;
Xi’an Jiaotong University, Xi’an, China(西安交通大学,西安,中国)
;
Nanjing University, Nanjing, China(南京大学,南京,中国)
;
Tsinghua University, Beijing, China(清华大学,北京,中国)
;
University of Macau, Macau SAR, China(澳门大学,澳门特别行政区,中国)
;
The Hong Kong Polytechnic University, Hong Kong, China(香港理工大学,香港,中国)
;
University of Illinois at Chicago, Chicago, USA(伊利诺伊大学香槟分校,芝加哥,美国)
专题命中
评测与基准
:LLM(title,title_cn);large language model(title,abstract);language model(title,abstract);分类 cs.CL
REAL: Regression-Aware Reinforcement Learning for LLM-as-a-Judge
REAL: 面向LLM评判的回归感知强化学习
Yasi Zhang, Tianyu Chen, Mingyuan Zhou, Oscar Leong, Ying Nian Wu, Michal Lukasik
机构
*
University of California, Los Angeles(加州大学洛杉矶分校)
;
The University of Texas at Austin(得克萨斯大学奥斯汀分校)
;
Google Research Now at Google DeepMind(谷歌研究 现在在谷歌深Mind)
专题命中
评测与基准
:LLM(title,title_cn);SFT(summary_cn,abstract);large language model(abstract);language model(abstract)
An Empirical Evaluation of LLM-Generated Code Security Across Prompting Methods
LLM生成代码安全性的提示方法实证评估
Mohammed Kharma, Ahmed Sabbah, Mohammad Alkhanafseh, Mohammad Hammoudeh, David Mohaisen
机构
*
Department of Computer Science, Birzeit University(计算机科学系,巴勒斯坦比泽大学)
;
King Fahd University of Petroleum and Minerals(国王法赫德石油和矿物大学)
;
University of Central Florida(中央佛罗里达大学)
专题命中
评测与基准
:LLM(title,title_cn);prompting(title,abstract);large language model(abstract);language model(abstract)
Rethinking LLM-as-a-Judge: Representation-as-a-Judge with Small Language Models via Semantic Capacity Asymmetry
重新思考大语言模型作为评判器:通过语义能力不对称利用小语言模型进行表示作为评判器
Zhuochun Li, Yong Zhang, Ming Li, Yuelyu Ji, Yiming Zeng, Ning Cheng, Yun Zhu, Yanmeng Wang, Shaojun Wang, Jing Xiao, Daqing He
机构
*
Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司)
;
University of Pittsburgh(匹兹堡大学)
;
University of Maryland, College Park(马里兰大学学院公园分校)
;
University of Connecticut(康涅狄格大学)
专题命中
评测与基准
:LLM(title,abstract);language model(title,abstract);small language model(title);large language model(abstract)
Breaking the Mirror: Activation-Based Mitigation of Self-Preference in LLM Evaluators
打破镜像:基于激活的LLM评估者自我偏好缓解方法
Dani Roytburg, Matthew Bozoukov, Matthew Nguyen, Jou Barzdukas, Simon Fu, Narmeen Oozeer
机构
*
University of Virginia(弗吉尼亚大学)
;
University of California, San Diego(加州大学圣地亚哥分校)
;
Carnegie Mellon University(卡内基梅隆大学)
;
School of Computer Science(计算机科学学院)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);preference optimization(abstract)
Facial-Expression-Aware Prompting for Empathetic LLM Tutoring
面向情感的提示方法用于共情LLM辅导
Shuangquan Feng, Laura Fleig, Ruisen Tu, Philip Chi, Edmund Bu, Melinda Ozel, Junhua Ma, Teng Fei, Virginia R. de Sa
机构
*
Neurosciences Graduate Program, University of California San Diego(加州大学圣地亚哥分校神经科学研究生项目)
;
Department of Cognitive Science, University of California San Diego(加州大学圣地亚哥分校认知科学系)
;
Department of Computer Science and Engineering, University of California San Diego(加州大学圣地亚哥分校计算机科学与工程系)
;
Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电气与计算机工程系)
;
Department of Mathematics, University of California San Diego(加州大学圣地亚哥分校数学系)
;
Face the FACS
;
Halıcıoğlu Data Science Institute, University of California San Diego(Halıcıoğlu数据科学研究所)
专题命中
评测与基准
:LLM(title,title_cn);prompting(title);large language model(abstract);language model(abstract)
SciCustom: A Framework for Custom Evaluation of Scientific Capabilities in Large Language Models
SciCustom: 一个用于大型语言模型科学能力定制评估的框架
Yiyang Gu, Junwei Yang, Junyu Luo, Ye Yuan, Bin Feng, Yingce Xia, Shufang Xie, Kaili Liu, Bohan Wu, Qi Shi, Haoran Li, Beier Xiao, Zhiping Xiao, Xiao Luo, Weizhi Zhang, Philip S. Yu, Zequn Liu, Ming Zhang
机构
*
State Key Laboratory for Multimedia Information Processing, School of Computer Science, PKU-Anker LLM Lab, Peking University(多媒体信息处理国家重点实验室,计算机学院,PKU-Anker LLM实验室,北京大学)
;
Zhongguancun Academy(中关村学院)
;
IDEA
;
Xidian University(西安电子科技大学)
;
Peking University(北京大学)
;
University of Washington(华盛顿大学)
;
University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
;
University of Illinois Chicago(伊利诺伊大学芝加哥分校)
专题命中
评测与基准
:large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract);分类 cs.CL
CommentsAccepted at the ICML 2026 workshops "Statistical Frameworks for Uncertainty in Agentic Systems" and "Combining Theory and Benchmarks: Towards a Virtuous Cycle to Understand and Guarantee Foundation Model Performance". 13 pages, 9 figures