LODESTAR: Trustworthy Entropy Is Navigated, Not Merely Measured -- Reinforced Polarizer Keeps a Frozen LLM from Being Confidently Misled by the Wrong Evidence
Benchmarking LLM Judges for Mobile Agent Evaluation
面向移动智能体评估的LLM评判基准测试
Ziqiang Wan, Li Gu, Zhixiang Chi, Zhi Liu, Seyed Mehdi Ayyoubzadeh, Yuanhao Yu, Yang Wang
机构
*
Mila – Québec AI Institute(米拉-魁北克人工智能研究所)
;
Concordia University(康考迪亚大学)
;
University of Toronto(多伦多大学)
;
Shanghai University(上海大学)
;
McMaster University(麦克马斯特大学)
机构
*
Department of Mechanical Engineering, University of Michigan, Ann Arbor, Michigan, USA(机械工程系,密歇根大学,安阿伯,密歇根州,美国)
;
Max-Planck-Institute for Sustainable Materials, Materials Informatics, Düsseldorf, Germany(可持续材料研究所,材料信息学,杜塞尔多夫,德国)
;
Mechanical Engineering, University of Michigan, Ann Arbor, Michigan, USA(机械工程,密歇根大学,安阿伯,密歇根州,美国)
专题命中
评测与基准
:LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI