Measuring Faithfulness Depends on How You Measure: Classifier Sensitivity in LLM Chain-of-Thought Evaluation
衡量忠实性取决于如何测量:分类器敏感性在LLM链式推理评估中的应用
Richard J. Young
机构
*
University of Nevada, Las Vegas, Department of Management, Entrepreneurship and Technology, Lee Business School(内华达大学拉斯维加斯分校管理、创业与技术系,Lee商学院)
;
DeepNeuro AI
Dynamical Systems Theory Behind a Hierarchical Reasoning Model
层次推理模型背后的动力系统理论
Vasiliy A. Es'kin, Mikhail E. Smorkalov
机构
*
Department of Radiophysics, University of Nizhny Novgorod(尼日尼诺夫戈罗德大学无线电物理系)
;
Huawei Nizhny Novgorod Research Center(华为尼日尼诺夫戈罗德研究中心)
;
Skolkovo Institute of Science and Technology(斯克洛科夫科学与技术研究院)
专题命中
推理与问题求解
:large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
Lie to Me: How Faithful Is Chain-of-Thought Reasoning in Reasoning Models?
对我的谎言:推理模型中的思维链推理可信度如何?
Richard J. Young
机构
*
University of Nevada, Las Vegas, Department of Management, Entrepreneurship and Technology, Lee Business School(内华达大学拉斯维加斯分校,管理、创业与技术系,李商学院)
;
DeepNeuro AI
专题命中
推理与问题求解
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
I Came, I Saw, I Explained: Benchmarking Multimodal LLMs on Figurative Meaning in Memes
我来了,我看到了,我解释了:在表情包中评估多模态大语言模型的隐喻意义
Shijia Zhou, Saif M. Mohammad, Barbara Plank, Diego Frassinelli
机构
*
MaiNLP, Center for Information and Language Processing, LMU Munich(MaiNLP,信息与语言处理中心,慕尼黑大学)
;
Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)
;
National Research Council Canada(加拿大国家研究委员会)
专题命中
推理与问题求解
:large language model(abstract);language model(abstract);分类 cs.CL