Calibration Drift Under Reasoning: How Chain-of-Thought Budgets Induce Overconfidence in Large Language Models
推理下的校准漂移:思维链预算如何导致大型语言模型过度自信
Prakul Sunil Hiremath, Harshit R. Hiremath
机构
*
Department of Computer Science and Engineering, Visvesvaraya Technological University, Belagavi(维斯瓦拉亚科技大学计算机科学与工程系,贝拉加维)
;
Department of Computer Science and Business System, SG Balekundri Institute of Technology, Belagavi(SG巴莱昆德里理工学院计算机科学与商业系统系,贝拉加维)
专题命中
推理与问题求解
:large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments31 pages, 4 figures, 3 tables. Introduces Calibration Drift Under Reasoning (CDUR) with theoretical analysis and preliminary experiments; includes CABStop; code and data available
Beyond representational alignment with brain-guided language models for robust reasoning
超越表征对齐:基于大脑引导的语言模型实现稳健推理
Mingqing Xiao, Kai Du, Zhouchen Lin
机构
*
State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(北京大学通用人工智能国家重点实验室、智能科学与技术学院)
;
Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系)
;
Microsoft Research Asia(微软亚洲研究院)
专题命中
推理与问题求解
:language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
机构
*
LMU Munich(慕尼黑大学)
;
Harvard University(哈佛大学)
;
University of Cambridge(剑桥大学)
;
Mina AI
;
Konrad Zuse School of Excellence in Reliable AI (relAI)(康拉德·楚泽可靠人工智能卓越学校(relAI))
专题命中
推理与问题求解
:large language model(title,comments);language model(title,comments);post-training(abstract);分类 cs.CL、cs.AI、cs.LG
Architecture-Aware Reinforcement Learning Makes Sliding-Window Attention Competitive in Math Reasoning
架构感知强化学习使滑动窗口注意力在数学推理中具有竞争力
Kai Liu, Peijie Dong, Xinchen Xie, Jianfei Gao, Qipeng Guo, Xiaowen Chu, Shaoting Zhang, Kai Chen
机构
*
Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(上海智能自主系统研究院,同济大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))
专题命中
推理与问题求解
:SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)
MODF-SIR: A Multi-agent Omni-modal Distilled Framework for Social Intelligence Reasoning
MODF-SIR:面向社交智能推理的多智能体全模态蒸馏框架
Shang Ma, Jisheng Dang, Wencan Zhang, Yifan Zhang, Bimei Wang, Hong Peng, Bin Hu, Qi Tian, Tat-Seng Chua
机构
*
School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院)
;
School of Medical Technology, Beijing Institute of Technology(北京理工大学医学技术学院)
;
Cloud and AI BU, Huawei(华为云与AI业务部)
;
School of Computing, National University of Singapore(新加坡国立大学计算机学院)
专题命中
推理与问题求解
:large language model(abstract);language model(abstract);foundation model(abstract);prompting(abstract)
RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning
RoboGPT-R1: 通过强化学习增强机器人任务规划
Jinrui Liu, Bingyan Nie, Boyu Li, Yaran Chen, Yuze Wang, Shunsen He, Haoran Li
机构
*
Institute of Automation, CASIA(中国科学院自动化研究所)
;
School of Artificial Intelligence, UCAS(中国科学技术大学人工智能学院)
;
Huawei Cloud Technology Co., Ltd(华为云技术有限公司)
专题命中
推理与问题求解
:SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
机构
*
School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算与信息系统学院)
;
SensiLab, Monash University, Australia(蒙纳士大学SensiLab)
From Consumption to Reflection: Designing Human-AI Relations for Stable Reasoning
从消费到反思:为稳定推理设计人-人工智能关系
Rikard Rosenbacke, Carl Rosenbacke, Victor Rosenbacke, Martin McKee
机构
*
Faculty of Medicine, Lund University(吕勒欧大学医学院)
;
Department of Economics, Lund University School of Economics and Management(吕勒欧大学经济学与管理学院经济系)
;
Department of Health Services Research and Policy, London School of Hygiene & Tropical Medicine(伦敦卫生与热带医学学院健康服务研究与政策系)
专题命中
推理与问题求解
:LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI