Beyond the Final Layer: Intermediate Representations for Better Multilingual Calibration in Large Language Models
机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室)
专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室)
专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL
机构 * University of Utah(犹他大学) ; Monash University(莫纳什大学) ; Texas A&M University(德克萨斯农工大学)
专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.AI
专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.LG
机构 * Fermi National Accelerator Laboratory(费米国家加速器实验室) ; Department of Astronomy and Astrophysics, University of Chicago(芝加哥大学天文学与天体物理学系) ; Kavli Institute for Cosmological Physics, University of Chicago(芝加哥大学凯弗利宇宙物理研究所)
专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.LG
专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.AI
专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI
Comments Accepted to 11th ACM International Workshop on Security and Privacy Analytics (IWSPA 2025)
专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL
专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL
专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL
Comments 13 pages, 3 figures
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
Comments Published at NeurIPS 2024
专题命中 幻觉与事实性 :alignment(abstract);RLHF(abstract);分类 cs.CL
Comments EMNLP 2024
专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.CL
Comments 9 pages
专题命中 幻觉与事实性 :alignment(abstract);RLHF(abstract);分类 cs.LG
Comments NeurIPS 2023. Code available at: https://github.com/ngruver/llmtime
专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL
专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.LG
Comments Accepted at International Conference on Machine Learning (ICML) 2024
专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.AI
Comments Accepted at CVPR 2024
专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI、cs.CY
Comments 40 pages
专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL
Comments 5 pages, ACL Findings 2023
专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.LG
专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.LG
Comments Source code is available at \url{https://github.com/jylins/hood}
专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.CL
Comments 8 pages
通过选择性预测使语言模型对齐
机构 * Department of Computer Science and Engineering(计算机科学与工程系) ; Bioinformatics and Computational Biology Program(生物信息学与计算生物学项目) ; Division of Biostatistics and Health Data Science(生物统计学与健康数据科学部) ; University of Minnesota Twin Cities(明尼苏达大学双城分校)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG;safety(comments)
AI总结 研究聚焦提升语言模型可靠性,采用选择性预测策略,在模型训练后对齐阶段,提出基于强化学习的框架RLSR,以风险-覆盖曲线下面积为目标,在域内域外任务中风险-覆盖权衡表现更好。
Comments Accepted by ICML 2026 Agents in the Wild: Safety, Security, and Beyond Workshop, Project Page: https://sun-umn.github.io/RLSR
超越均值:从小型试点数据对齐基于LLM的调查模拟器的三轴保真度
专题命中 幻觉与事实性 :alignment(abstract,comments);分类 cs.CL、cs.CY、cs.LG
AI总结 针对LLM模拟社会调查响应时的系统偏差,提出结构、边际和个体三轴保真度框架,通过提示、修正和微调三种方法对比,发现微调小型试点数据可实现平衡保真度,但保真度水平因子样本而异。
Comments 11 pages, 8 tables, 3 figures; Pluralistic Alignment @ ICML 2026 Workshop
通过不确定性校准微调增强大语言模型的信任
机构 * Capital One, AI Labs(Capital One人工智能实验室) ; Wayve Technologies(Wayve技术公司) ; Intel Corporation(英特尔公司)
专题命中 幻觉与事实性 :trustworthy(abstract,comments);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出一种不确定性感知微调方法,用于提升大语言模型在自然语言生成任务中的不确定性估计能力,从而提高生成响应的可信度并减少幻觉现象。
Comments ICLR 2026 Trustworthy AI workshop
在奉承式微调下校准崩溃:奖励黑客如何破坏大语言模型的不确定性量化
机构 * Cambridge AI Safety Hub (CAISH)(剑桥人工智能安全中心)
专题命中 幻觉与事实性 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG;trustworthy(comments)
AI总结 研究探讨了在强化学习从人类反馈(RLHF)等方案中,奉承式微调对校准的影响,发现GRPO微调导致校准退化,尽管效果不显著,但经矩阵缩放后仍保留较高校准误差。
Comments Accepted at the AISTATS 2026 Workshop on Towards Trustworthy Predictions: Theory and Applications of Calibration for Modern AI. 14 Pages
专题命中 幻觉与事实性 :DPO(abstract,comments);分类 cs.CL、cs.AI、cs.LG
Comments repo: https://github.com/Mr-Loevan/HSA-DPO
放大并不意味着具有预测性:思考模型中的推理行为
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Stanford University(斯坦福大学)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究揭示思考模型存在“放大-提升差距”,即面向推理的训练放大了与正确性关联弱的推理行为,却未放大高提升值的关键行为,推动了过程级推理目标的研究。
Comments Published in COLM 2026
MMAligner:通过表示校准保护多模态大语言模型
专题命中 幻觉与事实性 :alignment(abstract);safety(abstract)
AI总结 MMAligner通过校准多模态大语言模型的表示,将不安全多模态输入的拒绝率提升至99%,仅造成不足2%的效用下降,显著优化了安全与效用的权衡。
Comments To Appear in the Proceedings of The ACM Conference on Computer and Communications Security (CCS), 2026
TerraNova:人类世的基础模型
机构 * Politecnico di Milano(米兰理工大学) ; RFF-CMCC European Institute on Economics and the Environment (EIEE)(RFF-CMCC欧洲经济与环境研究所) ; Euro-Mediterranean Center on Climate Change (CMCC)(欧洲地中海气候变化中心)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG
AI总结 TerraNova是适配原生几何的基础模型,融合地球物理与社会数据,可重建密集场、适配未见变量,兼具地理空间编码能力与国家层面功能。
Comments 32 pages, 16 figures. Supplementary Information (full methodological specification, ablation programme, extended results, computational cost; 157 pages) available at the project page: https://carlosrodriguezpardo.es/projects/TerraNova/
自信流形:语言模型中正确性表示的几何结构
机构 * University College London(伦敦大学学院)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究揭示语言模型正确性表示的几何结构,发现低维子空间中的质心距离与探测器性能一致,表明检测是几何而非学习过程。