Uncertainty quantification for trustworthy deep learning: Methods and measures
面向可信深度学习的不确定性量化:方法与度量
专题命中 幻觉与事实性 :trustworthy(title);safety(abstract);分类 cs.LG
AI总结 本综述针对深度学习的不确定性量化,梳理五大类方法及相关任务,整合评估框架,还探讨大语言模型不确定性与开放研究方向,为可信深度学习提供结构化批判性参考。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
面向可信深度学习的不确定性量化:方法与度量
专题命中 幻觉与事实性 :trustworthy(title);safety(abstract);分类 cs.LG
AI总结 本综述针对深度学习的不确定性量化,梳理五大类方法及相关任务,整合评估框架,还探讨大语言模型不确定性与开放研究方向,为可信深度学习提供结构化批判性参考。
自信流形:语言模型中正确性表示的几何结构
机构 * University College London(伦敦大学学院)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究揭示语言模型正确性表示的几何结构,发现低维子空间中的质心距离与探测器性能一致,表明检测是几何而非学习过程。
非对称通信:大语言模型与语言游戏
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 本文通过提出非对称通信框架,纠正了AI讨论对大语言模型的错误属性投射,将相关现象重新归类为接收方一侧的现象,为AI治理提供了启示,明确对齐是制度约束工程,责任归人类机构。
伊斯兰研究中的人工智能与真实性:对生成式人工智能在古兰经、圣训及教法知识中的可靠性、幻觉及来源保真度的批判性评估
机构 * School of Computer Science, The University of Sydney(悉尼大学计算机学院) ; Macquarie University(麦考瑞大学) ; The University of New South Wales(新南威尔士大学)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI
AI总结 本研究评估6款主流生成式AI在伊斯兰知识领域的可靠性,发现其仅适用于伊斯兰入门学习辅助,需验证后才可用于宗教指导或学术研究,为相关群体提供实践指导。
测量社交媒体文本中的人类价值表达:校准的LLM标注与编码器迁移
机构 * Independent researcher, Lisbon, Portugal(独立研究者,里斯本,葡萄牙) ; University of Waterloo, ON, Canada(滑铁卢大学,安大略省,加拿大)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL
AI总结 本研究使用校准的LLM标注和软标签训练,将基于Schwartz人类基本价值理论的社交媒体文本价值表达迁移到编码器模型,实现可扩展预测。
面向社交媒体中统一的多模态虚假信息检测:基准数据集与基线模型
机构 * School of Computer Science and Information Engineering, Hefei University of Technology(计算机科学与信息工程学院,合肥工业大学) ; School of Computer Science and Technology, Northwestern Polytechnical University(计算机科学与技术学院,西北工业大学)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI
AI总结 该研究构建了含9.8万样本的OmniFake基准数据集,提出UMFDet框架,实现对人工与AI生成两类多模态虚假内容的统一检测,性能优于专用基线。