arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-23 至 2026-06-23 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 7 篇

2606.21937 2026-06-23 cs.CY cs.AI cs.CL 新提交 82%

Latent Confidence Alignment for LLM Self-Assessment

潜在置信对齐用于大语言模型自我评估

Ting-Yu Chen, Tingting Yu, Pei-Cing Huang, Chan Hsu, Ming-Yen Lin, Yihuang Kang

机构 * Department of Information Management(信息管理系) National Sun Yat-Sen University(国立中山大学) Kaohsiung Medical University Hospital(高雄医学大学附设医院) Kaohsiung Medical University(高雄医学大学)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 提出基于Rasch模型的潜在置信对齐误差(LCAE)来评估LLM自我评估与潜在错误概率的一致性,并引入项目难度作为外部信号,实验表明该方法在不影响模型能力的情况下提升自我评估质量。

Comments 2026 IEEE 27th International Conference on Information Reuse and Integration for Data Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22181 2026-06-23 cs.LG 新提交 70%

Residue-Level Attributions in Protein Language Models Do Not Recover Allergen Epitopes

蛋白质语言模型中的残基级归因不能恢复过敏原表位

Jianzhou Yao, Anxiong Song, Katja Baerenfaller, Damir Zhakparov

机构 * Swiss Institute of Allergy and Asthma Research, Davos, Switzerland(瑞士过敏与哮喘研究所,达沃斯,瑞士) ETH Zurich, Zurich, Switzerland(苏黎世联邦理工学院,苏黎世,瑞士) Swiss Institute of Bioinformatics, Lausanne, Switzerland(瑞士生物信息学研究所,洛桑,瑞士)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本研究通过引入表位基准,评估蛋白质过敏原性模型的可解释性,发现分类器残基级归因与注释表位对齐不显著,模型可能依赖理化特征而非表位特异性机制。

Comments Accepted at the ICML 2026 Mechanistic Interpretability Workshop (peer-reviewed)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20676 2026-06-23 cs.CV cs.AI cs.CL 新提交 62%

Jury Duty: Calibration and Orientation Failures in MLLM-as-a-Judge Under Cultural Ambiguity

陪审团职责:文化模糊性下MLLM作为评判者的校准与定向失败

Daniel Lee, Harsh Sharma, Eunkyu Park, Pranav Narayanan Venkit, Jeonghwan Kim, Kah Mun Chia, Andreas Vlachos, Shafiq Joty

机构 * Salesforce AI Research(Salesforce AI 研究院) University of Cambridge(剑桥大学) University of Colorado Boulder(科罗拉多大学博尔德分校) Carnegie Mellon University(卡内基梅隆大学) UIUC(伊利诺伊大学厄巴纳-香槟分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 针对MLLM作为评判者在跨文化场景中的偏差问题,提出VOIR DIRE基准,通过分析校准失败(压缩尺度)和定向失败(默认一种文化规范),揭示模型偏向于更宽容的文化解读。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05126 2026-06-23 cs.CL cs.AI 版本更新 62%

Generalization of Fine-Tuned Uncertainty Communication and Metacognition in Large Language Models

微调后大语言模型的不确定性沟通与元认知的泛化

Mark Steyvers, Catarina Belem, Padhraic Smyth

机构 * Department of Cognitive Sciences, University of California, Irvine, United States(认知科学系,加州大学伊文斯顿分校,美国) Department of Computer Science, University of California, Irvine, United States(计算机科学系,加州大学伊文斯顿分校,美国)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究通过监督微调提升大语言模型不确定性沟通能力,发现领域内校准和判别改善,但任务间迁移有限,多任务训练可促进泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11973 2026-06-23 cs.CV cs.LG 版本更新 57%

Confidence-Uncertainty Boundary Calibration for Bayesian Deep Learning in Medical Image Analysis

医学图像分析中贝叶斯深度学习的置信-不确定性边界校准

Hua Xu, Julián D. Arias-Londoño, Juan I. Godino-Llorente

机构 * Escuela Técnica Superior de Ingenieros de Telecomunicación Universidad Politécnica de Madrid(电信工程高级学院马德里理工大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 提出基于贝叶斯深度学习的概率优化框架,通过置信-不确定性边界曲线(CUBC)和边界损失(CUB-Loss)校准预测置信与不确定性,并引入双温度缩放(DTS)进行后处理,在肺炎、糖尿病视网膜病变和皮肤病变三个医学图像任务上验证了有效性。

Comments 26 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21607 2026-06-23 cs.DB cs.LG 57%

Beyond Accuracy: An Empirical Study of Uncertainty Estimation in Imputation

超越准确性:对缺失数据填补中不确定性估计的实证研究

Zarin Tahia Hossain, Mostafa Milani

机构 * Department of Computer Science Western University London, Ontario, Canada(计算机科学系 温哥华大学 安大略省伦敦市 加拿大)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本文通过实证研究比较了三种主要填补方法家族的不确定性估计,发现高重建准确性并不一定意味着可靠的不确定性,提出了选择不确定性感知填补器的指导方针。

Comments To appear in conference proceedings

Journal ref Proceedings of the 2025 IEEE International Conference on Big Data, BigData 2025, Macau, China, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06917 2026-06-23 cs.LG eess.SP 57%

Efficient Unsupervised Domain Adaptation Regression for Spatial-Temporal Sensor Fusion

高效无监督领域适应回归用于空间-时间传感器融合

Keivan Faghih Niresi, Ismail Nejjar, Olga Fink

机构 * Intelligent Maintenance and Operations Systems Laboratory, EPFL(智能维护与操作系统实验室,瑞士联邦理工学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本文提出一种针对回归任务的高效无监督领域适应方法,通过整合空间-时间图神经网络和源目标域扰动逆Gram矩阵对齐,实现无标注数据下的可扩展领域适应,验证于空气质量监测和EEG信号重建任务,取得最佳性能。

Comments Accepted to IEEE Internet of Things Journal

详情

展开后加载摘要…

URL PDF HTML 收藏