arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-24 至 2026-04-24 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 4 篇

2604.20854 2026-04-24 cs.IR cs.AI 79%

ERA: Evidence-based Reliability Alignment for Honest Retrieval-Augmented Generation

ERA:基于证据的可靠性对齐用于诚实检索增强生成

Sunguk Shin, Meeyoung Cha, Byung-Jun Lee, Sungwon Park

机构 * Korea University(韩国大学) Gauss Labs Inc.(Gauss实验室)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出ERA框架,通过将置信度估计从标量概率转为显式证据分布,提升RAG系统中的回避行为,有效区分知识冲突与不确定性,实验表明在标准基准和定制泛化数据集上表现优异。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20903 2026-04-24 cs.CR 78%

Sensitivity Uncertainty Alignment in Large Language Models

大语言模型中的敏感性不确定性对齐

Prakul Sunil Hiremath, Harshit R. Hiremath

专题命中 幻觉与事实性 :alignment(title,abstract)

AI总结 本文提出SUA框架,用于分析大语言模型在对抗性和模糊输入下的失败原因,通过敏感性与不确定性对齐提升模型可靠性。

Comments 24 pages, 4 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03247 2026-04-24 cs.LG cs.AI 62%

Towards Multimodal Active Learning: Efficient Learning with Limited Paired Data

迈向多模态主动学习:在有限配对数据下高效学习

Jiancheng Zhang, Yinglun Zhu

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出首个处理对齐数据的多模态主动学习框架,结合不确定性与多样性原则,实现线性时间获取,降低多模态标注成本且保持性能。

Comments Accepted by Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21193 2026-04-24 cs.AI 57%

Trust but Verify: Introducing DAVinCI -- A Framework for Dual Attribution and Verification in Claim Inference for Language Models

信任但验证:介绍DAVinCI——一种用于语言模型声明推断中双属性和验证的框架

Vipula Rawte, Ryan Rossi, Franck Dernoncourt, Nedim Lipka

机构 * Adobe(Adobe公司) Adobe Research(Adobe研究院)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出DAVinCI框架,通过双属性和验证机制提升语言模型输出的事实可靠性与可解释性,实验表明其在分类准确率、属性精度、召回率和F1分数上提升5-20%。

详情

展开后加载摘要…

URL PDF HTML 收藏