arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-02 至 2026-04-02 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 3 篇

2602.22413 2026-04-02 cs.AI 70%

Epistemic Filtering and Collective Hallucination: A Jury Theorem for Confidence-Calibrated Agents

知识过滤与集体幻觉:一个适用于置信度校准代理的陪审团定理

Jonas Karge

机构 * Technische Universität Dresden(德累斯顿工业大学)

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 研究异质代理在时间中学习自我可靠性估计并选择性 abstain 的集体准确性,提出基于置信度校准的框架,推导非渐近下界并证明其在置信度门控设置下的泛化能力,通过蒙特卡洛模拟验证,探讨其在AI安全中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25052 2026-04-02 cs.CL cs.AI 62%

Closing the Confidence-Faithfulness Gap in Large Language Models

弥合大语言模型中的置信度-忠实度差距

Miranda Muqing Miao, Lyle Ungar

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文通过线性探针和对比激活添加分析,揭示大语言模型中置信度信号与校准的线性关系,提出双阶段适应性引导流程以提升校准对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00983 2026-04-02 cs.CV 50%

ACT Now: Preempting LVLM Hallucinations via Adaptive Context Integration

现在行动:通过自适应上下文整合预防治愈LVLM幻觉

Bei Yan, Yuecong Min, Jie Zhang, Shiguang Shan, Xilin Chen

机构 * University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出ACT方法,通过自适应整合上下文信息缓解LVLM幻觉问题,采用视觉上下文探索和语义上下文聚合技术,有效减少幻觉并提升生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏