arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-27 至 2026-04-27 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 4 篇

2604.14651 2026-04-27 cs.CL 83%

CURA: Clinical Uncertainty Risk Alignment for Language Model-Based Risk Prediction

CURA:语言模型基于风险预测的临床不确定性风险对齐

Sizhe Wang, Ziqi Xu, Claire Najjuuko, Charles Alba, Chenyang Lu

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校)

专题命中 幻觉与事实性 :alignment(title,abstract);trustworthy(abstract);分类 cs.CL

AI总结 CURA通过结合个体误差概率和群体模糊性,提升临床语言模型的风险预测不确定性校准,实验表明其能提高校准指标并减少过度自信的误判。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16994 2026-04-27 cs.LG cs.AI cs.CL 67%

FADE: Why Bad Descriptions Happen to Good Features

FADE:为什么好的特征会遇到糟糕的描述

Bruno Puri, Aakriti Jain, Elena Golimblevskaia, Patrick Kahardipraja, Thomas Wiegand, Wojciech Samek, Sebastian Lapuschkin

机构 * Department of Artificial Intelligence, Fraunhofer Heinrich Hertz Institute(人工智能系,弗劳恩霍夫海因里希·赫兹研究所) Department of Electrical Engineering and Computer Science, Technische Universität Berlin(电气工程与计算机科学系,柏林技术大学) BIFOLD - Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所) Centre of eXplainable Artificial Intelligence, Technological University Dublin(可解释人工智能中心,都柏林技术大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FADE提出了一种模型无关的框架,用于自动评估特征与描述的一致性,通过四个指标量化特征与描述之间的不一致原因,揭示了生成特征描述的挑战。

Journal ref In Findings of the Association for Computational Linguistics: ACL 2025, pages 17138-17160, Vienna, Austria. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22498 2026-04-27 cs.CV cs.AI 57%

CGC: Compositional Grounded Contrast for Fine-Grained Multi-Image Understanding

CGC:基于组成性 grounded 对比的细粒度多图像理解

Lihao Zheng, Zhenwei Shao, Yu Zhou, Yan Yang, Xintian Shen, Jiawei Chen, Hao Ma, Tao Wei

机构 * School of Computer Science and Technology, Hangzhou Dianzi University(杭州电子科技大学计算机科学与技术学院) School of Computer Science(计算机科学学院) Technology, Hangzhou Dianzi University(技术,杭州电子科技大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文提出CGC框架,通过跨图像对比和内图像对比提升多图像细粒度理解,结合规则空间奖励增强属性和对齐,实验显示在多个基准上取得最佳结果,并在多模态任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21740 2026-04-27 cs.CY cs.SI physics.soc-ph 57%

Towards Operational Validation of LLM-Agent Social Simulations: A Replicated Study of a Reddit-like Technology Forum

向LLM-代理社会模拟的操作验证:一个Reddit-like技术论坛的重复研究

Aleksandar Tomašević, Darja Cvetković, Sara Major, Slobodan Maletić, Miroslav Anđelković, Ana Vranić, Boris Stupovski, Dušan Vudragović, Aleksandar Bogojević, Marija Mitrović Dankulov

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CY

AI总结 本文通过30天的模拟研究,验证LLM-代理在技术论坛中的操作有效性,发现模拟结果与真实数据在用户和帖子层面有重叠,但评论毒性等指标存在差异,揭示了代理设计对模拟结果的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏