arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-27 至 2026-05-27 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 6 篇

2605.27288 2026-05-27 cs.CL cs.AI cs.LG 67%

It's Not Always Sycophancy: Measuring LLM Conformity as a Function of Epistemic Uncertainty

并非总是谄媚:基于认知不确定性测量LLM的从众行为

Kevin H. Guo, Chao Yan, Avinash Baidya, Katherine Brown, Xiang Gao, Juming Xiong, Zhijun Yin, Bradley A. Malin

机构 * Vanderbilt University(范德比尔特大学) Vanderbilt University Medical Center(范德比尔特大学医学中心) Intuit AI Research(Intuit AI研究院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MUSE框架,通过区分谄媚从众和不确定性驱动的从众,揭示LLM在用户反驳时改变立场的行为机制,并发现两种从众均随用户感知专业性和建议合理性增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03585 2026-05-27 cs.CL cs.AI 62%

Belief-Sim: Towards Belief-Driven Simulation of Demographic Misinformation Susceptibility

Belief-Sim:迈向信念驱动的人口统计错误信息易感性模拟

Angana Borah, Zohaib Khan, Rada Mihalcea, Verónica Pérez-Rosas

机构 * University of Michigan - Ann Arbor(密歇根大学安娜堡分校) Texas State University(德克萨斯州立大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出BeliefSim框架,利用心理学分类和调查先验构建人口信念档案,通过提示条件化和后训练适应,实现基于信念模拟人口统计错误信息易感性,对齐度达92%。

Comments Paper Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20586 2026-05-27 cs.AI cs.LG 62%

PaTAS: A Framework for Trust Propagation in Neural Networks Using Subjective Logic

PaTAS:基于主观逻辑的神经网络信任传播框架

Koffi Ismael Ouattara, Ioannis Krontiris, Theo Dimitrakos, Dennis Eisermann, Houda Labiod, Frank Kargl

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出PaTAS框架,利用主观逻辑在神经网络中并行传播信任,通过信任节点和信任函数量化输入、参数和激活的信任,并设计参数信任更新和推理路径信任评估方法,以在对抗或退化条件下提供可解释的信任估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27315 2026-05-27 cs.CL 57%

Real Images, Worse Judgments: Evaluating Vision-Language Models on Concreteness and Imagery

真实图像,更差判断:评估视觉-语言模型在具体性和意象性上的表现

Yifan Jiang, Ruoxi Ning, Sheng Yao, Freda Shi

机构 * University of Waterloo(滑铁卢大学) Vector Institute(向量研究所)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本文通过具体性和意象性评分任务,发现真实图像上下文不仅未提升视觉-语言模型与人类判断的一致性,反而在视觉证据相关性低时加剧偏差,并表明推理时聚焦文本指令可缓解退化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27073 2026-05-27 cs.LG 57%

Learning to Orchestrate Agents under Uncertainty

学习在不确定性下编排智能体

Mary Chriselda Antony Oliver, Lan Jiang, Aaron Bundi Anampiu, Elaf Almahmoud, Francesco Quinzan, Umang Bhatt

机构 * Department of Applied Mathematics and Theoretical Physics, University of Cambridge(应用数学与理论物理系,剑桥大学) Centre for Human-Inspired Artificial Intelligence, University of Cambridge(启发式人工智能中心,剑桥大学) African Institute for Mathematical Sciences, South Africa(南非数学科学研究所) Department of Engineering Science, University of Oxford(工程科学系,牛津大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 提出BOT-Orch框架,将编排问题转化为带正则化的多臂赌博机问题,在不确定性下实现异构智能体的自适应编排,理论保证遗憾界为O(√T)并优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21510 2026-05-27 cs.LG cs.CV stat.ML 57%

An uncertainty-aware Bayesian framework for machine learning classification models: A case study in land cover classification

一种不确定性感知的贝叶斯机器学习分类模型框架:以土地覆盖分类为例

Samuel Bilson, Miles McCrory, Anna Pustogvar

机构 * National Physical Laboratory, Teddington, UK(英国国家物理实验室,Teddington) Department of Data Science(数据科学系) Department of Thermal & Radiometric Metrology(热学与辐射计量学系) School of Geography, Geology & the Environment(地理、地质与环境学院)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 提出一种考虑输入测量不确定性的贝叶斯生成式分类模型框架,通过贝叶斯二次判别分析模型在土地覆盖数据集上验证,该模型在可解释性、不确定性建模和计算效率方面优于随机森林和神经网络。

Comments 38 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏