arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-19 至 2026-05-19 共收录 11 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 11 篇

2602.20042 2026-05-19 cs.CL 83%

AI Alignment Breaks at the Edge

AI对齐在边缘处破裂

Han Bao, Yue Huang, Xiaoda Wang, Zheyuan Zhang, Yujun Zhou, Carl Yang, Xiangliang Zhang, Yanfang Ye

机构 * University of Notre Dame(诺丁汉大学) Emory University(埃默里大学)

专题命中 幻觉与事实性 :alignment(title,abstract);safety(abstract);分类 cs.CL

AI总结 本文探讨了AI对齐在边缘案例中的失效问题,提出了一种新的对齐方法,通过识别和处理价值冲突、多方利益分歧和认知模糊性来改进AI的安全性和有效性。

Comments 38 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12617 2026-05-19 cs.AI cs.HC 83%

Evaluating AI Alignment in LLMs: Output Analysis of Value Priorities Across 75 Models with Human Benchmarking

评估大语言模型中的AI对齐:通过75个模型的人类基准测试分析价值优先级

Gabriel Rongyang Lau, Wei Yan Low, Seow Min Koh, Fiona Fui-Hoon Nah, Andree Hartanto

机构 * School of Social Sciences, Nanyang Technological University(南洋理工大学社会科学学院) Interdisciplinary Graduate Programme, Nanyang Technological University(南洋理工大学跨学科研究生项目) Faculty of Arts and Social Sciences, National University of Singapore(新加坡国立大学人文与社会科学学院) School of Computing and Information Systems, Singapore Management University(新加坡管理学院计算与信息学院) School of Social Sciences, Singapore Management University(新加坡管理学院社会科学学院)

专题命中 幻觉与事实性 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文通过分析75个大语言模型的输出,评估其价值优先级与人类判断的一致性,发现模型在价值优先级上存在差异,且模型大小、新旧和能力层级与价值一致性无直接关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18442 2026-05-19 cs.RO 78%

SG-CADVLM: A Context-Aware Decoding Powered Vision Language Model for Safety-Critical Scenario Generation

SG-CADVLM: 一种基于上下文感知解码的视觉语言模型,用于安全关键场景生成

Hongyi Zhao, Shuo Wang, Qijie He, Ziyuan Pu

机构 * School of Transportation, Southeast University(东南大学交通学院)

专题命中 幻觉与事实性 :safety(title,abstract)

AI总结 本文提出SG-CADVLM,一种结合上下文感知解码的多模态输入处理框架,用于从事故报告中生成高保真的安全关键场景,通过减少视觉语言模型的幻觉并同时生成道路几何和车辆轨迹,提升了生成场景的准确性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18648 2026-05-19 cs.LG cs.AI cs.CL 67%

An Assessment of Human vs. Model Uncertainty in Soft-Label Learning and Calibration

对软标签学习和校准中人类与模型不确定性的评估

Maja Pavlovic, Silviu Paun, Massimo Poesio

机构 * Queen Mary University London(伦敦女王玛丽大学) Amazon(亚马逊) University of Utrecht(乌得勒支大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过对比人类和模型标签在软标签学习中的效果,发现人类标签不仅提升了模型准确性,还通过正则化作用改善了模型在困难样本上的校准和训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18562 2026-05-19 stat.ME cs.AI cs.LG stat.AP 62%

Estimating Item Difficulty with Large Language Models as Experts

利用大语言模型作为专家估算项目难度

Diana Kolesnikova, Kirill Fedyanin, Abe D. Hofman, Matthieu J. S. Brinkhuis, Maria Bolsinova

机构 * Department of Methodology and Statistics, Tilburg University(蒂尔堡大学方法学与统计学系) Smart Business Technologies(智能商务技术公司) Department of Psychological Methods, University of Amsterdam(阿姆斯特丹大学心理方法系) Prowise Learn, Amsterdam(Prowise Learn公司,阿姆斯特丹) Department of Information and Computing Sciences, Utrecht University(乌得勒支大学信息与计算科学系)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了如何利用大语言模型估算新任务的难度,通过对比不同配置下的模型表现,发现基于对偶比较的配置在无额外优化时表现更优,而结合token概率和已知难度示例的绝对判断配置也表现出中等至高水平的对齐度。

Comments 24 pages, 2 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18163 2026-05-19 cs.AI cs.CL 62%

TRACE: Trajectory Correction from Cross-layer Evidence for Hallucination Reduction

TRACE: 通过跨层证据进行轨迹修正以减少幻觉

Tej Sanibh Ranade

机构 * Independent Researcher(独立研究者)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TRACE算法,通过跨层证据在推理时修正LLM中的幻觉,无需训练或标注,通过内部证据选择修正策略,提升多个基准测试的性能。

Comments 25 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17765 2026-05-19 cs.LG 57%

AURORA: Contextual Orthogonalization for Geometric Representation Learning in Healthcare Foundation Models

AURORA:用于医疗基础模型中几何表示学习的上下文正交化

Yuanyun Zhang, Shi Li

机构 * University of the Chinese Academy of Sciences(中国科学院大学) Columbia University(哥伦比亚大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本文提出AURORA框架,通过上下文潜在几何进行正交化,以解决医疗基础模型中潜在表示的语义模糊和上下文变化不稳定性问题,提升了模型在不同机构分布变化下的鲁棒性和预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17749 2026-05-19 cs.LG stat.ML 57%

Testable and Actionable Calibration for Full Swap Regret

可检验且可操作的全面交换懊悔校准

Konstantina Bairaktari, Lunjia Hu, Huy L. Nguyen, Jonathan Ullman

机构 * Department of Computer Science, Aarhus University(阿arhus大学计算机科学系) Khoury College of Computer Sciences, Northeastern University(东北大学计算机科学学院) Northeastern University(东北大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出了一种新的校准度量标准SCDL,该度量标准在不削弱任何要求的前提下,既可操作又可检验,同时具备连续性和一致性等理想特性,并通过实验验证了其在实际中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17353 2026-05-19 cs.CY 57%

You Can't Fool Us: Understanding the Resilience of LLM-driven Agent Communities to Misinformation

你无法欺骗我们:理解由LLM驱动的代理社区对谣言的韧性

Chichen Lin, Yijie Jin, Kangbo Hu, Weijian Fan, Han Xiao, Yongbin Wang, Zhihui Ying, Zhanzhan Zhao

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CY

AI总结 本文研究了由LLM驱动的代理社区在面对可信谣言冲击时的韧性,通过构建基于LLM的代理模拟,从主动开放思维(AOT)和政治意识形态(PI)两个维度分析社区对谣言的反应机制,发现高AOT提升抗谣言冲击能力和恢复力,而PI影响恢复路径,中等意识形态社区恢复更可靠,极化社区则保留更多支持。

Comments 26 pages, 7 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16732 2026-05-19 cs.CV cs.LG 57%

DiRotQ: Rotation-Aware Quantization for 4-bit Diffusion Transformers

DiRotQ:面向4位扩散变换器的旋转感知量化

Sayeh Sharify, Mahsa Salmani, Hesham Mostafa

机构 * d-Matrix

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本文提出DiRotQ,一种W4A4量化框架,通过旋转感知激活量化缓解扩散变换器在4位精度下的性能下降问题,同时引入VLM-as-a-Judge评估协议和Triton定制内核提升压缩下的效率与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02759 2026-05-19 cs.RO cs.CV 50%

DynoSLAM: Dynamic SLAM with Generative Graph Neural Networks for Real-World Social Navigation

DynoSLAM:基于生成图神经网络的动态SLAM用于现实世界的社交导航

Danil Tokhchukov, Veronika Morozova, Gonzalo Ferrer

机构 * Applied AI Institute(应用人工智能研究所)

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文提出DynoSLAM,通过整合社交感知图神经网络,解决动态环境中SLAM的不确定性问题,提升机器人在拥挤环境中的导航能力。

Comments Code & Project page at https://github.com/makriot/dynoslam

详情

展开后加载摘要…

URL PDF HTML 收藏