arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-05 至 2026-05-05 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 4 篇

2511.21086 2026-05-05 cs.CL 74%

Orthographic Constraint Satisfaction and Human Difficulty Alignment in Large Language Models

正交约束满足与大语言模型中的人类难度对齐

Bryan E. Tuck, Rakesh M. Verma

机构 * University of Houston(德克萨斯大学休斯顿分校)

专题命中 幻觉与事实性 :alignment(title);分类 cs.CL

AI总结 本文评估了三种大语言模型在字符级约束满足任务上的表现,发现跨家族性能差异显著大于同家族参数扩展效果,且模型在处理常见词时存在系统性失败,揭示了对分布合理性依赖的问题。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01428 2026-05-05 cs.CL 57%

Hallucinations Undermine Trust; Metacognition is a Way Forward

幻觉削弱信任;元认知是前进的方向

Gal Yona, Mor Geva, Yossi Matias

机构 * Tel Aviv University(特拉维夫大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL

AI总结 研究指出,生成AI的幻觉问题源于知识边界扩展而非意识提升,提出通过元认知表达不确定性以提升可信度和能力。

Comments To appear in ICML 2026 (Position Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01306 2026-05-05 physics.optics cs.LG physics.app-ph 57%

Machine Learning Enhanced Laser Spectroscopy for Multi-Species Gas Detection in Complex and Harsh Environments

机器学习增强的激光光谱法用于复杂恶劣环境中的多物种气体检测

Mohamed Sy

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹大学科学与技术学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本研究结合激光吸收光谱与机器学习,开发出多物种气体检测方法,通过深度去噪自编码器、结构化无监督框架和盲源分离技术提升检测可靠性,适用于动态或干扰环境。

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00893 2026-05-05 cs.CV cs.AI cs.IR 57%

Retrieval-Guided Generation for Safer Histopathology Image Captioning

基于检索的生成用于更安全的病理科图像描述生成

Md. Enamul Hoq, Wataru Uegami, Saghir Alfasly, Ghazal Alabtah, Sahar Rahimi Malakshan, Armita Kazemi, Alex T. Schmitgen, Fred Prior, H. R. Tizhoosh

机构 * Kimia Lab, Department of Artificial Intelligence \& Informatics, Mayo Clinic, Rochester, MN, USA Department of Biomedical Informatics, University of Arkansas for Medical Sciences, Little Rock, AR, USA Lane Department of Computer Science Electrical Engineering, West Virginia University, Morgantown, WV, USA Department of Computer Science Engineering, Princeton University, Princeton, NJ, USA Department of Computer Sciences, University of Wisconsin--Madison, Madison, WI, USA

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文提出检索引导生成方法,通过总结相似病例的专家文本生成描述,提升病理图像描述的准确性与可靠性,实验表明其在语义对齐和诊断一致性方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏