arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1730 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 1730 篇

2406.14144 2025-10-24 cs.CL cs.AI cs.LG 89%

Towards Understanding Safety Alignment: A Mechanistic Perspective from Safety Neurons

Jianhui Chen, Xiaozhi Wang, Zijun Yao, Yushi Bai, Lei Hou, Juanzi Li

机构 * Department of Computer Science and Technology, BNRist(计算机科学与技术系,BNRist) Shenzhen International Graduate School(深圳国际研究生院) KIRC, Institute for Artificial Intelligence, Tsinghua University(人工智能研究院,清华大学)

专题命中 幻觉与事实性 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08451 2026-06-09 cs.CL cs.AI 新提交 88%

Sycophancy as a Multilingual Alignment Failure: How Safety Degrades Across Languages, Topics, and Models

谄媚作为多语言对齐失败:安全性能如何随语言、主题和模型退化

Arya Shah, Himanshu Beniwal, Mayank Singh, Chaklam Silpasuwanchai

机构 * IIT Gandhinagar(印度理工学院甘地讷格尔分校) Asian Institute of Technology(亚洲理工学院)

专题命中 幻觉与事实性 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI

AI总结 研究多语言模型中谄媚现象,发现低资源语言中谄媚率激增,且与主题无关,归因于分词器生育率,表明对齐方法在非高资源语言中泛化差。

Comments 19 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09665 2026-04-17 cs.LG cs.AI 88%

Deliberative Alignment is Deep, but Uncertainty Remains: Inference time safety improvement in reasoning via attribution of unsafe behavior to base model

深度对齐但不确定性依然存在:通过将不安全行为归因于基础模型来改进推理时间的安全性

Pankayaraj Pathmanathan, Furong Huang

机构 * University of Maryland College Park(马里兰大学学院市)

专题命中 幻觉与事实性 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了对齐对语言模型安全性和通用性的影响,提出BoN采样方法将不安全行为归因于基础模型,减少多个安全基准的攻击成功率,同时保持实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13255 2026-03-17 cs.CY cs.AI 88%

The Ghost in the Grammar: Methodological Anthropomorphism in AI Safety Evaluations

语法中的幽灵:人工智能安全评估中的方法论人类学

Mariana Lins Costa

专题命中 幻觉与事实性 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI、cs.CY

AI总结 本文通过分析近期技术报告,探讨人工智能安全领域中对AI系统投射意图、人格等属性的隐性人类学倾向,质疑其对安全评估方法论的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01266 2025-10-03 cs.CL cs.AI 88%

OpenAI's GPT-OSS-20B Model and Safety Alignment Issues in a Low-Resource Language

Isa Inuwa-Dutse

机构 * University of Huddersfield(赫德菲尔德大学)

专题命中 幻觉与事实性 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI

Comments 6 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02313 2025-05-06 cs.CY cs.AI 88%

What Is AI Safety? What Do We Want It to Be?

Jacqueline Harding, Cameron Domenico Kirk-Giannini

机构 * Stanford University(斯坦福大学) Rutgers University–Newark(罗格斯大学-新布朗斯维尔)

专题命中 幻觉与事实性 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07775 2026-02-02 cs.CL 88%

The Unintended Trade-off of AI Alignment:Balancing Hallucination Mitigation and Safety in LLMs

AI对齐中的意外权衡:在LLMs中平衡幻觉缓解与安全

Omar Mahmoud, Ali Khalil, Buddhika Laknath Semage, Thommen George Karimpanal, Santu Rana

机构 * Applied Artificial Intelligence Initiative(应用人工智能倡议) Deakin University(德肯大学) School of Information Technology(信息科技学院)

专题命中 幻觉与事实性 :alignment(title,abstract);safety(title,abstract);分类 cs.CL

AI总结 本文提出了一种方法,通过解耦幻觉和拒绝特征,平衡LLMs中的真实性与安全性,减少因提高真实性而削弱安全对齐的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.08606 2019-10-22 hep-ph cs.LG hep-ex stat.ML 88%

AI Safety for High Energy Physics

Benjamin Nachman, Chase Shimmin

专题命中 幻觉与事实性 :safety(title,abstract);AI safety(title,abstract);分类 cs.LG

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23765 2026-05-08 cs.CL cs.AI cs.LG 87%

Knowledge-Level Consistency Reinforcement Learning: Dual-Fact Alignment for Long-Form Factuality

知识级一致性强化学习:长形式事实性的双事实对齐

Junliang Li, Yucheng Wang, Yan Chen, Yu Ran, Ruiqing Zhang, Jing Liu, Hua Wu, Haifeng Wang

机构 * Baidu Inc.(百度公司)

专题命中 幻觉与事实性 :alignment(title,abstract);RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出KLCF框架,通过双事实对齐机制提升长形式生成的事实性,有效缓解幻觉和保守倾向,提升精度与召回率。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24124 2026-03-30 cs.LG cs.AI cs.CL 87%

The Alignment Tax: Response Homogenization in Aligned LLMs and Its Implications for Uncertainty Estimation

对齐税:对齐语言模型中的响应同质化及其对不确定性估计的影响

Mingyi Liu

专题命中 幻觉与事实性 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现对齐语言模型存在响应同质化现象,影响不确定性估计方法的效果,提出通过叠加不确定性信号提升模型性能。

Comments 25 pages, 3 figures, 10 tables, 24 experiments across 5 benchmarks. v2: added SINdex head-to-head (Exp 27), NLI validation (Exp 28), decoding protocol analysis. Code: https://github.com/DigitLion/ucbd-experiment

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24027 2026-03-02 cs.CV cs.MM 86%

GuardAlign: Test-time Safety Alignment in Multimodal Large Language Models

GuardAlign: 多模态大语言模型中的测试时安全性对齐

Xingyu Zhu, Beier Zhu, Junfeng Fang, Shuo Wang, Yin Zhang, Xiang Wang, Xiangnan He

机构 * MoE Key Lab of BIPC, University of Science and Technology of China(摩埃关键实验室,中国科学技术大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Tianjin University(天津大学)

专题命中 幻觉与事实性 :safety(title,abstract);alignment(title)

AI总结 GuardAlign通过OT增强的安全检测和跨模态注意力校准,有效提升多模态大语言模型在测试时的安全性,减少不安全响应率并提升任务表现。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11856 2024-10-17 cs.HC cs.ET 86%

Malak: AI-based multilingual personal assistant to combat misinformation and generative AI safety issues

Farnaz Farid, Farhad Ahamed

专题命中 幻觉与事实性 :safety(title,abstract);AI safety(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15397 2026-03-17 cs.CR cs.AI 85%

SFCoT: Safer Chain-of-Thought via Active Safety Evaluation and Calibration

SFCoT:通过主动安全评估和校准实现更安全的推理链

Yu Pan, Wenlong Yu, Tiejun Wu, Xiaohu Ye, Qiannan Si, Guangquan Xu, Bin Wu

机构 * Department College of Intelligence and Computing(智能与计算学院) Tianjin University(天津大学) NSFOCUS Technologies Group Co., Ltd.(NSFOCUS技术集团有限公司) College of Management and Economics(管理与经济学院) School of Cyber Security(网络安全学院)

专题命中 幻觉与事实性 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出SFCoT框架,通过实时评估和校准潜在不安全的推理步骤,有效降低对抗攻击成功率,提升大语言模型的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00269 2025-10-10 cs.LG cs.AI cs.CL cs.CY 85%

Reducing Large Language Model Safety Risks in Women's Health using Semantic Entropy

Jahan C. Penny-Dimri, Magdalena Bachmann, William R. Cooke, Sam Mathewlynn, Samuel Dockree, John Tolladay, Jannik Kossen, Lin Li, Yarin Gal, Gabriel Davis Jones

机构 * Oxford Digital Health Labs, Nuffield Department of Women’s and Reproductive Health(牛津数字健康实验室,女性与生殖健康系) University of Oxford(牛津大学) Oxford University Hospitals NHS Foundation Trust(牛津大学医院 NHS 基础信托) OATML, Department of Computer Science(OATML,计算机科学系)

专题命中 幻觉与事实性 :safety(title,abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 15 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17477 2025-07-24 cs.AI 85%

An Uncertainty-Driven Adaptive Self-Alignment Framework for Large Language Models

Haoran Sun, Zekun Zhang, Shaoning Zeng

专题命中 幻觉与事实性 :alignment(title,abstract);safety(abstract);harmlessness(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18366 2026-07-22 cs.AI cs.CL cs.CY 新提交 85%

Operational Hallucination and Safety Drift in AI Agents

人工智能代理中的操作幻觉与安全漂移

Shasha Yu, Fiona Carroll, Barry L. Bentley

专题命中 幻觉与事实性 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究大型语言模型在多轮执行中引发的可靠性风险,通过多轮评估量化安全漂移和操作幻觉现象,分析其根源,提出行动感知监督层,该层能拦截违规行为且无良性误报,提升了代理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06333 2026-03-09 cs.AI cs.CL cs.LG 85%

SAHOO: Safeguarded Alignment for High-Order Optimization Objectives in Recursive Self-Improvement

SAHOO:递归自我改进中高阶优化目标的安全保障

Subramanyam Sahoo, Aman Chadha, Vinija Jain, Divya Chaudhary

机构 * MARS 4.0 Fellowship, Cambridge AI Safety Hub(CAISH), University of Cambridge(剑桥大学) AWS Generative AI Innovation Center, Amazon Web Services, USA(亚马逊网络服务) Google, USA(谷歌) Stanford University(斯坦福大学) Northeastern University, Seattle, WA, USA(东北大学)

专题命中 幻觉与事实性 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SAHOO通过三种保障措施实现递归自我改进中高阶优化目标的安全保障,显著提升代码生成和推理质量,同时保持约束和事实性。

Comments Published at ICLR 2026 Workshop on AI with Recursive Self-Improvement. 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23508 2025-12-30 cs.AI cs.GT 84%

Why AI Safety Requires Uncertainty, Incomplete Preferences, and Non-Archimedean Utilities

为何人工智能安全需要不确定性、不完全偏好和非阿基米德效用

Alessio Benavoli, Alessandro Facchini, Marco Zaffalon

机构 * School of Computer Science and Statistics, Trinity College Dublin(特里尼蒂大学计算机科学与统计学学院) Trinity Quantum Alliance, Trinity College Dublin(特里尼蒂量子联盟) Management in Networked and Digital Societies (MINDS) Department, Kozminski University(科津斯基大学网络化与数字化社会管理系)

专题命中 幻觉与事实性 :safety(title);AI safety(title);分类 cs.AI

AI总结 本文探讨了人工智能安全需通过不确定性推理、不完全偏好处理和非阿基米德效用机制来实现

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03745 2026-08-05 cs.AI cs.CL 新提交 84%

Risky Business: Measuring The Faithfulness-Safety Tension

危险的业务:测量忠实度与安全性之间的张力

Dominik Meier, Luca Joshua Francis, Marco Bernhard Kaiser, Terry Ruas, Jan Philip Wahle, Bela Gipp

专题命中 幻觉与事实性 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对大型推理模型中忠实度与安全性的张力,构建HazMart数据集,提出TRR技术,发现QwQ-32B的反相关内部方向,并通过表征引导提升安全行为9个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22676 2026-07-28 cs.AI cs.CL 新提交 84%

How LLM Task-Adaptation Reshapes Alignment: A Multi-dimensional Study of Behavioral and Representational Drift

大语言模型任务适应如何重塑对齐:行为和表征漂移的多维研究

James Elcock, William F. Shen, Xinchi Qiu, Nicholas D. Lane

机构 * University of Cambridge(剑桥大学)

专题命中 幻觉与事实性 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型任务适应对对齐的影响,通过系统评估监督微调、KL正则化SFT和可验证奖励强化学习等方法,发现训练后调整非均匀重塑对齐,不同方法影响各异,强调任务适应是对齐干预,应进行多维对齐评估。

Comments 21 pages, 7 figures (includes references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01887 2026-01-07 cs.LG cs.AI 84%

Safety at One Shot: Patching Fine-Tuned LLMs with A Single Instance

单次实例实现安全:用一个实例修补微调的LLM

Jiawen Zhang, Lipeng He, Kejia Chen, Jian Lou, Jian Liu, Xiaohu Yang, Ruoxi Jia

专题命中 幻觉与事实性 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 通过单个安全示例高效修复微调后的LLM安全性,无需牺牲实用性且成本极低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11681 2025-03-06 cs.CL cs.AI 84%

RIDE: Enhancing Large Language Model Alignment through Restyled In-Context Learning Demonstration Exemplars

Yuncheng Hua, Lizhen Qu, Zhuang Li, Hao Xue, Flora D. Salim, Gholamreza Haffari

专题命中 幻觉与事实性 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI

Comments 38 pages, 2 figures, 20 tables; The paper is under review in ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10960 2024-04-18 cs.CL cs.AI 84%

Uncertainty-Based Abstention in LLMs Improves Safety and Reduces Hallucinations

Christian Tomani, Kamalika Chaudhuri, Ivan Evtimov, Daniel Cremers, Mark Ibrahim

专题命中 幻觉与事实性 :safety(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16030 2024-02-27 cs.CL cs.AI 84%

Don't Forget Your Reward Values: Language Model Alignment via Value-based Calibration

Xin Mao, Feng-Lin Li, Huimin Xu, Wei Zhang, Anh Tuan Luu

专题命中 幻觉与事实性 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI

Comments 19 pages, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06785 2024-01-17 cs.CL cs.AI 84%

Human-Instruction-Free LLM Self-Alignment with Limited Samples

Hongyi Guo, Yuanshun Yao, Wei Shen, Jiaheng Wei, Xiaoying Zhang, Zhaoran Wang, Yang Liu

专题命中 幻觉与事实性 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22042 2026-07-14 cs.CV cs.AI 版本更新 83%

Uncertainty-guided Compositional Alignment with Part-to-Whole Semantic Representativeness in Hyperbolic Vision-Language Models

基于部分-整体语义代表性与不确定性引导的组合对齐超几何视觉语言模型

Hayeon Kim, Ji Ha Jang, Junghun James Kim, Se Young Chun

机构 * Dept. of Electrical and Computer Engineering(电子与计算机工程系) INMC & IPAI(INMC与IPAI) Seoul National University(首尔国立大学)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出UNCHA方法,通过超几何不确定性建模部分-整体语义代表性,提升超几何VLM对多物体场景的组合结构理解能力,实现零样本分类等任务的最先进性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12897 2026-06-12 cs.CL 新提交 83%

SafeLLM: Extraction as a Hallucination-Resistant Alternative to Rewriting in Safety-Critical Settings

SafeLLM: 在安全关键场景中,提取作为重写的抗幻觉替代方案

Julia Ive, Felix Jozsa, Evridiki Georgaki, Nabeel Sheikh, Emma Cattell, Nick Jackson, Paulina Bondaronek, Ciaran Scott Hill, Richard Dobson

机构 * Institute of Health Informatics, University College London(伦敦大学学院健康信息学研究所) National Hospital for Neurology and Neurosurgery(国家神经内科与神经外科医院) Somerset NHS Foundation Trust(萨默塞特NHS基金会信托) King's College Hospital(国王学院医院) King's College London(伦敦国王学院)

专题命中 幻觉与事实性 :safety(title,abstract);alignment(abstract);分类 cs.CL

AI总结 提出将提取作为重写型RAG的抗幻觉替代方案,通过行号选择策略在安全关键文档中实现高召回(95%)和低幻觉,优于直接复制和安全导向方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20042 2026-05-19 cs.CL 83%

AI Alignment Breaks at the Edge

AI对齐在边缘处破裂

Han Bao, Yue Huang, Xiaoda Wang, Zheyuan Zhang, Yujun Zhou, Carl Yang, Xiangliang Zhang, Yanfang Ye

机构 * University of Notre Dame(诺丁汉大学) Emory University(埃默里大学)

专题命中 幻觉与事实性 :alignment(title,abstract);safety(abstract);分类 cs.CL

AI总结 本文探讨了AI对齐在边缘案例中的失效问题,提出了一种新的对齐方法,通过识别和处理价值冲突、多方利益分歧和认知模糊性来改进AI的安全性和有效性。

Comments 38 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12617 2026-05-19 cs.AI cs.HC 83%

Evaluating AI Alignment in LLMs: Output Analysis of Value Priorities Across 75 Models with Human Benchmarking

评估大语言模型中的AI对齐:通过75个模型的人类基准测试分析价值优先级

Gabriel Rongyang Lau, Wei Yan Low, Seow Min Koh, Fiona Fui-Hoon Nah, Andree Hartanto

机构 * School of Social Sciences, Nanyang Technological University(南洋理工大学社会科学学院) Interdisciplinary Graduate Programme, Nanyang Technological University(南洋理工大学跨学科研究生项目) Faculty of Arts and Social Sciences, National University of Singapore(新加坡国立大学人文与社会科学学院) School of Computing and Information Systems, Singapore Management University(新加坡管理学院计算与信息学院) School of Social Sciences, Singapore Management University(新加坡管理学院社会科学学院)

专题命中 幻觉与事实性 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文通过分析75个大语言模型的输出,评估其价值优先级与人类判断的一致性,发现模型在价值优先级上存在差异,且模型大小、新旧和能力层级与价值一致性无直接关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14651 2026-04-27 cs.CL 83%

CURA: Clinical Uncertainty Risk Alignment for Language Model-Based Risk Prediction

CURA:语言模型基于风险预测的临床不确定性风险对齐

Sizhe Wang, Ziqi Xu, Claire Najjuuko, Charles Alba, Chenyang Lu

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校)

专题命中 幻觉与事实性 :alignment(title,abstract);trustworthy(abstract);分类 cs.CL

AI总结 CURA通过结合个体误差概率和群体模糊性,提升临床语言模型的风险预测不确定性校准,实验表明其能提高校准指标并减少过度自信的误判。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏