arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1732 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 1732 篇

2607.17883 2026-07-21 cs.CL cs.AI 新提交 76%

Zero Hallucination, by Construction: Hallucination-Aware Layered Oversight for Trustworthy Enterprise AI

通过构建实现零幻觉:用于可信企业人工智能的幻觉感知分层监督

Bogdan Raduta, Horia Velicu, Alexandru Preda, Serban Chiricescu

专题命中 幻觉与事实性 :trustworthy(title);分类 cs.CL、cs.AI

AI总结 研究企业AI因幻觉难以被信任的问题时,提出HALO架构,通过六层防御将幻觉视为可控制故障模式,详细介绍各层并关注基于证据的置信度,以实现可信企业AI,在索赔提取工作负载上进行了架构说明。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10216 2026-06-10 cs.LG cs.AI 新提交 76%

A Source Domain is All You Need: Source-Only Cross-OS Transfer Learning for APT Anomaly Detection via Semantic Alignment and Optimal Transport

一个源域足矣:基于语义对齐和最优传输的仅源域跨操作系统APT异常检测迁移学习

Sidahmed Benabderrahmanea, Petko Valtchev, James Cheney, Talal Rahwan

机构 * New York University, NYUAD, Division of Science, Computer Science Department(纽约大学,NYUAD,科学学院,计算机科学系) University of Quebec in Montreal, Computer Science Department, Montreal(魁北克大学蒙特利尔分校,计算机科学系,蒙特利尔) University of Edinburgh, School of Informatics, Edinburgh(爱丁堡大学,信息学院,爱丁堡)

专题命中 幻觉与事实性 :alignment(title);分类 cs.AI、cs.LG

AI总结 针对跨操作系统APT检测中目标域无标签的挑战,提出基于最优传输的仅源域异常评分框架,通过语义抽象和三种偏差通道实现零目标监督下的异常排序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20400 2026-02-25 cs.LG cs.AI 76%

Three Concrete Challenges and Two Hopes for the Safety of Unsupervised Elicitation

三个具体挑战和两个希望:对无监督引导的安全性

Callum Canavan, Aditya Shrivastava, Allison Qi, Jonathan Michala, Fabien Roger

专题命中 幻觉与事实性 :safety(title);分类 cs.AI、cs.LG

AI总结 本文探讨了无监督引导技术在面对特定数据集挑战时的局限性,并提出了未来研究的优先方向。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23665 2025-09-30 cs.LG cs.AI cs.IT math.IT math.PR 76%

Calibration Meets Reality: Making Machine Learning Predictions Trustworthy

Kristina P. Sinaga, Arjun S. Nair

机构 * Independent Researcher(独立研究者)

专题命中 幻觉与事实性 :trustworthy(title);分类 cs.AI、cs.LG

Comments 30 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22251 2025-09-29 cs.CL cs.AI 76%

Beyond Textual Context: Structural Graph Encoding with Adaptive Space Alignment to alleviate the hallucination of LLMs

Yifang Zhang, Pengfei Duan, Yiwen Yang, Shengwu Xiong

机构 * Wuhan University of Technology(武汉理工大学)

专题命中 幻觉与事实性 :alignment(title);分类 cs.CL、cs.AI

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05634 2025-08-08 cs.RO cs.AI cs.CV cs.LG cs.SY eess.SY 76%

Towards Generalizable Safety in Crowd Navigation via Conformal Uncertainty Handling

Jianpeng Yao, Xiaopan Zhang, Yu Xia, Zejin Wang, Amit K. Roy-Chowdhury, Jiachen Li

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 幻觉与事实性 :safety(title);分类 cs.AI、cs.LG

Comments 9th Conference on Robot Learning (CoRL 2025); Project website: https://gen-safe-nav.github.io/. arXiv admin note: text overlap with arXiv:2407.17460

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11129 2025-06-16 cs.CL cs.AI 76%

Trustworthy AI for Medicine: Continuous Hallucination Detection and Elimination with CHECK

Carlos Garcia-Fernandez, Luis Felipe, Monique Shotande, Muntasir Zitu, Aakash Tripathi, Ghulam Rasool, Issam El Naqa, Vivek Rudrapatna, Gilmer Valdes

机构 * Department of Machine Learning, Moffitt Cancer Center(机器学习部门,莫菲特癌症中心) Department of Medicine, University of California San Francisco(医学部门,加州大学旧金山分校)

专题命中 幻觉与事实性 :trustworthy(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10168 2024-03-18 cs.LG cs.CY stat.ML 76%

Explainability through uncertainty: Trustworthy decision-making with neural networks

Arthur Thuy, Dries F. Benoit

专题命中 幻觉与事实性 :trustworthy(title);分类 cs.CY、cs.LG

Comments Accepted Manuscript version of an article published in the European Journal of Operational Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.03736 2022-10-11 eess.IV cs.AI cs.CV cs.LG 76%

Trustworthy clinical AI solutions: a unified review of uncertainty quantification in deep learning models for medical image analysis

Benjamin Lambert, Florence Forbes, Alan Tucholka, Senan Doyle, Harmonie Dehaene, Michel Dojat

专题命中 幻觉与事实性 :trustworthy(title);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1901.00064 2019-03-06 cs.AI 76%

Impossibility and Uncertainty Theorems in AI Value Alignment (or why your AGI should not have a utility function)

Peter Eckersley

专题命中 幻觉与事实性 :alignment(title);分类 cs.AI;safety(comments)

Comments Published in SafeAI 2019: Proceedings of the AAAI Workshop on Artificial Intelligence Safety 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16411 2026-08-12 cs.CV cs.AI cs.CL cs.DB cs.LG 版本更新 75%

Grounded Post-Training with Hard Examples for Reducing Hallucination in Multimodal Large Language Models

通过分布偏移下的分阶段偏好优化减少视觉-语言模型中的幻觉

Qinwu Xu

机构 * Meta AI

专题命中 幻觉与事实性 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出分阶段偏好优化框架,通过构建针对幻觉问题的数据集,提升视觉-语言模型的 grounded reasoning,减少幻觉并提高响应信息量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01504 2026-04-03 cs.CL cs.AI cs.CY 75%

Magic, Madness, Heaven, Sin: LLM Output Diversity is Everything, Everywhere, All at Once

魔术、疯狂、天堂、罪恶:LLM输出多样性无处不在

Harnoor Dhingra

机构 * Microsoft(微软)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出Magic, Madness, Heaven, Sin框架,从四个规范性场景分析LLM输出多样性,揭示任务目标对输出多样性的影响,强调需基于任务目标进行多样性评估。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15068 2025-12-22 cs.LG cs.AI cs.CL 75%

The Semantic Illusion: Certified Limits of Embedding-Based Hallucination Detection in RAG Systems

语义幻觉:基于嵌入的幻觉检测在RAG系统中的认证极限

Debu Sinha

机构 * Independent Researcher(独立研究者)

专题命中 幻觉与事实性 :RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示了基于嵌入的幻觉检测在RAG系统中存在语义幻觉问题,通过符合预测方法发现真实幻觉检测的挑战,证明需通过推理而非表面语义解决。

Comments 12 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00588 2025-11-21 cs.LG cs.AI cs.CY 75%

Diagnosing Hallucination Risk in AI Surgical Decision-Support: A Sequential Framework for Sequential Validation

诊断人工智能手术决策支持中的幻觉风险:一种用于序列验证的连续框架

Dong Chen, Yanzhe Wei, Zonglin He, Guan-Ming Kuang, Canhua Ye, Meiru An, Huili Peng, Yong Hu, Huiren Tao, Kenneth MC Cheung

机构 * Orthopaedic Centre, The University of Hong Kong - Shenzhen Hospital(香港大学深圳医院骨科中心) Translational Medicine Centre, The University of Hong Kong - Shenzhen Hospital(香港大学深圳医院转化医学中心) Department of Orthopaedics & Traumatology, Li Ka Shing Faculty of Medicine, The University of Hong Kong(香港大学李嘉诚医学院骨科与创伤外科部)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出了一种用于评估人工智能手术决策支持系统幻觉风险的连续框架,通过多维度测试揭示模型在复杂性下的脆弱性,并强调了增强推理能力的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14318 2025-10-17 cs.CL cs.AI cs.LG 75%

Evaluating & Reducing Deceptive Dialogue From Language Models with Multi-turn RL

Marwa Abdulhai, Ryan Cheng, Aryansh Shrivastava, Natasha Jaques, Yarin Gal, Sergey Levine

机构 * UC Berkeley(伯克利大学) University of Oxford(牛津大学) University of Washington(华盛顿大学) UK AI Security Institute(英国人工智能安全研究所) Google DeepMind(谷歌DeepMind)

专题命中 幻觉与事实性 :RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04909 2025-06-06 cs.AI cs.CL cs.CR cs.LG 75%

When Thinking LLMs Lie: Unveiling the Strategic Deception in Representations of Reasoning Models

Kai Wang, Yihao Zhang, Meng Sun

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05410 2025-05-09 cs.CL cs.AI cs.LG 75%

Reasoning Models Don't Always Say What They Think

Yanda Chen, Joe Benton, Ansh Radhakrishnan, Jonathan Uesato, Carson Denison, John Schulman, Arushi Somani, Peter Hase, Misha Wagner, Fabien Roger, Vlad Mikulik, Samuel R. Bowman, Jan Leike, Jared Kaplan, Ethan Perez

机构 * Alignment Science Team, Anthropic(Anthropic对齐科学团队)

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.12962 2023-10-20 cs.CL cs.AI cs.LG 75%

An Emulator for Fine-Tuning Large Language Models using Small Language Models

Eric Mitchell, Rafael Rafailov, Archit Sharma, Chelsea Finn, Christopher D. Manning

专题命中 幻觉与事实性 :alignment(abstract);harmlessness(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13317 2026-08-14 cs.AI 新提交 74%

StateBridge: Training-free Hidden-state Alignment for Latent Communication in LLM Multi-Agent Systems

StateBridge:面向大语言模型多智能体系统潜在通信的无训练隐藏状态对齐

Yanwen Peng, Delvin Ce Zhang, Xi Wang, Nikolaos Aletras

机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院)

专题命中 幻觉与事实性 :alignment(title);分类 cs.AI

AI总结 StateBridge 是一种无训练的潜在通信方法,通过闭式正交变换对齐大语言模型多智能体的隐藏状态,在 26 个模型-任务对中 22 个取得最优或并列最优性能,优于基线。

Comments 18 pages, 3 figures, 4 tables, accepted by COLM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19060 2026-07-28 cs.CV cs.LG 版本更新 74%

Shift-Aware Calibration for Fine-Tuned CLIP: Leveraging Image-Text Alignment

用于微调CLIP的移位感知校准:利用图像-文本对齐

Song-Lin Lv, Yu-Yang Chen, Zhi Zhou, Lan-Zhe Guo

专题命中 幻觉与事实性 :alignment(title);分类 cs.LG

AI总结 研究针对微调CLIP时预测置信度与准确性不一致问题,提出无需训练的移位感知校准(SAC)方法,利用原始与微调CLIP输出对数差异作校准信号,经实验验证该方法在多数据集和微调方法上提升了校准效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07820 2026-07-03 cs.CL 74%

Reference Games as a Testbed for the Alignment of Model Uncertainty and Clarification Requests

参考游戏作为模型不确定性与澄清请求对齐的测试平台

Manar Ali, Judith Sieker, Sina Zarrieß, Hendrik Buschmeier

机构 * Digital Linguistics Lab(数字语言实验室) Computational Linguistics Group(计算语言学小组)

专题命中 幻觉与事实性 :alignment(title);分类 cs.CL

AI总结 本文通过参考游戏测试语言模型在不确定性识别与澄清请求表达上的能力,发现模型在简单任务中难以准确识别自身不确定性并转化为澄清行为。

Comments Accepted at GEM@ACL 2026, the 5th Generation, Evaluation & Metrics Workshop

Journal ref Proceedings of the Fifth Workshop on Generation, Evaluation and Metrics (GEM 2026), pp. 990-998

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16583 2026-06-16 cs.CL 新提交 74%

Uncertainty Is Not a Safety Net for Clinical VQA, but Can It Anticipate Model Failure?

不确定性并非临床VQA的安全网,但它能预测模型失败吗?

Arnisa Fazla, Alberto Testoni, Ameen Abu-Hanna, Barbara Plank, Iacer Calixto

机构 * Amsterdam University Medical Center, University of Amsterdam(阿姆斯特丹大学医学中心) Amsterdam Public Health(阿姆斯特丹公共卫生) LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 幻觉与事实性 :safety(title);分类 cs.CL

AI总结 研究临床视觉语言模型的不确定性估计是否可靠,发现其质量随模型准确率变化,在模型脆弱时失效,但能预测扰动下的性能崩溃。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06972 2026-06-08 cs.AI 新提交 74%

Accounting for Context: Shaping Moral Credences for Value Alignment

考虑情境:塑造道德信念以实现价值对齐

Jazon Szabo, Sanjay Modgil

机构 * University of Oxford(牛津大学)

专题命中 幻觉与事实性 :alignment(title);分类 cs.AI

AI总结 本文针对价值对齐中道德多元性问题,提出在聚合道德评估时必须考虑情境因素,并形式化道德不确定性下的决策,揭示弱帕累托原则的违反是辛普森悖论的一种变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27710 2026-05-28 cs.AI 74%

DeepSciVerify: Verifying Scientific Claim--Citation Alignment via LLM-Driven Evidence Escalation

DeepSciVerify: 通过LLM驱动的证据升级验证科学声明与引文对齐

Shaghayegh Sadeghi, Khashayar Khajavi, Rise Adhikari, Alexander Tessier

机构 * School of Computing Science, Simon Fraser University(西蒙弗雷泽大学计算科学学院)

专题命中 幻觉与事实性 :alignment(title);分类 cs.AI

AI总结 提出DeepSciVerify两阶段流水线,结合摘要推理与选择性升级到段落证据,在SCitance基准上以86.7 Micro-F1超越纯摘要基线4.5点,同时67%实例无需全文检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21651 2026-05-18 cs.LG 74%

Rethinking Output Alignment For 1-bit Post-Training Quantization of Large Language Models

重新思考1位后训练量化用于大语言模型的输出对齐

Dung Anh Hoang, Cuong Pham, Cuong Nguyen, Trung le, Jianfei Cai, Thanh-Toan Do

机构 * Department of Data Science and AI(数据科学与人工智能系) Monash University(墨尔本大学) Centre for Vision, Speech and Signal Processing(视觉、语音和信号处理中心) University of Surrey(萨里大学)

专题命中 幻觉与事实性 :alignment(title);分类 cs.LG

AI总结 本文提出一种新的1位后训练量化方法,解决输出对齐问题,通过减少层间误差累积和表示空间各向异性畸变,提升大语言模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21086 2026-05-05 cs.CL 74%

Orthographic Constraint Satisfaction and Human Difficulty Alignment in Large Language Models

正交约束满足与大语言模型中的人类难度对齐

Bryan E. Tuck, Rakesh M. Verma

机构 * University of Houston(德克萨斯大学休斯顿分校)

专题命中 幻觉与事实性 :alignment(title);分类 cs.CL

AI总结 本文评估了三种大语言模型在字符级约束满足任务上的表现,发现跨家族性能差异显著大于同家族参数扩展效果,且模型在处理常见词时存在系统性失败,揭示了对分布合理性依赖的问题。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04486 2026-01-09 cs.CR cs.AI cs.HC 74%

Decision-Aware Trust Signal Alignment for SOC Alert Triage

面向SOC警报分拣的决策感知信任信号对齐

Israt Jahan Chowdhury, Md Abu Yousuf Tanvir

机构 * Ontario Tech University(安大略技术大学)

专题命中 幻觉与事实性 :alignment(title);分类 cs.AI

AI总结 本文提出了一种决策感知的信任信号对齐方法,用于提升SOC警报分拣的决策支持效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25712 2025-10-01 cs.LG 74%

Expert Merging: Model Merging with Unsupervised Expert Alignment and Importance-Guided Layer Chunking

Dengming Zhang, Xiaowen Ma, Zhenliang Ni, Zhenkai Wu, Han Shu, Xin Jiang, Xinghao Chen

机构 * Zhejiang University(浙江大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 幻觉与事实性 :alignment(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05360 2025-01-10 cs.GT cs.AI 74%

On Corrigibility and Alignment in Multi Agent Games

Edmund Dable-Heath, Boyko Vodenicharski, James Bishop

专题命中 幻觉与事实性 :alignment(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00492 2024-11-04 cs.CL 74%

Multi-expert Prompting Improves Reliability, Safety, and Usefulness of Large Language Models

Do Xuan Long, Duong Ngoc Yen, Anh Tuan Luu, Kenji Kawaguchi, Min-Yen Kan, Nancy F. Chen

专题命中 幻觉与事实性 :safety(title);分类 cs.CL

Comments EMNLP 2024 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏