arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1732 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 1732 篇

2510.03136 2025-10-06 cs.CL 70%

Beyond the Final Layer: Intermediate Representations for Better Multilingual Calibration in Large Language Models

Ej Zhou, Caiqi Zhang, Tiancheng Hu, Chengzu Li, Nigel Collier, Ivan Vulić, Anna Korhonen

机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02580 2025-10-06 cs.AI 70%

V2X-UniPool: Unifying Multimodal Perception and Knowledge Reasoning for Autonomous Driving

Xuewen Luo, Fengze Yang, Fan Ding, Xiangbo Gao, Shuo Xing, Yang Zhou, Zhengzhong Tu, Chenxi Liu

机构 * University of Utah(犹他大学) Monash University(莫纳什大学) Texas A&M University(德克萨斯农工大学)

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17193 2025-07-24 physics.app-ph cs.LG 70%

Spintronic Bayesian Hardware Driven by Stochastic Magnetic Domain Wall Dynamics

Tianyi Wang, Bingqian Dai, Kin Wong, Yaochen Li, Yang Cheng, Qingyuan Shu, Haoran He, Puyang Huang, Hanshen Huang, Kang L. Wang

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03037 2025-06-04 cs.LG stat.ME stat.ML 70%

On the Need to Align Intent and Implementation in Uncertainty Quantification for Machine Learning

Shubhendu Trivedi, Brian D. Nord

机构 * Fermi National Accelerator Laboratory(费米国家加速器实验室) Department of Astronomy and Astrophysics, University of Chicago(芝加哥大学天文学与天体物理学系) Kavli Institute for Cosmological Physics, University of Chicago(芝加哥大学凯弗利宇宙物理研究所)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09301 2025-04-15 cs.AI 70%

Continuum-Interaction-Driven Intelligence: Human-Aligned Neural Architecture via Crystallized Reasoning and Fluid Generation

Pengcheng Zhou, Zhiqiang Nie, Haochen Li

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22573 2025-03-31 cs.CR cs.AI 70%

A Framework for Cryptographic Verifiability of End-to-End AI Pipelines

Kar Balan, Robert Learney, Tim Wood

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI

Comments Accepted to 11th ACM International Workshop on Security and Privacy Analytics (IWSPA 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05223 2025-03-27 cs.CL 70%

100% Elimination of Hallucinations on RAGTruth for GPT-4 and GPT-3.5 Turbo

Michael C. Wood, Adam A. Forbes

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01695 2025-03-04 cs.CL 70%

Generate, Discriminate, Evolve: Enhancing Context Faithfulness via Fine-Grained Sentence-Level Self-Evolution

Kun Li, Tianhua Zhang, Yunxiang Li, Hongyin Luo, Abdalla Moustafa, Xixin Wu, James Glass, Helen Meng

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18004 2024-12-25 cs.CL 70%

Correctness is not Faithfulness in RAG Attributions

Jonas Wallat, Maria Heuss, Maarten de Rijke, Avishek Anand

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17826 2024-12-05 cs.LG cs.AI cs.CL cs.CY cs.HC stat.ML 70%

Prediction-Powered Ranking of Large Language Models

Ivi Chatzi, Eleni Straitouri, Suhas Thejaswi, Manuel Gomez Rodriguez

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

Comments Published at NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02655 2024-10-10 cs.CL 70%

Calibrating the Confidence of Large Language Models by Eliciting Fidelity

Mozhi Zhang, Mianqiu Huang, Rundong Shi, Linsen Guo, Chong Peng, Peng Yan, Yaqian Zhou, Xipeng Qiu

专题命中 幻觉与事实性 :alignment(abstract);RLHF(abstract);分类 cs.CL

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13808 2024-08-27 cs.CL 70%

Towards Reliable Medical Question Answering: Techniques and Challenges in Mitigating Hallucinations in Language Models

Duy Khoa Pham, Bao Quoc Vo

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.CL

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07820 2024-08-13 cs.LG 70%

Large Language Models Are Zero-Shot Time Series Forecasters

Nate Gruver, Marc Finzi, Shikai Qiu, Andrew Gordon Wilson

专题命中 幻觉与事实性 :alignment(abstract);RLHF(abstract);分类 cs.LG

Comments NeurIPS 2023. Code available at: https://github.com/ngruver/llmtime

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10114 2024-07-23 cs.CL 70%

TokenSHAP: Interpreting Large Language Models with Monte Carlo Shapley Value Estimation

Roni Goldshmidt, Miriam Horovicz

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00793 2024-06-04 stat.ML cs.LG 70%

Is In-Context Learning in Large Language Models Bayesian? A Martingale Perspective

Fabian Falck, Ziyu Wang, Chris Holmes

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.LG

Comments Accepted at International Conference on Machine Learning (ICML) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03789 2024-04-08 cs.CV cs.AI 70%

Quantifying Uncertainty in Motion Prediction with Variational Bayesian Mixture

Juanwu Lu, Can Cui, Yunsheng Ma, Aniket Bera, Ziran Wang

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.AI

Comments Accepted at CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.01320 2023-10-25 cs.AI cs.CL cs.CY cs.LG cs.MA 70%

Avalon's Game of Thoughts: Battle Against Deception through Recursive Contemplation

Shenzhi Wang, Chang Liu, Zilong Zheng, Siyuan Qi, Shuo Chen, Qisen Yang, Andrew Zhao, Chaofei Wang, Shiji Song, Gao Huang

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.16519 2023-05-29 cs.CL 70%

The Dangers of trusting Stochastic Parrots: Faithfulness and Trust in Open-domain Conversational Question Answering

Sabrina Chiesurin, Dimitris Dimakopoulos, Marco Antonio Sobrevilla Cabezudo, Arash Eshghi, Ioannis Papaioannou, Verena Rieser, Ioannis Konstas

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL

Comments 5 pages, ACL Findings 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.02730 2022-11-08 stat.ML cs.LG 70%

Uncertainty-aware predictive modeling for fair data-driven decisions

Patrick Kaiser, Christoph Kern, David Rügamer

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.12807 2022-09-27 cs.LG cs.CV 70%

Out-of-Distribution Detection with Hilbert-Schmidt Independence Optimization

Jingyang Lin, Yu Wang, Qi Cai, Yingwei Pan, Ting Yao, Hongyang Chao, Tao Mei

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.LG

Comments Source code is available at \url{https://github.com/jylins/hood}

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.09625 2021-07-21 cs.CL 70%

Learning ULMFiT and Self-Distillation with Calibration for Medical Dialogue System

Shuang Ao, Xeno Acharya

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.CL

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03528 2026-07-07 cs.LG cs.AI cs.CL 新提交 69%

Aligning Language Models with Selective Prediction

通过选择性预测使语言模型对齐

Gaoxiang Luo, Yifan Wu, Sinian Zhang, Aryan Deshwal, Ju Sun

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Bioinformatics and Computational Biology Program(生物信息学与计算生物学项目) Division of Biostatistics and Health Data Science(生物统计学与健康数据科学部) University of Minnesota Twin Cities(明尼苏达大学双城分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG;safety(comments)

AI总结 研究聚焦提升语言模型可靠性,采用选择性预测策略,在模型训练后对齐阶段,提出基于强化学习的框架RLSR,以风险-覆盖曲线下面积为目标,在域内域外任务中风险-覆盖权衡表现更好。

Comments Accepted by ICML 2026 Agents in the Wild: Safety, Security, and Beyond Workshop, Project Page: https://sun-umn.github.io/RLSR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28963 2026-06-30 cs.CL cs.CY cs.LG 69%

Beyond the Mean: Three-Axis Fidelity for Aligning LLM-Based Survey Simulators from Small Pilot Data

超越均值:从小型试点数据对齐基于LLM的调查模拟器的三轴保真度

Eun Cheol Choi, Youngrae Kim, Prabhu Pugalenthi, Hong-En Chen, Bo-Ruei Huang

专题命中 幻觉与事实性 :alignment(abstract,comments);分类 cs.CL、cs.CY、cs.LG

AI总结 针对LLM模拟社会调查响应时的系统偏差,提出结构、边际和个体三轴保真度框架,通过提示、修正和微调三种方法对比,发现微调小型试点数据可实现平衡保真度,但保真度水平因子样本而异。

Comments 11 pages, 8 tables, 3 figures; Pluralistic Alignment @ ICML 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02904 2026-04-21 cs.CL cs.AI cs.LG 69%

Enhancing Trust in Large Language Models via Uncertainty-Calibrated Fine-Tuning

通过不确定性校准微调增强大语言模型的信任

Ranganath Krishnan, Piyush Khanna, Omesh Tickoo

机构 * Capital One, AI Labs(Capital One人工智能实验室) Wayve Technologies(Wayve技术公司) Intel Corporation(英特尔公司)

专题命中 幻觉与事实性 :trustworthy(abstract,comments);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种不确定性感知微调方法,用于提升大语言模型在自然语言生成任务中的不确定性估计能力,从而提高生成响应的可信度并减少幻觉现象。

Comments ICLR 2026 Trustworthy AI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10585 2026-04-14 cs.LG cs.AI cs.CL 69%

Calibration Collapse Under Sycophancy Fine-Tuning: How Reward Hacking Breaks Uncertainty Quantification in LLMs

在奉承式微调下校准崩溃:奖励黑客如何破坏大语言模型的不确定性量化

Subramanyam Sahoo

机构 * Cambridge AI Safety Hub (CAISH)(剑桥人工智能安全中心)

专题命中 幻觉与事实性 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG;trustworthy(comments)

AI总结 研究探讨了在强化学习从人类反馈(RLHF)等方案中,奉承式微调对校准的影响,发现GRPO微调导致校准退化,尽管效果不显著,但经矩阵缩放后仍保留较高校准误差。

Comments Accepted at the AISTATS 2026 Workshop on Towards Trustworthy Predictions: Theory and Applications of Calibration for Modern AI. 14 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14233 2025-01-07 cs.CV cs.AI cs.CL cs.LG 69%

Detecting and Mitigating Hallucination in Large Vision Language Models via Fine-Grained AI Feedback

Wenyi Xiao, Ziwei Huang, Leilei Gan, Wanggui He, Haoyuan Li, Zhelun Yu, Fangxun Shu, Hao Jiang, Linchao Zhu

专题命中 幻觉与事实性 :DPO(abstract,comments);分类 cs.CL、cs.AI、cs.LG

Comments repo: https://github.com/Mr-Loevan/HSA-DPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13760 2026-08-17 cs.CL cs.AI cs.CV cs.LG 新提交 67%

Amplified Does Not Mean Predictive: Reasoning Behaviors in Thinking Models

放大并不意味着具有预测性:思考模型中的推理行为

Jean de Dieu Nyandwi, Leena Mathur, Yonatan Bisk, Robert Hawkins, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究揭示思考模型存在“放大-提升差距”,即面向推理的训练放大了与正确性关联弱的推理行为,却未放大高提升值的关键行为,推动了过程级推理目标的研究。

Comments Published in COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05909 2026-08-07 cs.CR 新提交 67%

MMAligner: Safeguarding Multimodal Large Language Models through Representation Calibration

MMAligner:通过表示校准保护多模态大语言模型

Shenyi Zhang, Keyan Guo, Zihao Wang, Xuebin Li, Lingchen Zhao, Hongxin Hu, Chao Shen, Qian Wang

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract)

AI总结 MMAligner通过校准多模态大语言模型的表示,将不安全多模态输入的拒绝率提升至99%,仅造成不足2%的效用下降,显著优化了安全与效用的权衡。

Comments To Appear in the Proceedings of The ACM Conference on Computer and Communications Security (CCS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29527 2026-08-03 cs.LG cs.AI cs.CY econ.EM stat.ML 新提交 67%

TerraNova: A Foundation Model for the Anthropocene

TerraNova:人类世的基础模型

Carlos Rodriguez-Pardo, Massimo Tavoni

机构 * Politecnico di Milano(米兰理工大学) RFF-CMCC European Institute on Economics and the Environment (EIEE)(RFF-CMCC欧洲经济与环境研究所) Euro-Mediterranean Center on Climate Change (CMCC)(欧洲地中海气候变化中心)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 TerraNova是适配原生几何的基础模型,融合地球物理与社会数据,可重建密集场、适配未见变量,兼具地理空间编码能力与国家层面功能。

Comments 32 pages, 16 figures. Supplementary Information (full methodological specification, ablation programme, extended results, computational cost; 157 pages) available at the project page: https://carlosrodriguezpardo.es/projects/TerraNova/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08159 2026-07-31 cs.LG cs.AI cs.CL 版本更新 67%

The Confidence Manifold: Geometric Structure of Correctness Representations in Language Models

自信流形:语言模型中正确性表示的几何结构

Seonglae Cho, Zekun Wu, Kleyton Da Costa, Adriano Koshiyama

机构 * University College London(伦敦大学学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示语言模型正确性表示的几何结构,发现低维子空间中的质心距离与探测器性能一致,表明检测是几何而非学习过程。

详情

展开后加载摘要…

URL PDF HTML 收藏