arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1732 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 1732 篇

2602.00085 2026-02-03 cs.LG cs.AI cs.CL 67%

CARE-RFT: Confidence-Anchored Reinforcement Finetuning for Reliable Reasoning in Large Language Models

CARE-RFT:基于置信度的强化微调用于大语言模型中的可靠推理

Shuozhe Li, Jincheng Cao, Bodun Hu, Aryan Mokhtari, Leqi Liu, Amy Zhang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CARE-RFT通过引入置信度锚定的正则化方法,在保持大语言模型推理能力的同时提升其可信度和校准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04435 2026-01-09 cs.CL cs.AI cs.CY 67%

Accommodation and Epistemic Vigilance: A Pragmatic Account of Why LLMs Fail to Challenge Harmful Beliefs

适应与认知警觉:一种实用视角下为何LLMs未能挑战有害信念

Myra Cheng, Robert D. Hawkins, Dan Jurafsky

机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学) Department of Linguistics, Stanford University(语言学系,斯坦福大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文通过语用学视角揭示LLMs在挑战有害信念时的失败原因,并提出简单干预提升安全性的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03860 2026-01-06 cs.CL cs.AI cs.LG 67%

Hallucination to Truth: A Review of Fact-Checking and Factuality Evaluation in Large Language Models

幻觉与事实:大型语言模型中事实核查与事实性评估的综述

Subhey Sadi Rahman, Md. Adnanul Islam, Md. Mahbub Alam, Musarrat Zeba, Md. Abdur Rahman, Sadia Sultana Chowa, Mohaimenul Azam Khan Raiaan, Sami Azam

机构 * Department of Computer Science and Engineering, United International University, Dhaka 1212, Bangladesh(乌姆特国际大学计算机科学与工程系) Department of Computer Science and Engineering, Daffodil International University, Dhaka-1341, Bangladesh(达芙尼国际大学计算机科学与工程系) Faculty of Science and Technology, Charles Darwin University, Casuarina, NT 0909, Australia(查尔斯·达尔文大学科学与技术学院)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文综述了大型语言模型中事实核查与事实性评估的关键挑战及方法,强调了提升事实准确性的重要性。

Journal ref Artif. Intell. Rev. (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21722 2025-12-29 cs.RO 67%

MAction-SocialNav: Multi-Action Socially Compliant Navigation via Reasoning-enhanced Prompt Tuning

MAction-SocialNav: 通过推理增强的提示调优实现多动作社交合规导航

Zishuo Wang, Xinyu Zhang, Zhuonan Liu, Tomohito Kawabata, Daeun Song, Xuesu Xiao, Ling Xiao

机构 * Graduate School of Information Science and Technology, Hokkaido University(信息科学与技术研究生院,北海道大学) Graduate School of Computer Science, George Mason University(计算机科学研究生院,乔治·梅森大学)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract)

AI总结 MAction-SocialNav通过推理增强的提示调优实现多动作社交合规导航,提升决策质量与安全性,效率高于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19004 2025-12-23 cs.CL cs.AI cs.LG 67%

Context-Aware Initialization for Reducing Generative Path Length in Diffusion Language Models

基于上下文的初始化以减少扩散语言模型中的生成路径长度

Tongyuan Miao, Gary Huang, Kai Jun Han, Annie Jiang

机构 * University of Michigan(密歇根大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于上下文的初始化方法,通过注入提示条件先验来减少扩散语言模型生成路径长度,提升解码效率并解决预热启动的准确性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07564 2025-12-11 cs.CV cs.AI cs.CL cs.LG 67%

Toward More Reliable Artificial Intelligence: Reducing Hallucinations in Vision-Language Models

迈向更可靠的人工智能:减少视觉-语言模型中的幻觉

Kassoum Sanogo, Renzo Ardiccioni

机构 * Department of CS AI and Data Science(计算机科学与数据科学系) ESEO Engineering School(ESEO工程学院) Faculty of Law, Economy, Management(法学院、经济与管理学院)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出无需训练的自我纠正框架,通过不确定性引导的视觉再注意力减少视觉-语言模型中的幻觉,提升响应准确性。

Comments 24 pages, 3 figures, 2 tables. Training-free self-correction framework for vision-language models. Code and implementation details will be released at: https://github.com/kassoumsanogo1/self-correcting-vlm-re-Attention.git

Journal ref The 4th National and International Academic Conference Celebrating the 20th Anniversary of Rajapruk University (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22351 2025-12-01 cs.CV 67%

INSIGHT: An Interpretable Neural Vision-Language Framework for Reasoning of Generative Artifacts

INSIGHT: 一种可解释的神经视觉-语言框架,用于生成性艺术作品的推理

Anshul Bagaria

机构 * Indian Institute of Technology, Madras, Tamil Nadu, India(印度理工学院Madras分校,泰米尔纳德州,印度)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract)

AI总结 INSIGHT提出了一种可解释的神经视觉-语言框架,通过多尺度定位、语义对齐和结构化提示协议,实现对生成性艺术作品的鲁棒检测与透明解释。

Comments 36 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11895 2025-11-26 cs.CV 67%

Adversarial Robustness for Unified Multi-Modal Encoders via Efficient Calibration

通过高效校准实现统一多模态编码器的对抗鲁棒性

Chih-Ting Liao, Zhangquan Chen, Chunlei Meng, Tzu-Yu Huang, Xin Cao, Xu Zheng

机构 * UNSW Sydney(新南威尔士大学悉尼分校) Tsinghua University(清华大学) Fudan University(复旦大学) UTS(澳大利亚UTS大学) HKUST(GZ)(香港理工大学(广州))

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract)

AI总结 本研究提出高效对抗校准框架,提升统一多模态编码器的对抗鲁棒性,同时保持清洁性能,提升47.3%的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05810 2025-11-18 cs.AI cs.CL cs.LG 67%

DiagnoLLM: A Hybrid Bayesian Neural Language Framework for Interpretable Disease Diagnosis

Bowen Xu, Xinyue Zeng, Jiazhen Hu, Tuo Wang, Adithya Kulkarni

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10837 2025-11-17 cs.LG cs.AI cs.CL 67%

The Map of Misbelief: Tracing Intrinsic and Extrinsic Hallucinations Through Attention Patterns

Elyes Hajji, Aymen Bouguerra, Fabio Arnez

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at AAAI 2025-FS-ATRACC

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12839 2025-11-06 cs.CL cs.AI cs.CE cs.CY 67%

FaStfact: Faster, Stronger Long-Form Factuality Evaluations in LLMs

Yingjia Wan, Haochen Tan, Xiao Zhu, Xinyu Zhou, Zhiwei Li, Qingsong Lv, Changxuan Sun, Jiaqi Zeng, Yi Xu, Jianqiao Lu, Yinhong Liu, Zhijiang Guo

机构 * UCLA(美国大学洛杉矶分校) CUHK(香港中文大学) HKUST (GZ)(香港科技大学(广州)) HKUST(香港科技大学) Tsinghua University(清华大学) ECNU(华东师范大学) NVIDIA(英伟达) UCL(伦敦大学学院) HKU(香港大学) University of Cambridge(剑桥大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

Comments EMNLP 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05777 2025-11-04 cs.CL cs.AI cs.CY 67%

Medical Hallucinations in Foundation Models and Their Impact on Healthcare

Yubin Kim, Hyewon Jeong, Shan Chen, Shuyue Stella Li, Chanwoo Park, Mingyu Lu, Kumail Alhamoud, Jimin Mun, Cristina Grau, Minseok Jung, Rodrigo Gameiro, Lizhou Fan, Eugene Park, Tristan Lin, Joonsik Yoon, Wonjin Yoon, Maarten Sap, Yulia Tsvetkov, Paul Liang, Xuhai Xu, Xin Liu, Chunjong Park, Hyeonhoon Lee, Hae Won Park, Daniel McDuff, Samir Tulebaev, Cynthia Breazeal

机构 * Massachusetts Institute of Technology(麻省理工学院) Harvard Medical School(哈佛医学院) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) Seoul National University Hospital(首尔国立大学医院) Google Research(谷歌研究) Google DeepMind(谷歌DeepMind) Columbia University(哥伦比亚大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23607 2025-11-03 cs.LG cs.AI cs.CL 67%

Deep Learning-based Prediction of Clinical Trial Enrollment with Uncertainty Estimates

Tien Huu Do, Antoine Masquelier, Nae Eoun Lee, Jonathan Crowther

机构 * Pfizer(辉瑞公司) Merck(默克公司)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.11593 2025-10-28 cs.CV cs.AI cs.CL cs.DB cs.LG 67%

Improving Image Captioning Descriptiveness by Ranking and LLM-based Fusion

Luigi Celona, Simone Bianco, Marco Donzella, Paolo Napoletano

机构 * Department of Informatics, Systems and Communication(信息学、系统与通信系)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments This manuscript has been accepted for publication in Springer Neural Computing and Applications

Journal ref Neural Computer & Application 37, 27279-27299 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21657 2025-10-22 cs.CL cs.AI cs.LG 67%

Explaining Large Language Models with gSMILE

Zeinab Dehghani, Mohammed Naveed Akram, Koorosh Aslansefat, Adil Khan, Yiannis Papadopoulos

机构 * University of Hull(赫尔大学) Fraunhofer IESE(弗劳恩霍夫研究所)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17598 2025-10-21 cs.LG cs.AI cs.CL 67%

Hallucination Detection in LLMs Using Spectral Features of Attention Maps

Jakub Binkowski, Denis Janiak, Albert Sawczyn, Bogdan Gabrys, Tomasz Kajdanowicz

机构 * Wroclaw University of Science and Technology(沃拉日-克拉夫大学科学与技术学院) University of Technology Sydney(悉尼技术大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to EMNLP 2025. Code available at https://github.com/graphml-lab-pwr/lapeigvals

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15260 2025-10-20 cs.LG cs.AI cs.CL 67%

DRO-InstructZero: Distributionally Robust Prompt Optimization for Large Language Models

Yangyang Li

机构 * Department of Electrical Engineering and Computer Science(电气工程与计算机科学系) Massachusetts Institute of Technology(麻省理工学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Preprint. Under review at ICLR 2026. 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04933 2025-10-07 cs.CL cs.AI cs.IT cs.LG cs.NE math.IT 67%

The Geometry of Truth: Layer-wise Semantic Dynamics for Hallucination Detection in Large Language Models

Amir Hameed Mir

机构 * Sirraya Labs(Sirraya实验室)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Comments: 14 pages, 14 figures, 5 tables. Code available at: https://github.com/sirraya-tech/Sirraya_LSD_Code

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19629 2025-10-03 cs.SE cs.RO 67%

Software Engineering for Self-Adaptive Robotics: A Research Agenda

Hassan Sartaj, Shaukat Ali, Ana Cavalcanti, Lukas Esterle, Cláudio Gomes, Peter Gorm Larsen, Anastasios Tefas, Jim Woodcock, Houxiang Zhang

机构 * Simula Research Laboratory(Simula研究实验室) University of York(约克大学) Aarhus University(奥胡斯大学) Aristotle University of Thessaloniki(塞萨洛尼基亚里士多德大学) Southwest University(西南大学) Norwegian University of Science and Technology(挪威科学与技术大学)

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09598 2025-09-30 cs.CL cs.AI cs.CY 67%

How to Protect Yourself from 5G Radiation? Investigating LLM Responses to Implicit Misinformation

Ruohao Guo, Wei Xu, Alan Ritter

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments Accepted to EMNLP 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19517 2025-09-29 cs.AI cs.CL cs.LG 67%

Cognitive Load Limits in Large Language Models: Benchmarking Multi-Hop Reasoning

Sai Teja Reddy Adapala

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10901 2025-09-19 cs.LG cs.AI cs.CL 67%

3DS: Medical Domain Adaptation of LLMs via Decomposed Difficulty-based Data Selection

Hongxin Ding, Yue Fang, Runchuan Zhu, Xinke Jiang, Jinyang Zhang, Yongxin Xu, Xu Chu, Junfeng Zhao, Yasha Wang

机构 * School of Computer Science, Peking University, Beijing, China(北京大学计算机学院) Key Laboratory of High Confidence Software Technologies, Ministry of Education(教育部高可信软件技术重点实验室) National Engineering Research Center for Software Engineering, Peking University, China(软件工程国家级工程研究中心) Big Data Technology Research Center, Nanhu Laboratory, Jiaxing, China(南湖实验室大数据技术研究中心) Peking University Information Technology Institute, Tianjin Binhai, China(北京大学信息科学技术研究院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to EMNLP 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16146 2025-09-16 cs.CV cs.AI cs.CL cs.LG 67%

Steering LVLMs via Sparse Autoencoder for Hallucination Mitigation

Zhenglin Hua, Jinghan He, Zijun Yao, Tianxu Han, Haiyun Guo, Yuheng Jia, Junfeng Fang

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University)(东南大学新一代人工智能技术及其交叉应用关键实验室) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Wuhan University of Technology(武汉理工大学) National University of Singapore(新加坡国立大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15133 2025-09-16 cs.CL cs.AI cs.CV cs.HC cs.LG 67%

EasyEdit2: An Easy-to-use Steering Framework for Editing Large Language Models

Ziwen Xu, Shuxun Wang, Kewei Xu, Haoming Xu, Mengru Wang, Xinle Deng, Yunzhi Yao, Guozhou Zheng, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Ocean Research Center of Zhoushan, Zhejiang University(舟山海洋研究中心,浙江大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2025 System Demonstrations. Demo: https://www.youtube.com/watch?v=AkfoiPfp5rQ; code: https://github.com/zjunlp/EasyEdit

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03525 2025-09-03 cs.CV 67%

Vehicle-to-Everything Cooperative Perception for Autonomous Driving

Tao Huang, Jianan Liu, Xi Zhou, Dinh C. Nguyen, Mostafa Rahimi Azghadi, Yuxuan Xia, Qing-Long Han, Sumei Sun

机构 * College of Science and Engineering, James Cook University(科学与工程学院,詹姆斯库克大学) Momoni AI Department of Electrical and Computer Engineering, University of Alabama in Huntsville(电气与计算机工程系,阿拉巴马大学亨茨维尔分校) Department of Automation and Intelligent Sensing, Shanghai Jiaotong University(自动化与智能感知系,上海交通大学) School of Engineering, Swinburne University of Technology(工程学院,斯威本技术大学) Institute for Infocomm Research, Agency for Science, Technology and Research (A*STAR)(信息与通信研究机构,科技研究局(A*STAR))

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract)

Comments This article has been accepted for publication in Proceedings of the IEEE on 11 August 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02319 2025-08-27 cs.CV 67%

Is Uncertainty Quantification a Viable Alternative to Learned Deferral?

Anna M. Wundram, Christian F. Baumgartner

机构 * Faculty of Health Sciences and Medicine, University of Lucerne, Switzerland(健康科学与医学学院,卢塞恩大学,瑞士) Cluster of Excellence -- ML for Science, University of Tübingen, Germany(卓越中心——科学中的机器学习,图宾根大学,德国)

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract)

Comments Accepted as an oral presentation at MICCAI UNSURE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17419 2025-06-24 cs.CL cs.AI cs.LG stat.ML 67%

UProp: Investigating the Uncertainty Propagation of LLMs in Multi-Step Agentic Decision-Making

Jinhao Duan, James Diffenderfer, Sandeep Madireddy, Tianlong Chen, Bhavya Kailkhura, Kaidi Xu

机构 * Drexel University(德雷塞尔大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) Argonne National Laboratory(阿贡国家实验室) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 19 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11001 2025-06-16 cs.SE cs.AI cs.CY cs.LG 67%

Rethinking Technological Readiness in the Era of AI Uncertainty

S. Tucker Browne, Mark M. Bailey

机构 * United States Air Force(美国空军) National Intelligence University(国家情报大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.CY、cs.LG

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17004 2025-06-03 cs.LG cs.AI cs.CL stat.ML 67%

(Im)possibility of Automated Hallucination Detection in Large Language Models

Amin Karbasi, Omar Montasser, John Sous, Grigoris Velegkas

机构 * Yale University(耶鲁大学)

专题命中 幻觉与事实性 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05980 2025-06-03 cs.CL cs.AI cs.LG 67%

FactLens: Benchmarking Fine-Grained Fact Verification

Kushan Mitra, Dan Zhang, Sajjadur Rahman, Estevam Hruschka

机构 * Megagon Labs(梅加贡实验室) Adobe Inc.(Adobe公司)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 12 pages, updated version

详情

展开后加载摘要…

URL PDF HTML 收藏