arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1738 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 1738 篇

2512.11750 2025-12-15 eess.SY cs.LG cs.SY 57%

LUCID: Learning-Enabled Uncertainty-Aware Certification of Stochastic Dynamical Systems

LUCID:基于学习的不确定性感知随机动力系统认证

Ernesto Casablanca, Oliver Schön, Paolo Zuliani, Sadegh Soudjani

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 LUCID通过学习控制障碍证书和傅里叶核展开,为随机动态系统提供鲁棒且高效的认证框架,实现形式安全保证。

Comments The manuscript has been accepted for publication in the main track of AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08938 2025-12-11 cs.HC cs.CY 57%

The Impact of Artificial Intelligence on Strategic Technology Management: A Mixed-Methods Analysis of Resources, Capabilities, and Human-AI Collaboration

人工智能对战略技术管理的影响:资源、能力和人机协作的混合方法分析

Massimo Fascinari, Vincent English

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CY

AI总结 本文通过混合方法分析,探讨AI如何提升战略技术管理的有效性,提出AIbSTM框架,强调人机协作而非自主AI领导。

Comments 32 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07334 2025-12-09 cs.AI 57%

Hallucination as a Computational Boundary: A Hierarchy of Inevitability and the Oracle Escape

幻觉作为计算边界:不可避免性层级与 oracle 逃逸

Wang Xi, Quan Shi, Zenghui Ding, Jianqing Gao, Xianjun Yang

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文提出计算类对齐原则,通过构建计算必要性层级和逃逸路线,为大型语言模型的幻觉问题提供理论框架和解决方案。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12868 2025-12-08 cs.HC cs.AI 57%

As Confidence Aligns: Exploring the Effect of AI Confidence on Human Self-confidence in Human-AI Decision Making

信心相辅:探索AI信心对人类自信心在人类-AI决策中的影响

Jingshu Li, Yitian Yang, Q. Vera Liao, Junti Zhang, Yi-Chieh Lee

机构 * National University of Singapore(新加坡国立大学) Microsoft Research(微软研究院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本研究发现人类自信心与AI置信度相辅相成,且这种一致性在AI退出后仍持续,同时实时反馈会降低一致性,表明两者并非独立。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00882 2025-12-04 cs.CV cs.AI 57%

Look, Recite, Then Answer: Enhancing VLM Performance via Self-Generated Knowledge Hints

看、复述、然后回答:通过自动生成的知识提示提升VLM性能

Xisheng Feng

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 通过自动生成的知识提示提升VLM性能,采用模块化设计减少幻觉,实现精准农业中杂草识别准确率的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02340 2025-12-03 cs.AI cs.CV 57%

Reasoning Path and Latent State Analysis for Multi-view Visual Spatial Reasoning: A Cognitive Science Perspective

多视角视觉空间推理的推理路径与潜在状态分析:从认知科学视角

Qiyao Xue, Weichen Liu, Shiqi Wang, Haoming Wang, Yuyang Wu, Wei Gao

机构 * University of Pittsburgh(匹兹堡大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 ReMindView-Bench从认知科学视角评估VLMs在多视角空间推理中的表现,揭示其在跨视角对齐和视角取向方面的不足。

Comments 23 pages, 37 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25686 2025-12-02 cs.LG 57%

EXP-CAM: Explanation Generation and Circuit Discovery Using Classifier Activation Matching

EXP-CAM:基于分类器激活匹配的解释生成与电路发现

Pirzada Suhail, Aditya Anand, Amit Sethi

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 EXP-CAM通过分类器激活匹配生成最小且忠实的图像解释,揭示模型内部计算机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23440 2025-12-01 cs.LG cs.AR cs.DC stat.ML 57%

Accelerated Execution of Bayesian Neural Networks using a Single Probabilistic Forward Pass and Code Generation

利用单次概率前向传递和代码生成加速贝叶斯神经网络

Bernhard Klein, Falk Selker, Hendrik Borras, Sophie Steger, Franz Pernkopf, Holger Fröning

机构 * Heidelberg University(海德堡大学) Graz University of Technology(格拉茨技术大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文提出一种基于概率前向传递和代码生成的方法,显著提升贝叶斯神经网络在嵌入式系统中的计算效率和部署性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22004 2025-12-01 stat.ML cs.LG 57%

On the Effect of Regularization on Nonparametric Mean-Variance Regression

关于正则化对非参数均方回归的影响

Eliot Wong-Toi, Alex Boyd, Vincent Fortuin, Stephan Mandt

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本文研究了正则化对非参数均方回归模型的影响,通过统计场理论框架揭示了正则化驱动的相变现象,并展示了在UCI和ClimSim数据集上的鲁棒校准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21705 2025-12-01 cs.CL cs.CV 57%

Insight-A: Attribution-aware for Multimodal Misinformation Detection

Insight-A: 多模态虚假信息检测中的归因意识

Junjie Wu, Yumeng Fu, Chen Gong, Guohong Fu

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Institute of Artificial Intelligence, Soochow University(苏州大学人工智能研究院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL

AI总结 Insight-A通过归因意识和分层推理提升多模态虚假信息检测效果,有效识别伪造来源并增强跨模态一致性检查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.00259 2025-12-01 cs.CL 57%

AutoHall: Automated Factuality Hallucination Dataset Generation for Large Language Models

AutoHall: 自动化生成大语言模型的事实性幻觉数据集

Zouying Cao, Yifei Yang, XiaoJing Li, Hai Zhao

机构 * AGI Institute, School of Computer Science, Shanghai Jiao Tong University(AGI研究院,计算机科学学院,上海交通大学) Shanghai Key Laboratory of Trusted Data Circulation and Governance in Web3(上海可信数据流通与治理Web3重点实验室) School of Media & Communication, Shanghai Jiao Tong University(媒体与传播学院,上海交通大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL

AI总结 AutoHall通过自动化生成模型特定的幻觉数据集,提升大语言模型的事实性内容检测能力。

Comments Accepted by IEEE Transactions on Audio, Speech, and Language Processing (TASLP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21401 2025-11-27 cs.CL 57%

Can LLMs extract human-like fine-grained evidence for evidence-based fact-checking?

大语言模型能否提取出具有人类细粒度证据的证据以用于基于证据的事实核查?

Antonín Jarolím, Martin Fajčík, Lucia Makaiová

机构 * Brno University of Technology, Czech Republic(布拉格技术大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本文研究了大语言模型在细粒度证据提取任务中的表现,通过新数据集评估发现,模型大小与对齐程度之间存在有效平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20704 2025-11-27 cs.LG stat.ML 57%

Pretraining Transformer-Based Models on Diffusion-Generated Synthetic Graphs for Alzheimer's Disease Prediction

基于扩散生成合成图的Transformer模型预训练用于阿尔茨海默病预测

Abolfazl Moslemi, Hossein Peyvandi

机构 * Sharif University of Technology(谢里夫理工学院) Pasargad Institute for Advanced Innovative Solutions(帕萨尔加德先进创新解决方案研究所)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本研究提出基于扩散生成合成图的Transformer模型,通过预训练提升阿尔茨海默病预测的准确性和泛化能力。

Comments 14 pages. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17572 2025-11-25 cs.CL cs.SI 57%

Community-Aligned Behavior Under Uncertainty: Evidence of Epistemic Stance Transfer in LLMs

在不确定性下对齐的行为:LLMs中认知立场转移的证据

Patrick Gerard, Aiden Chang, Svitlana Volkova

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本研究通过删除事件知识验证LLMs在无知情况下仍能保持社区特定的行为模式,证明对齐编码了结构化且可推广的行为,推动更安全的LLM部署。

Comments 37 pages, EurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12972 2025-11-24 cs.CV cs.AI 57%

Aligning Vision to Language: Annotation-Free Multimodal Knowledge Graph Construction for Enhanced LLMs Reasoning

对齐视觉与语言:无需注释的多模态知识图谱构建以增强大语言模型推理

Junming Liu, Siyuan Meng, Yanting Gao, Song Mao, Pinlong Cai, Guohang Yan, Yirong Chen, Zilin Bian, Ding Wang, Botian Shi

机构 * Tongji University(同济大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(华东师范大学) Stanford University(斯坦福大学) New York University(纽约大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文提出 VaLiK 方法,通过跨模态信息补充构建无需注释的多模态知识图谱,提升大语言模型推理能力。

Comments 14 pages, 7 figures, 6 tables; Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16333 2025-11-21 cs.LG 57%

Beyond Generative AI: World Models for Clinical Prediction, Counterfactuals, and Planning

超越生成式AI:用于临床预测、反事实和规划的世界模型

Mohammad Areeb Qazi, Maryam Nadeem, Mohammad Yaqub

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(莫莫德·本·扎伊德人工智能大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文探讨了世界模型在医疗领域中的应用,旨在通过预测动态、反事实评估和规划提升临床决策的可靠性。

Comments 2 Figures, 1 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15921 2025-11-21 cs.AI 57%

Thinking, Faithful and Stable: Mitigating Hallucinations in LLMs

思考、忠实与稳定:减轻大语言模型幻觉的方法

Chelsea Zou, Yiheng Yao, Basant Khalil

机构 * Stanford University(斯坦福大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本研究提出一种通过强化学习策略减少大语言模型幻觉的方法,通过置信度对齐和熵激增信号提升推理的连贯性和准确性。

Comments Originally released June 5, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01840 2025-11-20 cs.LG 57%

Optimizing In-Context Learning for Efficient Full Conformal Prediction

Weicao Deng, Sangwoo Park, Min Li, Osvaldo Simeone

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12579 2025-11-18 cs.AI 57%

Enhancing Conversational Recommender Systems with Tree-Structured Knowledge and Pretrained Language Models

Yongwen Ren, Chao Wang, Peng Du, Chuan Qin, Dazhong Shen, Hui Xiong

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04832 2025-11-18 cs.CL 57%

Joint Evaluation of Answer and Reasoning Consistency for Hallucination Detection in Large Reasoning Models

Changyue Wang, Weihang Su, Qingyao Ai, Yiqun Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Quan Cheng Laboratory(泉城实验室)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10227 2025-11-13 cs.LG physics.app-ph 57%

A Certifiable Machine Learning-Based Pipeline to Predict Fatigue Life of Aircraft Structures

Ángel Ladrón, Miguel Sánchez-Domínguez, Javier Rozalén, Fernando R. Sánchez, Javier de Vicente, Lucas Lacasa, Eusebio Valero, Gonzalo Rubio

机构 * ETSIAE-UPM - School of Aeronautics, Universidad Politécnica de Madrid(西班牙马德里理工大学航空学院) Institute for Cross-Disciplinary Physics and Complex Systems (IFISC), CSIC-UIB(跨学科物理与复杂系统研究所(IFISC)) Center for Computational Simulation, Universidad Politécnica de Madrid, Campus de Montegancedo, Boadilla del Monte(马德里理工大学计算模拟中心)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

Comments 34 pages, 17 figures

Journal ref Engineering Failure Analysis, Volume 184, 2026, 110334

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07700 2025-11-12 cs.LG cs.CV eess.IV 57%

On the Role of Calibration in Benchmarking Algorithmic Fairness for Skin Cancer Detection

Brandon Dominique, Prudence Lam, Nicholas Kurtansky, Jochen Weber, Kivanc Kose, Veronica Rotemberg, Jennifer Dy

机构 * Northeastern University(东北大学) Memorial Sloan Kettering Cancer Center(纪念斯隆凯特琳癌症中心)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

Comments 19 pages, 4 figures. Accepted for publication at the Journal of Machine Learning for Biomedical Imaging (MELBA) https://melba-journal.org/2025:027

Journal ref Machine.Learning.for.Biomedical.Imaging. 3 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07295 2025-11-12 cs.IR cs.AI 57%

Hard vs. Noise: Resolving Hard-Noisy Sample Confusion in Recommender Systems via Large Language Models

Tianrui Song, Wen-Shuo Chao, Hao Liu

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06607 2025-11-11 cs.LG 57%

Explainable Probabilistic Machine Learning for Predicting Drilling Fluid Loss of Circulation in Marun Oil Field

Seshu Kumar Damarla, Xiuli Zhu

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

Comments 5 pages, 3 tables, 4 figrues

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07863 2025-11-11 cs.LG 57%

Robust Hallucination Detection in LLMs via Adaptive Token Selection

Mengjia Niu, Hamed Haddadi, Guansong Pang

机构 * Imperial College London, UK(伦敦帝国学院) Singapore Management University(新加坡管理大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05804 2025-11-11 cs.LG cs.SY eess.SP eess.SY stat.ML 57%

Catching Contamination Before Generation: Spectral Kill Switches for Agents

Valentin Noël

机构 * Devoteam

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

Comments Preprint under review (2025). 9 pages, 2 figures. Code and scripts: to be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11196 2025-11-11 cs.CL cs.CV 57%

Evaluating Reasoning Faithfulness in Medical Vision-Language Models using Multimodal Perturbations

Johannes Moll, Markus Graf, Tristan Lemke, Nicolas Lenhart, Daniel Truhn, Jean-Benoit Delbrouck, Jiazhen Pan, Daniel Rueckert, Lisa C. Adams, Keno K. Bressem

机构 * Technical University of Munich (TUM)(慕尼黑技术大学) TUM University Hospital(慕尼黑技术大学医院) German Heart Center TUM University Hospital(慕尼黑技术大学医院德国心脏中心) Department of Radiology(放射科) Klinikum rechts der Isar TUM University Hospital(慕尼黑技术大学医院右岸诊所) Uniklinik RWTH Aachen(亚琛工业大学医院) HOPPR IL USA(HOPPR美国) University of Oxford(牛津大学) Imperial College London(伦敦帝国学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

Comments Accepted to ML4H 2025 Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21257 2025-11-11 cs.CV cs.CL 57%

Hallucination as an Upper Bound: A New Perspective on Text-to-Image Evaluation

Seyed Amir Kasaei, Mohammad Hossein Rohban

机构 * Department of Computer Engineering, Sharif University of Technology(谢里夫理工大学计算机工程系)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

Comments Accepted at GenProCC NeurIPS 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09360 2025-11-10 cs.CL 57%

MetaRAG: Metamorphic Testing for Hallucination Detection in RAG Systems

Channdeth Sok, David Luz, Yacine Haddam

机构 * Forvia Paris Tech Center, GIT, Immeuble Lumière, 40 avenue des Terroirs de France, 75012 Paris, France(巴黎Forvia技术中心,GIT,Lumière大厦,法国巴黎75012)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL

Comments Identity-Aware AI workshop at 28th European Conference on Artificial Intelligence, October 25, 2025, Bologna, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23845 2025-11-06 cs.CL 57%

Read Your Own Mind: Reasoning Helps Surface Self-Confidence Signals in LLMs

Jakub Podolak, Rajeev Verma

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL

Comments Presented at UncertaiNLP Workshop at EMNLP 2025 https://aclanthology.org/2025.uncertainlp-main.21.pdf

Journal ref UncertaiNLP Workshop at Empirical Methods in Natural Language Processing 2025 (EMNLP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏