arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 2579 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 152 篇

2606.11204 2026-06-11 cs.CL cs.IR 新提交 79%

Benchmarking Large Language Models for Safety Data Extraction

大型语言模型在安全数据提取中的基准测试

Jonas Grill, Thomas Bayer, Sören Berlinger

机构 * SAP SE(SAP公司) Institute for Digital Transformation, Ravensburg-Weingarten University(拉文斯堡-魏恩加滕大学数字化转型研究所)

专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.CL

AI总结 针对安全数据表(SDS)的异构格式,本研究基准测试了四种大型语言模型(LLM)在文本与多模态处理下的提取性能,发现文本结合思维链提示的Gemini 1.5 Pro准确率最高(84%),但均未达到90%的可靠部署阈值。

Comments 18 pages, 8 figures, submitted to Applied Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08197 2026-06-09 cs.CL cs.DC 新提交 79%

AlignFed: Alignment-Aware Asynchronous Federated Fine-Tuning for Large Language Models in Heterogeneous Edge Environments

AlignFed: 异构边缘环境中大语言模型的对齐感知异步联邦微调

Yan Wang, Ziyi Gao, Rui Wang

机构 * University of Science and Technology Beijing(北京科技大学)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL

AI总结 提出AlignFed框架,通过多阶段语义对齐机制(版本感知更新分组、跨版本语义对齐、公平性感知聚合)解决异步联邦微调中大语言模型在异构边缘环境中的模型漂移、客户端漂移和聚合不公平问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16591 2026-07-21 cs.LG cs.AI 新提交 79%

Learning from World Feedback: Why Model Uncertainty Fails as a Risk Signal in Model-Based RL

从世界反馈中学习:为何模型不确定性在基于模型的强化学习中无法作为风险信号

Zhaohui Wang

专题命中 幻觉与事实性 :alignment(abstract);RLHF(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨 RLxF 中学习信号应源于世界反馈,在安全模型控制中实例化并提炼原则。通过实验表明基于动力学的不确定性惩罚会增加碰撞率,用世界反馈信号可降低碰撞率,提取原则并指出其适用于多种相关方法。

Comments Accepted at the ICML 2026 Workshop on Reinforcement Learning from X Feedback (RLxF). 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07141 2026-08-10 cs.CV 新提交 78%

Human-AI Perceptual Alignment by Playing Hues and Cues

通过玩Hues and Cues游戏实现人类与AI的感知对齐

Nuria Alabau-Bosque, Jorge Vila-Tomás, Paula Daudén-Oliver, Pablo Hernández-Cámara, Valero Laparra, Jesús Malo

机构 * Universitat de València(瓦伦西亚大学) Image Processing Lab(图像处理实验室)

专题命中 幻觉与事实性 :alignment(title,abstract)

AI总结 本研究提出基于Hues and Cues游戏的评估框架,对比162个CVLMs与人类的颜色感知对齐,发现其在抽象领域偏离人类基线,筛选的预训练数据集可缓解错位。

Comments 19 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22959 2026-07-28 cs.CV cs.AI 新提交 77%

HALLELUAI: A Hallucination-Aware AI System for Ultra-Realistic Image-to-Video Generation at Scale

HALLELUAI:一个用于大规模超逼真图像到视频生成的幻觉感知人工智能系统

Aniket Sakpal, Yang Jiang, Rouzbeh Davoudi, Shayan Hassantabar, Mani Najmabadi

机构 * Expedia Group(亿客行集团)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 针对AI生成视频时质量控制难的问题,HALLELUAI系统集成视频调节与智能再生模块,能评估风险并迭代修复。经人工参与评估,该系统可输出超逼真视频,推动了可信AI视频内容发展,实现大规模图像到视频生成。

Comments 10 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17883 2026-07-21 cs.CL cs.AI 新提交 76%

Zero Hallucination, by Construction: Hallucination-Aware Layered Oversight for Trustworthy Enterprise AI

通过构建实现零幻觉:用于可信企业人工智能的幻觉感知分层监督

Bogdan Raduta, Horia Velicu, Alexandru Preda, Serban Chiricescu

专题命中 幻觉与事实性 :trustworthy(title);分类 cs.CL、cs.AI

AI总结 研究企业AI因幻觉难以被信任的问题时,提出HALO架构,通过六层防御将幻觉视为可控制故障模式,详细介绍各层并关注基于证据的置信度,以实现可信企业AI,在索赔提取工作负载上进行了架构说明。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10216 2026-06-10 cs.LG cs.AI 新提交 76%

A Source Domain is All You Need: Source-Only Cross-OS Transfer Learning for APT Anomaly Detection via Semantic Alignment and Optimal Transport

一个源域足矣:基于语义对齐和最优传输的仅源域跨操作系统APT异常检测迁移学习

Sidahmed Benabderrahmanea, Petko Valtchev, James Cheney, Talal Rahwan

机构 * New York University, NYUAD, Division of Science, Computer Science Department(纽约大学,NYUAD,科学学院,计算机科学系) University of Quebec in Montreal, Computer Science Department, Montreal(魁北克大学蒙特利尔分校,计算机科学系,蒙特利尔) University of Edinburgh, School of Informatics, Edinburgh(爱丁堡大学,信息学院,爱丁堡)

专题命中 幻觉与事实性 :alignment(title);分类 cs.AI、cs.LG

AI总结 针对跨操作系统APT检测中目标域无标签的挑战,提出基于最优传输的仅源域异常评分框架,通过语义抽象和三种偏差通道实现零目标监督下的异常排序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13317 2026-08-14 cs.AI 新提交 74%

StateBridge: Training-free Hidden-state Alignment for Latent Communication in LLM Multi-Agent Systems

StateBridge:面向大语言模型多智能体系统潜在通信的无训练隐藏状态对齐

Yanwen Peng, Delvin Ce Zhang, Xi Wang, Nikolaos Aletras

机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院)

专题命中 幻觉与事实性 :alignment(title);分类 cs.AI

AI总结 StateBridge 是一种无训练的潜在通信方法,通过闭式正交变换对齐大语言模型多智能体的隐藏状态,在 26 个模型-任务对中 22 个取得最优或并列最优性能,优于基线。

Comments 18 pages, 3 figures, 4 tables, accepted by COLM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16583 2026-06-16 cs.CL 新提交 74%

Uncertainty Is Not a Safety Net for Clinical VQA, but Can It Anticipate Model Failure?

不确定性并非临床VQA的安全网,但它能预测模型失败吗?

Arnisa Fazla, Alberto Testoni, Ameen Abu-Hanna, Barbara Plank, Iacer Calixto

机构 * Amsterdam University Medical Center, University of Amsterdam(阿姆斯特丹大学医学中心) Amsterdam Public Health(阿姆斯特丹公共卫生) LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 幻觉与事实性 :safety(title);分类 cs.CL

AI总结 研究临床视觉语言模型的不确定性估计是否可靠,发现其质量随模型准确率变化,在模型脆弱时失效,但能预测扰动下的性能崩溃。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06972 2026-06-08 cs.AI 新提交 74%

Accounting for Context: Shaping Moral Credences for Value Alignment

考虑情境:塑造道德信念以实现价值对齐

Jazon Szabo, Sanjay Modgil

机构 * University of Oxford(牛津大学)

专题命中 幻觉与事实性 :alignment(title);分类 cs.AI

AI总结 本文针对价值对齐中道德多元性问题,提出在聚合道德评估时必须考虑情境因素,并形式化道德不确定性下的决策,揭示弱帕累托原则的违反是辛普森悖论的一种变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29062 2026-08-03 cs.AI 新提交 70%

On the Generalization of Steering Vectors for Chain-of-Thought Faithfulness

论用于思维链忠实性的引导向量的泛化性

Matthew Nguyen, Kyle Cox, Austin Meek, Iván Arcuschin

机构 * University of Virginia(弗吉尼亚大学) University of Delaware(特拉华大学) Poseidon Research(波塞冬研究院)

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 该研究针对三个模型探究提升思维链忠实性的引导向量的泛化性,发现其效果主要由评估设置决定,且仅对最大型模型有效,引导可减少未被确认的提示使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13596 2026-07-16 cs.CR cs.AI 新提交 70%

Protective Capacity Hallucination: When Large Language Models Claim Nonexistent Capabilities

保护能力幻觉:当大语言模型声称具备不存在的能力时

Eunna Lee, Jungpyo Nam, Sunjun Hwang

机构 * Korea Cyber University(韩国网络大学) Yonsei University(延世大学)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 研究大语言模型的保护能力幻觉现象,通过三阶段研究发现其受情境严重程度和交互形式影响,体现了角色分配与能力边界规范的差距,提出能力边界的部署端规范是缓解该问题的目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02569 2026-07-07 cs.CV cs.LG 新提交 70%

Uncertainty-Aware Last-Layer Adaptation of RETFound for Referable Diabetic Retinopathy Screening Under Dataset Shift

数据集偏移下用于可参考糖尿病视网膜病变筛查的RETFound不确定性感知最后一层自适应

Karim Mardhani

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 用RETFound对糖尿病视网膜病变筛查的不确定性感知最后一层自适应进行以安全为中心的实证评估,比较多种方法,在APTOS上不确定性感知操作点改善了敏感性等,在DDR上结果有差异,强调安全评估的价值。

Comments 12 pages, 8 tables, 6 figures. Code available at https://github.com/kmardhani/uncertainty-aware-retfound

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31916 2026-07-01 cs.CL 新提交 70%

Theory of Mind and Persuasion Beyond Conversation: Assessing the Capacity of LLMs to Induce Belief States via Planning and Action

超越对话的心智理论与说服:通过规划与行动评估LLMs诱导信念状态的能力

Ben Slater, Matteo G. Mecattaf, Lucy G. Cheke, John Burden, Winnie Street

机构 * Leverhulme Centre for the Future of Intelligence(勒沃霍姆未来智能中心) Prolific Google, Paradigms of Intelligence Team(谷歌智能范式团队)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 提出非对话式规划心智理论(NCP-ToM)框架,评估LLMs通过行动而非对话诱导他人信念状态的能力,发现GPT-5在80%任务中优于人类,但鲁棒性不足。

Comments 29 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22181 2026-06-23 cs.LG 新提交 70%

Residue-Level Attributions in Protein Language Models Do Not Recover Allergen Epitopes

蛋白质语言模型中的残基级归因不能恢复过敏原表位

Jianzhou Yao, Anxiong Song, Katja Baerenfaller, Damir Zhakparov

机构 * Swiss Institute of Allergy and Asthma Research, Davos, Switzerland(瑞士过敏与哮喘研究所,达沃斯,瑞士) ETH Zurich, Zurich, Switzerland(苏黎世联邦理工学院,苏黎世,瑞士) Swiss Institute of Bioinformatics, Lausanne, Switzerland(瑞士生物信息学研究所,洛桑,瑞士)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本研究通过引入表位基准,评估蛋白质过敏原性模型的可解释性,发现分类器残基级归因与注释表位对齐不显著,模型可能依赖理化特征而非表位特异性机制。

Comments Accepted at the ICML 2026 Mechanistic Interpretability Workshop (peer-reviewed)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18259 2026-06-18 cs.HC cs.AI 新提交 70%

Caring Without Feeling: Affective Dynamics as the Control Layer of Human-AI Agent Collaboration

无感关怀:情感动态作为人-AI智能体协作的控制层

Junjie Xu, Xingjiao Wu, Zihao Zhang, Yujia Xu, Yuzhe Yang, Jin Zhu, Luwei Xiao, Wen Wu, Liang He

机构 * East China Normal University(华东师范大学) National University of Singapore(新加坡国立大学)

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文综述情感动态在人-AI智能体协作中的作用,提出将情感视为协调层而非AI内部属性,用于校准信任、委托和治理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03528 2026-07-07 cs.LG cs.AI cs.CL 新提交 69%

Aligning Language Models with Selective Prediction

通过选择性预测使语言模型对齐

Gaoxiang Luo, Yifan Wu, Sinian Zhang, Aryan Deshwal, Ju Sun

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Bioinformatics and Computational Biology Program(生物信息学与计算生物学项目) Division of Biostatistics and Health Data Science(生物统计学与健康数据科学部) University of Minnesota Twin Cities(明尼苏达大学双城分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG;safety(comments)

AI总结 研究聚焦提升语言模型可靠性,采用选择性预测策略,在模型训练后对齐阶段,提出基于强化学习的框架RLSR,以风险-覆盖曲线下面积为目标,在域内域外任务中风险-覆盖权衡表现更好。

Comments Accepted by ICML 2026 Agents in the Wild: Safety, Security, and Beyond Workshop, Project Page: https://sun-umn.github.io/RLSR

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13760 2026-08-17 cs.CL cs.AI cs.CV cs.LG 新提交 67%

Amplified Does Not Mean Predictive: Reasoning Behaviors in Thinking Models

放大并不意味着具有预测性:思考模型中的推理行为

Jean de Dieu Nyandwi, Leena Mathur, Yonatan Bisk, Robert Hawkins, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究揭示思考模型存在“放大-提升差距”,即面向推理的训练放大了与正确性关联弱的推理行为,却未放大高提升值的关键行为,推动了过程级推理目标的研究。

Comments Published in COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05909 2026-08-07 cs.CR 新提交 67%

MMAligner: Safeguarding Multimodal Large Language Models through Representation Calibration

MMAligner:通过表示校准保护多模态大语言模型

Shenyi Zhang, Keyan Guo, Zihao Wang, Xuebin Li, Lingchen Zhao, Hongxin Hu, Chao Shen, Qian Wang

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract)

AI总结 MMAligner通过校准多模态大语言模型的表示,将不安全多模态输入的拒绝率提升至99%,仅造成不足2%的效用下降,显著优化了安全与效用的权衡。

Comments To Appear in the Proceedings of The ACM Conference on Computer and Communications Security (CCS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29527 2026-08-03 cs.LG cs.AI cs.CY econ.EM stat.ML 新提交 67%

TerraNova: A Foundation Model for the Anthropocene

TerraNova:人类世的基础模型

Carlos Rodriguez-Pardo, Massimo Tavoni

机构 * Politecnico di Milano(米兰理工大学) RFF-CMCC European Institute on Economics and the Environment (EIEE)(RFF-CMCC欧洲经济与环境研究所) Euro-Mediterranean Center on Climate Change (CMCC)(欧洲地中海气候变化中心)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 TerraNova是适配原生几何的基础模型,融合地球物理与社会数据,可重建密集场、适配未见变量,兼具地理空间编码能力与国家层面功能。

Comments 32 pages, 16 figures. Supplementary Information (full methodological specification, ablation programme, extended results, computational cost; 157 pages) available at the project page: https://carlosrodriguezpardo.es/projects/TerraNova/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26317 2026-07-30 cs.CY cs.AI cs.CL 新提交 67%

Aligning LLM-Simulated and Human Examinees for Psychometric Calibration: A Cognitive Diagnostic Profiling Approach

对齐大语言模型模拟与人类应试者的心理测量校准:一种认知诊断画像方法

Wenjie Zhou, Yunting Liu, Renjiao Tang, Mark Wilson

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 该研究提出认知诊断画像(CDP)零样本框架,优化LLM模拟应试者的心理测量对齐,在Tatsuoka分数减法数据集上提升了能力分布、掌握画像及题目难度与人类的匹配度,助力LLM模拟应试者用于测试开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12336 2026-07-15 cs.CL cs.AI cs.CY cs.ET cs.HC 新提交 67%

Evaluating Health Misinformation in Low-Resource Languages: Integrating Small Language Models with a Culturally-Sensitive Responsible NLP Framework (Bangla as a Case Study)

评估低资源语言中的健康错误信息:将小语言模型与文化敏感的负责任自然语言处理框架相结合(以孟加拉语为例)

Farnaz Farid, Raihan Alam, Al Al-Areqi, Farhad Ahamed, Muhammad Hassan Khan, Sadia Hossain, Irena Veljanova, Anika Tabassum Binte Hossain

机构 * Western Sydney University(西悉尼大学) Microsoft(微软公司) Excelsia College(埃克塞尔西亚学院) Faulconbridge Health Centre(福尔康布里奇健康中心)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究针对低资源语言中健康错误信息难检测问题,提出结合小语言模型与文化敏感的负责任自然语言处理框架,以孟加拉语为例进行实验,证明Phi-4表现优,还设计新框架,为评估低资源语言错误信息提供整体视角。

Comments 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12257 2026-07-15 cs.AI cs.CL cs.IR cs.LG 新提交 67%

On-Device Deep Research at 4B: Exposure Bounds Faithfulness, Retrieval Bounds Coverage

4B 设备上的深度研究:曝光界限忠实度、检索界限覆盖率

Vinay Kumar Chaganti

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究聚焦 4B 设备上深度研究,区分引用主张忠实度与可信覆盖率两个量,通过交叉对比来源字符数和质量,发现曝光决定忠实度,检索决定覆盖率,提出先提高曝光再调控检索召回率的实际方法。

Comments 13 pages, 2 figures, appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02089 2026-07-03 cs.CV cs.AI cs.CL cs.LG cs.MM 新提交 67%

ESC: Emotional Self-Correction for Reliable Vision-Language Models

ESC:面向可靠视觉语言模型的情感自我纠正

Tien-Huy Nguyen, Minh-Nhat Nguyen, Nguyen Nhat Huy, Hung Viet Nguyen, Huy Nguyen Minh Nhat, Thanh-Huy Nguyen, Cuong Tuan Nguyen, Hoang M. Le, Dat Nguyen, Phat Kim Huynh, Min Xu, Ulas Bagci

机构 * 1 GenAI4E Lab 2 University of Information Technology, Ho Chi Minh City, Vietnam 3 Universit\"at Trier, Germany 4 Ho Chi Minh University of Technology, Ho Chi Minh City, Vietnam 5 PAMI Lab, Vietnamese German University, Vietnam 6 Vietnam National University, Ho Chi Minh City, Vietnam 7 Carnegie Mellon University, USA 8 Omoshiroi AI, USA 9 Harvard University, USA 10 Basis Research Institute 11 PASSIO Laboratory, North Carolina A\&T State University, USA 12 Mohamed bin Zayed University of Artificial Intelligence, UAE 13 Northwestern University, USA [4pt] Equal contribution. Corresponding author

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出训练无关的ESC框架,通过外部验证器检测错误初始响应并注入情感反馈,促使VLM自我纠正,提升安全、幻觉、感知和多模态推理等任务的可靠性。

Comments ECCV Main Track 2026 (113 pages, 15 tables, 65 figures). Project Page: https://genai4e.github.io/ESC/?

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25760 2026-06-25 cs.LG cs.AI cs.CL cs.CV 新提交 67%

Uncertainty Quantification for Computer-Use Agents: A Benchmark across Vision-Language Models and GUI Grounding Datasets

计算机使用代理的不确定性量化:跨视觉语言模型和GUI基础数据集的基准测试

Divake Kumar, Sina Tayebati, Devashri Naik, Amanda Sofie Rios, Nilesh Ahuja, Omesh Tickoo, Ranganath Krishnan, Amit Ranjan Trivedi

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Intel Labs(英特尔实验室) Capital One AI Labs(Capital One AI实验室)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出跨机制基准Argus,评估27种后验不确定性量化方法在4个VLM代理和4个数据集上的表现,发现UQ排名在固定模型内跨数据集稳定,但跨模型类别和接口时下降,隐藏状态和密度方法最稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12900 2026-06-12 cs.AI cs.CL cs.LG 新提交 67%

Zero-source LLM Hallucination Detection with Human-like Criteria Probing

零源大语言模型幻觉检测:类人类标准探测

Jiahao Yang, Shuhai Zhang, Hailong Kang, Feng Liu, Qi Chen, Mingkui Tan

机构 * South China University of Technology(华南理工大学) The University of Melbourne(墨尔本大学) Pazhou Laboratory(帕乔实验室) Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出HCPD范式,通过类人类标准探测机制模拟人类评估者的多面推理,结合奖励对齐和多样本聚合,实现零源条件下的有效可解释幻觉检测。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09856 2026-06-10 cs.CL cs.AI cs.LG stat.ML 新提交 67%

Using Probabilistic Programs to Train Inductive Reasoning in Large Language Models

使用概率程序训练大型语言模型的归纳推理

Liyi Zhang, Akshay K. Jagadish, Brenden M. Lake, Thomas L. Griffiths

机构 * Princeton University(普林斯顿大学) Princeton AI Lab(普林斯顿人工智能实验室)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出基于程序的后验训练(PPT)方法,利用LLM生成概率程序场景,通过推理产生分布目标,微调模型以提升归纳推理准确性、与人类判断的一致性及校准能力。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11280 2026-08-13 eess.IV cs.AI cs.CV cs.LG 新提交 62%

Uncertainty-Aware and Explainable Ensemble Deep Learning Framework for Multi-Class Skin Lesion Classification

用于多类皮肤病变分类的不确定性感知且可解释的集成深度学习框架

Rofiqul Islam, Lilatul Ferdouse

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments 5 pages, 3 figures, IEEE AIBThings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07525 2026-08-11 cs.CL cs.AI 新提交 62%

Unified Hallucination Fuzzing for Multimodal Large Language Models

面向多模态大语言模型的统一幻觉模糊测试

Pengfei Zhou, Jiajun Song, Zhiwei Tang, Yixing Ma, Xiaopeng Peng, Donghui Si, Yuhang Xu, Huiqi Song, Yiyuan Miao, Yichen Qian, Weihua Chen, Wangbo Zhao, Bohan Zhuang, Jiasheng Tang, Yang You

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型的幻觉问题,提出含UniHall基准与SAMF自演化模糊测试的评估框架,发现SOTA模型在模糊测试下性能显著下降,存在有用性-幻觉权衡。

Comments 47 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07520 2026-08-11 cs.CY cs.AI 新提交 62%

KumbhDoot: A Scale-Ready, LLM-Bounded Architecture for Mass-Gathering Public-Service Assistants

KumbhDoot:面向大规模集会公共服务助手的可扩展、大语言模型(LLM)限定架构

Saurabh Sakalkar, Abhishek Singh, Ramesh Raskar

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.CY

AI总结 针对大壶节这类高风险低连接性的大规模集会,提出KumbhDoot架构,以相似度优先、LLM限定为核心,解决默认LLM助手成本高、易幻觉等问题,适配公共服务场景。

详情

展开后加载摘要…

URL PDF HTML 收藏