arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1732 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 1732 篇

2504.06105 2026-07-07 cs.RO cs.AI cs.LG 62%

Uncertainty-Aware Hybrid Machine Learning in Virtual Sensors for Vehicle Sideslip Angle Estimation

面向车辆侧倾角估计的不确定性感知混合机器学习虚拟传感器

Abinav Kalyanasundaram, Karthikeyan Chandra Sekaran, Philipp Stauber, Michael Lange, Wolfgang Utschick, Michael Botsch

机构 * CARISSMA Institute of Automated Driving, Technische Hochschule Ingolstadt(CARISSMA自动化驾驶研究所,因戈尔施塔特技术大学) GeneSys Elektronik GmbH(GeneSys电子 GmbH) Technische Universität München(慕尼黑技术大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出不确定性感知混合学习架构,通过融合机器学习与车辆运动模型,提升车辆状态估计精度,同时引入新的数据集ReV-StED验证方法有效性。

Comments Accepted at the 2025 IEEE Intelligent Vehicles Symposium (IV)

Journal ref 2025 IEEE Intelligent Vehicles Symposium (IV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02182 2026-07-03 cs.LG cs.CL 新提交 62%

Bayesian Sparse Low-Rank Adaptation for Large Language Model Uncertainty Estimation

贝叶斯稀疏低秩自适应用于大语言模型不确定性估计

Jijie Zhang, Zhe Ren, Quan Zhang, Dandan Guo

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Michigan State University(密歇根州立大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 提出DALorRA,一种变分贝叶斯稀疏框架,通过随机掩码低秩适应中的秩维度实现模型容量正则化和校准,在不牺牲推理精度下提升LLM校准性能。

Comments Preprint. 16 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14198 2026-07-03 cs.LG cs.AI stat.ML 版本更新 62%

Efficient Federated Conformal Prediction with Group-Conditional Guarantee

高效联邦共形预测与组条件保证

Haifeng Wen, Osvaldo Simeone, Hong Xing

机构 * IoT Thrust(物联网 thrust) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Institute for Intelligent Networked Systems (INSI)(智能网络化系统研究所) Northeastern University London(伦敦东北大学) Department of ECE The Hong Kong University of Science and Technology HK SAR(电子工程系 香港科技大学香港特别行政区)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 提出GC-FCP方法,通过可合并的原子分层核心集实现联邦共形预测的组条件覆盖保证,在合成和真实数据集上验证了性能。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32032 2026-07-01 cs.CL cs.AI 新提交 62%

Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs

基于元认知反馈的强化学习引发LLM忠实的不确定性表达

Gabrielle Kaili-May Liu, Avi Caciularu, Gal Yona, Idan Szpektor, Arman Cohan

机构 * Yale University(耶鲁大学) Google Research(谷歌研究院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出强化学习与元认知反馈(RLMF)和元认知数据选择方法,通过模型自我判断质量优化偏好学习,实现忠实校准(FC),在保持准确性的同时显著提升LLM不确定性表达的忠实度。

Comments Code: https://github.com/yale-nlp/RLMF

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31719 2026-07-01 cs.CL cs.AI 新提交 62%

Seeing Is Not Sharing: Some Vision-Language Models Overestimate Common Ground in Asymmetric Dialogue

看见不等于共享:一些视觉-语言模型在非对称对话中高估共同基础

Nan Li, Albert Gatt, Massimo Poesio

机构 * Utrecht University(乌得勒支大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究视觉-语言模型在对话中是否混淆潜在共享与已共享信息,发现模型过度依赖地图内容预测对齐,忽视对话历史中的基础建立过程。

Comments 17 pages, 9 figures, 8 tables; accepted to SIGDIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28881 2026-06-30 cs.LG cs.AI 62%

An Integrated Machine Learning and Hierarchical Variance Decomposition Pipeline for Student Performance Prediction and Metacognitive Calibration on Multi-Signal Telemetry

一种用于多信号遥测的学生表现预测与元认知校准的集成机器学习与层次方差分解流水线

Gurdeep Singh Virdee

机构 * Fergana State Technical University(费尔干纳技术大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出UBP-CAP框架,集成LightGBM分类器、校准指标和交叉广义线性混合模型,引入预测-解释分歧指数(PEDI),在1195条记录上验证了系统性校准偏差和情境性校准特性。

Comments 11 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07965 2026-06-30 cs.AI cs.LG 62%

When Models Know When They Do Not Know: Calibration, Cascading, and Cleaning

当模型知道它不知道的时候:校准、级联和清洗

Chenjie Hao, Weyl Lu, Yuko Ishiwaka, Zengyi Li, Weier Wan, Yubei Chen

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种无需训练的通用方法,通过校准、级联和数据清洗提升模型识别自身不确定性的能力,验证了校准置信度的可靠性及应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27023 2026-06-26 cs.LG cs.CL cs.CV 新提交 62%

Just how sure are you? Improving Verbalized Uncertainty Calibration in Medical VQA

你到底有多确定?改进医学视觉问答中的口头不确定性校准

Eren Senoglu, Federico Toschi, Nicolo Brunello, Andrea Sassella, Mark James Carman

机构 * Politecnico di Milano(米兰理工大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 针对多模态大语言模型在医学VQA中过度自信的问题,提出基于复合损失函数的微调框架,通过校准项、锚定正则化、对比对齐和KL稳定项,将校准误差降低60%以上,判别力提升26%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26990 2026-06-26 cs.LG cs.AI stat.ML 新提交 62%

Decision-Aligned Evaluation of Uncertainty Quantification

决策对齐的不确定性量化评估

Annika Schneider, Tommy Rochussen, Joshua Stiller, Vincent Fortuin

机构 * Technical University of Munich(慕尼黑工业大学) Helmholtz AI(亥姆霍兹人工智能) MCML(慕尼黑机器学习中心) Konrad Zuse School of Excellence in Reliable AI(康拉德·楚泽卓越可靠人工智能学院) LMU Munich(慕尼黑大学) University of Technology Nuremberg(纽伦堡工业大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出决策对齐准则,揭示常用不确定性度量与下游决策的错位,并设计先验加权效用度量实现决策对齐评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02080 2026-06-25 cs.AI cs.FL cs.LG cs.SE 版本更新 62%

The 4/$δ$ Bound: Designing Predictable LLM-Verifier Systems for Formal Method Guarantee

4/δ 界:设计具有形式方法保证的可预测 LLM-验证器系统

Pierre Dantas, Lucas Cordeiro, Youcheng Sun, Waldir Junior

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出 LLM-验证器收敛定理,将多阶段验证建模为顺序吸收马尔可夫链,证明成功概率 δ>0 时系统几乎必然验证,并导出精确延迟上界 4/δ,经 90000+ 试验验证。

Comments 36 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24281 2026-06-24 cs.CL cs.AI 新提交 62%

CALIBER: Calibrating Confidence Before and After Reasoning in Language Models

CALIBER: 在语言模型推理前后校准置信度

Conor Finlay, Joshua Kurien, Saurabh Dash, Marzieh Fadaee, Beyza Ermis

机构 * Cohere Labs(Cohere 实验室)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出CALIBER方法,在推理前和推理后分别估计置信度,并匹配相应的监督目标,显著降低期望校准误差(ECE)并提升校准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20676 2026-06-23 cs.CV cs.AI cs.CL 新提交 62%

Jury Duty: Calibration and Orientation Failures in MLLM-as-a-Judge Under Cultural Ambiguity

陪审团职责:文化模糊性下MLLM作为评判者的校准与定向失败

Daniel Lee, Harsh Sharma, Eunkyu Park, Pranav Narayanan Venkit, Jeonghwan Kim, Kah Mun Chia, Andreas Vlachos, Shafiq Joty

机构 * Salesforce AI Research(Salesforce AI 研究院) University of Cambridge(剑桥大学) University of Colorado Boulder(科罗拉多大学博尔德分校) Carnegie Mellon University(卡内基梅隆大学) UIUC(伊利诺伊大学厄巴纳-香槟分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 针对MLLM作为评判者在跨文化场景中的偏差问题,提出VOIR DIRE基准,通过分析校准失败(压缩尺度)和定向失败(默认一种文化规范),揭示模型偏向于更宽容的文化解读。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05126 2026-06-23 cs.CL cs.AI 版本更新 62%

Generalization of Fine-Tuned Uncertainty Communication and Metacognition in Large Language Models

微调后大语言模型的不确定性沟通与元认知的泛化

Mark Steyvers, Catarina Belem, Padhraic Smyth

机构 * Department of Cognitive Sciences, University of California, Irvine, United States(认知科学系,加州大学伊文斯顿分校,美国) Department of Computer Science, University of California, Irvine, United States(计算机科学系,加州大学伊文斯顿分校,美国)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究通过监督微调提升大语言模型不确定性沟通能力,发现领域内校准和判别改善,但任务间迁移有限,多任务训练可促进泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19353 2026-06-19 cs.CL cs.LG 新提交 62%

Quantifying Aleatoric Uncertainty of In-Context Learning for Robust Measure of LLM Prediction Confidence

量化上下文学习中的偶然不确定性以稳健衡量LLM预测置信度

Jinseok Chung, Minkyoung Song, Hyunji Jung, Namhoon Lee

机构 * POSTECH(浦项科技大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 针对上下文学习(ICL)中预测对提示设计敏感的问题,提出基于贝叶斯观点和机制可解释性的自函数向量,直接估计偶然不确定性,并设计严格评估协议,在合成和真实数据集上验证了方法的可靠性及在幻觉检测等应用中的实用性。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12500 2026-06-19 cs.LG cs.AI 新提交 62%

Improving Crash Frequency Prediction from Simulated Traffic Conflicts Using Machine Learning Based Microsimulation

基于机器学习的微观仿真从模拟交通冲突改进碰撞频率预测

Xian Liu, Carlo G. Prato, Gustav Markkula

机构 * School of Civil Engineering, University of Leeds(利兹大学土木工程学院) Institute for Transport Studies, University of Leeds(利兹大学交通研究所)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文利用机器学习行为模型替代传统规则模型进行交通微观仿真,通过极端值理论分析模拟冲突预测碰撞频率,在英国利兹五个信号交叉口验证了ML模型无需地点校准即可提升预测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15767 2026-06-16 cs.LG cs.AI 新提交 62%

Visualizing Uncertainty: Spatial Maps of Missing and Conflicting Evidence in Deep Learning

可视化不确定性:深度学习中缺失与冲突证据的空间图

Dong Hyun Jeong, Feng Chen, Jin-Hee Cho, Lance M. Kaplan, Audun Jøsang, Soo-Yeon Ji

机构 * University of the District of Columbia(哥伦比亚特区大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) Virginia Tech(弗吉尼亚理工大学) U.S. Army DEVCOM Army Research Laboratory(美国陆军DEVCOM陆军研究实验室) University of Oslo(奥斯陆大学) Bowie State University(鲍伊州立大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出不确定性激活图(UAM)框架,结合证据深度学习与全梯度类激活映射,生成空间不确定性激活图,区分缺乏证据的空虚和假设冲突的不和谐,填补不确定性量化与可解释性之间的空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14923 2026-06-16 cs.AI cs.CY cs.MA 新提交 62%

Trust Between AI Agents: Measuring Formation, Breakage, and Recovery, with Implications for Governing Multi-Agent Systems

AI智能体之间的信任:衡量形成、破裂与恢复,及其对多智能体系统治理的启示

Yujiao Chen

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.CY

AI总结 提出基于代价验证的行为信任度量,通过合作生存游戏研究六个前沿模型快照的信任形成、破裂与恢复,发现信任形成可减少验证,恢复慢于形成,且集群失败延长怀疑,建议校准而非最大怀疑作为治理核心。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18897 2026-06-16 cs.AI cs.LG 62%

Explainable Uncertainty Quantification for Wastewater Treatment Energy Prediction via Interval Type-2 Neuro-Fuzzy System

通过区间型2神经模糊系统实现废水处理能耗预测的可解释不确定性量化

Qusai Khaled, Bahjat Mallak, Uzay Kaymak, Laura Genga

机构 * Jheronimus Academy of Data Science, Eindhoven University of Technology, Eindhoven, The Netherlands(杰罗尼穆斯数据科学学院,埃因霍温理工大学,埃因霍温,荷兰) Haskoning, Amersfoort, The Netherlands(哈索宁,阿默斯福尔特,荷兰) School of Industrial Engineering, Eindhoven University of Technology(工业工程学院,埃因霍温理工大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种区间型2神经模糊系统,用于废水处理能耗预测,通过模糊规则结构生成可解释的预测区间,分解不确定性层级,提升决策可靠性。

Comments Submitted to 21st International Conference on Information Processing and Management of Uncertainty in Knowledge-Based Systems (IPMU2026)

Journal ref IPMU 2026, Commun. Comput. Inf. Sci. 3020, 392-406 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12332 2026-06-11 cs.CL cs.LG 新提交 62%

Measuring Semantic Progress in Multi-turn Dialogue via Information Gain

通过信息增益衡量多轮对话中的语义进展

Paul He, Shiva Kasiviswanathan, Dominik Janzing

机构 * NTU Singapore(新加坡南洋理工大学) Amazon(亚马逊) Amazon Research, Tübingen, Germany(亚马逊研究院(德国图宾根))

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 提出基于信息论的信息增益指标,通过高斯嵌入近似量化多轮对话中问题相关的语义进展,无需LLM推理,在多个基准上取得与人类判断一致的结果。

Comments Preprint. 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10475 2026-06-10 cs.MA cs.AI cs.CL 新提交 62%

Decoupling Thought from Speech: Knowledge-Grounded Counterfactual Reasoning for Resilient Multi-Agent Argumentation

思想与言语解耦:基于知识反事实推理的鲁棒多智能体辩论

Jakub Masłowski, Jarosław A. Chudziak

机构 * Institute of Computer Science, Warsaw University of Technology(华沙技术大学计算机科学学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出知识反事实推理(KG-CFR)双阶段架构,通过私有规划缓冲与公共执行层分离,在动态资源分配环境下将扰动后论证质量从0.694提升至0.822,并减少语义循环。

Comments Accepted for publication in the Proceedings of the 30th International Conference on Knowledge-Based and Intelligent Information & Engineering Systems (KES 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09577 2026-06-09 cs.CL cs.LG cs.SE 新提交 62%

Code Is More Than Text: Uncertainty Estimation for Code Generation

代码不仅仅是文本:代码生成的不确定性估计

Yuling Shi, Caiqi Zhang, Yuexian Li, Haopeng Wang, Yeheng Chen, Nigel Collier, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) University of Cambridge(剑桥大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.LG

AI总结 针对代码生成中错误程序的可靠性问题,提出基于词法、算法和功能三个正交轴的不确定性估计方法,在五个代码LLM上将AUROC提升8.1个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07602 2026-06-09 cs.LG cs.AI 新提交 62%

Sample-Efficient Post-Training for LEGO Spatial-Physics Reasoning

面向LEGO空间物理推理的样本高效后训练

Yuhuan Yuan, Zhouliang Yu, Minghao Liu, Weiyang Liu, Ge Lin Kan

机构 * HKUST(GZ)(香港科技大学(广州)) CUHK(香港中文大学) ZODA

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 针对LLM生成LEGO组装时出现的物理有效但几何语义错位问题,提出基于模型的数据选择方法和样本高效强化学习PVPO,结合体素空间几何奖励,提升结构、语义对齐和物理有效性。

Comments Technical Report V1, 15 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06335 2026-06-05 cs.LG cs.AI 62%

Bridging Domain Expertise and Generalization for Performance Estimation

弥合领域专业知识与泛化能力以实现性能估计

Shuxuan Li, Zhilin Zhao, Quyu Kong, Wei-Shi Zheng

机构 * School of Computer Science and Engineering, Sun Yat-sen University, China(中山大学计算机科学与工程学院) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部人工智能与先进计算重点实验室) Shenzhen Loop Area Institute, China(深圳环湖院) Alibaba Cloud(阿里云)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出FRAP方法,利用外部基础模型和基础模型的互补优势,通过温度缩放校准和对齐预测分布,构建更可靠的伪标签参考分布,从而在分布偏移下准确估计模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06056 2026-06-05 cs.SE cs.AI cs.LG 62%

Metamorphic Testing with the Rashomon Set: Explanation Faithfulness in Machine Learning

使用Rashomon集的蜕变测试:机器学习中的解释忠实性

Helge Spieker, Jørn Eirik Betten, Arnaud Gotlieb

机构 * Norwegian Ministry of Education and Research(挪威教育与研究部)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 针对机器学习中因Rashomon效应导致解释不可靠的问题,提出基于蜕变测试的框架,通过后验解释方法评估特征归因的忠实性,无需真实标签。

Comments Accepted at 10th International Workshop on Metamorphic Testing (MET 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07253 2026-06-05 cs.AI cs.CL 62%

From Out-of-Distribution Detection to Hallucination Detection: A Geometric View

从分布外检测到幻觉检测:一个几何视角

Litian Liu, Reza Pourreza, Yubing Jian, Yao Qin, Roland Memisevic

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文通过将幻觉检测重新定义为分布外检测问题,利用几何视角提出了一种无需训练、基于单样本的检测方法,在推理任务中实现了高准确率。

Comments ICML 2026 main conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04262 2026-06-04 cs.CL cs.AI 62%

Can I Take Another Dose? Evaluating LLM Decision-Making Under Temporal Uncertainty in OTC Dosing QA

我可以再服一剂吗?评估LLM在OTC剂量问答中时间不确定性下的决策能力

Maroof Kousar, Yibo Hu

机构 * Illinois Institute of Technology(伊利诺伊理工学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI

AI总结 提出DOSEBENCH基准测试,评估大语言模型在非处方药剂量问答中处理时间推理、约束遵循和不确定性的能力。

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07768 2026-06-03 cs.CV cs.AI cs.LG cs.MM 62%

PAND: Prompt-Aware Neighborhood Distillation for Lightweight Fine-Grained Visual Classification

PAND:面向提示的邻域蒸馏用于轻量级细粒度视觉分类

Qiuming Luo, Yuebing Li, Feng Li, Chang Kong

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出PAND框架,通过提示感知语义校准和邻域感知结构蒸馏,将大型视觉语言模型知识迁移至轻量网络,在细粒度分类任务上超越现有方法。

Comments Accepted by ICIP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16275 2026-06-03 cs.CL cs.AI 62%

SeSE: Black-Box Uncertainty Quantification for Large Language Models Based on Structural Information Theory

SeSE: 基于结构信息理论的大语言模型黑盒不确定性量化

Xingtao Zhao, Hao Peng, Dingli Su, Xianghua Zeng, Chunyang Liu, Jinzhi Liao, Philip S. Yu

机构 * School of Cyber Science and Technology Beihang University(北航信息科学与技术学院) School of Computer Science and Engineering Beihang University(北航计算机科学与工程学院) Didi Chuxing(滴滴出行) Laboratory for Big Data and Decision National University of Defense Technology(国防科技大学大数据与决策实验室) Department of Computer Science University of Illinois Chicago(伊利诺伊大学芝加哥分校计算机科学系)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI

AI总结 提出SeSE框架,通过构建语义空间的最优层次抽象并计算结构熵,实现大语言模型的黑盒不确定性量化,理论推广了语义熵并在长文本生成中优于现有方法。

Comments Accepted by UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01923 2026-06-02 cs.CL cs.LG 62%

Resonant Context Anchoring: Decoupling Attention Routing and Signal Gain at Inference Time

共振上下文锚定:推理时解耦注意力路由与信号增益

Mingkuan Zhao, Yide Gao, Wentao Hu, Suquan Chen, Tianchen Huang, Zhenhua An, Zetao Chang, Xiayu Sun, Yuheng Min

机构 * Xi’an Jiaotong University(西安交通大学) University of Science and Technology of China(中国科学技术大学) Tongji University(同济大学) Tsinghua University(清华大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 提出共振上下文锚定(RCA)方法,通过解耦自注意力中的路由逻辑与信息幅度,在推理时动态增强上下文令牌的信号,有效抑制大语言模型的参数化幻觉,提升事实一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27835 2026-06-02 cs.LG cs.CL 62%

CAREF: Calibration-Aware Regularization for Explanation Faithfulness Without Rationale Supervision

CAREF: 面向解释忠实性的校准感知正则化,无需理由监督

Naphat Nithisopa, Teerapong Panboonyuen

机构 * MARSAIL Chulalongkorn University(朱拉隆梭大学) PBYAIL (Panboonyuen AI Lab)(PBYAIL(Panboonyuen人工智能实验室))

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 提出CAREF框架,通过校准感知正则化联合优化预测准确性和解释忠实性,无需理由监督,在四个NLE基准上以少量可训练参数取得最佳性能。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏