arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-07 至 2026-04-07 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 8 篇

2604.03524 2026-04-07 cs.AI 77%

Structural Rigidity and the 57-Token Predictive Window: A Physical Framework for Inference-Layer Governability in Large Language Models

结构刚性和57个标记的预测窗口:一种用于大语言模型推理层可控性的物理框架

Gregory M. Ruddell

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文提出一种物理框架,通过分析大语言模型的推理行为,揭示了预提交信号的存在条件,并展示了结构刚性在不同几何区域中的统一度量。

Comments Extends arXiv:2603.21415. 30 pages. Also available on Zenodo (10.5281/zenodo.19393882)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04231 2026-04-07 cs.LG 70%

Subspace Control: Turning Constrained Model Steering into Controllable Spectral Optimization

子空间控制:将受约束的模型操控转化为可控的谱优化

Yancheng Huang, Changsheng Wang, Chongyu Fan, Yicheng Lang, Bingqi Shang, Yang Zhang, Mingyi Hong, Qing Qu, Alvaro Velasquez, Sijia Liu

机构 * OPTML, Michigan State University(OPTML,密歇根州立大学) MIT-IBM Watson AI Lab, IBM Research(MIT-IBM Watson AI Lab,IBM研究院) University of Minnesota(明尼苏达大学) University of Michigan(密歇根大学) University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本文提出子空间控制框架,通过分析谱交叉任务干扰并利用一阶解正交化合并子空间,引入SIFT方法,实现可控更新以缓解目标与约束冲突,在四个应用中均取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07149 2026-04-07 cs.LG cs.AI cs.CL cs.IT math.IT 67%

Measuring Uncertainty in Transformer Circuits with Effective Information Consistency

通过有效信息一致性测量变换器电路中的不确定性

Anatoly A. Krasnovsky

机构 * Innopolis University(因诺波利斯大学) MB3R Lab(MB3R实验室)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出有效信息一致性评分,通过局部雅可比矩阵和激活值计算规范化sheaf不一致性,并结合高斯EI代理评估电路层面因果涌现,以量化变换器电路行为的一致性与可信度。

Journal ref Automatic Documentation and Mathematical Linguistics 59 (Suppl 5), S423-S429 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04175 2026-04-07 cs.LG 57%

Uncertainty-Aware Foundation Models for Clinical Data

具有不确定性的临床数据基础模型

Qian Zhou, Yuanyun Zhang, Shi Li

机构 * University of the Chinese Academy of Sciences(中国科学院大学) Columbia University(哥伦比亚大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本文提出一种考虑不确定性的临床数据基础模型框架,通过学习集合值表示并强制一致性,提升预测性能和数据缺失下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15443 2026-04-07 cs.CL stat.ML 57%

ALIEN: Aligned Entropy Head for Improving Uncertainty Estimation of LLMs

ALIEN:对齐熵头以提高大语言模型的不确定性估计

Artem Zabolotnyi, Roman Makarov, Mile Mitrovic, Polina Proskura, Oleg Travkin, Roman Alferov, Alexey Zaytsev

机构 * Applied AI Institute, Moscow, Russia(应用人工智能研究所,莫斯科,俄罗斯) SB AI Lab, Moscow, Russia(SB AI实验室,莫斯科,俄罗斯) Intellectual data analysis and predictive modeling Institute, Moscow, Russia(智能数据分析与预测建模研究所,莫斯科,俄罗斯)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 ALIEN通过轻量级对齐方法提升大语言模型的不确定性估计,减少过自信,改进模型在困难输入下的预测可靠性。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03493 2026-04-07 cs.CL 57%

Cultural Authenticity: Comparing LLM Cultural Representations to Native Human Expectations

文化真实性:比较大语言模型的文化表征与本地人类期望

Erin MacMurray van Liemt, Aida Davani, Sinchana Kumbale, Neha Dixit, Sunipa Dev

机构 * Google Research(谷歌研究院) Google India(谷歌印度)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本文提出人类中心框架评估LLM生成内容与本地期望的一致性,发现部分模型存在以西方为中心的校准,文化距离越远一致性越低,并识别出系统性误差。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03388 2026-04-07 cs.LG stat.ML 57%

Scalable Variational Bayesian Fine-Tuning of LLMs via Orthogonalized Low-Rank Adapters

通过正交化低秩适配器实现大规模语言模型的可扩展变分贝叶斯微调

Haotian Xiang, Bingcong Li, Qin Lu

机构 * School of Electrical and Computer Engineering, University of Georgia(佐治亚大学电气与计算机工程学院) Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文提出PoLAR-VBLL框架,通过正交化低秩适配器与变分推断结合,实现大规模语言模型的可扩展贝叶斯微调,提升不确定性量化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04863 2026-04-07 cs.CV 50%

Beyond the Global Scores: Fine-Grained Token Grounding as a Robust Detector of LVLM Hallucinations

超越全局评分:细粒度令牌接地作为检测LVLM幻觉的稳健检测器

Tuan Dung Nguyen, Minh Khoi Ho, Qi Chen, Yutong Xie, Nguyen Cam-Tu, Minh Khoi Nguyen, Dang Huy Pham Nguyen, Anton van den Hengel, Johan W. Verjans, Phi Le Nguyen, Vu Minh Hieu Phan

机构 * Hanoi University of Science and Technology(河内科技大学) Australian Institute for Machine Learning, University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学) Nanjing University(南京大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Hanoi-Amsterdam High School for the Gifted(河内阿姆斯特丹天才高中)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出细粒度令牌接地方法,通过分析模型层间令牌交互,发现幻觉令牌的扩散注意力模式和语义对齐失败特征,实现90%的幻觉检测准确率。

Comments Accepted at CVPR2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏