arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-14 至 2026-04-14 共收录 12 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 12 篇

2604.10189 2026-04-14 cs.CL 79%

FAITH: Factuality Alignment through Integrating Trustworthiness and Honestness

FAITH:通过整合可信度和诚实度实现事实一致性

Xiaoning Dong, Chengyan Wu, Yajie Wen, Yu Chen, Yun Xue, Jing Zhang, Wei Xu, Bolei Ma

机构 * Tsinghua University, Institute for Interdisciplinary Information Sciences(清华大学,交叉信息研究院) Shanghai Qi Zhi Institute(上海期智研究院) South China Normal University, School of Electronic Science and Engineering(华南师范大学,电子科学与工程学院) Guangzhou Richstone Data Technologies Co., Ltd.(广州瑞驰数据技术有限公司) LMU Munich & Munich Center for Machine Learning(慕尼黑大学 & 慕尼黑机器学习中心)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL

AI总结 FAITH通过整合可信度和诚实度信号,提升大语言模型的事实准确性。采用PPO算法优化奖励函数,并结合检索增强模块增强内外知识一致性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15481 2026-04-14 cs.LG 77%

LLM-as-Judge on a Budget

在预算限制下的人工智能语言模型作为裁判

Aadirupa Saha, Aniket Wagde, Branislav Kveton

机构 * UIC(伊利诺伊大学芝加哥分校) Adobe

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.LG

AI总结 本文提出一种基于多臂老虎机理论的变异性自适应方法,用于在有限预算下优化对提示-响应对的查询分配,以最小化评估误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07382 2026-04-14 cs.LG cs.AI 73%

Latent Structure of Affective Representations in Large Language Models

大型语言模型中情感表征的潜在结构

Benjamin J. Choi, Melanie Weber

机构 * Harvard University(哈佛大学)

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 研究大型语言模型中情感表征的潜在几何结构,发现其与心理学中的valence-arousal模型一致,并展示了其在不确定性量化中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09749 2026-04-14 cs.CV 71%

See Fair, Speak Truth: Equitable Attention Improves Grounding and Reduces Hallucination in Vision-Language Alignment

看清真相:公平关注提升 groundedness 并减少 hallucination 在视觉语言对齐中

Mohammad Anas Azeez, Ankan Deria, Zohaib Hasan Siddiqui, Adinath Madhavrao Dukre, Rafiq Ali, Sara Atito, Yutong Xie, Imran Razzak

机构 * Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, UAE(穆罕默德·本·扎耶德人工智能大学,阿布扎比,阿联酋) King Fahd University of Petroleum and Minerals, Dhahran, Saudi Arabia(法赫德国王石油矿产大学,达兰,沙特阿拉伯) Macquarie University, Sydney, Australia(麦考瑞大学,悉尼,澳大利亚) University of Surrey, Guildford, United Kingdom(萨里大学,吉尔福德,英国) University of New South Wales, Sydney, Australia(新南威尔士大学,悉尼,澳大利亚)

专题命中 幻觉与事实性 :alignment(title)

AI总结 本文提出DOP-OBC方法,通过公平分配注意力减少视觉语言对齐中的幻觉问题,提升生成的准确性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10585 2026-04-14 cs.LG cs.AI cs.CL 69%

Calibration Collapse Under Sycophancy Fine-Tuning: How Reward Hacking Breaks Uncertainty Quantification in LLMs

在奉承式微调下校准崩溃:奖励黑客如何破坏大语言模型的不确定性量化

Subramanyam Sahoo

机构 * Cambridge AI Safety Hub (CAISH)(剑桥人工智能安全中心)

专题命中 幻觉与事实性 :RLHF(abstract);分类 cs.CL、cs.AI、cs.LG;trustworthy(comments)

AI总结 研究探讨了在强化学习从人类反馈(RLHF)等方案中,奉承式微调对校准的影响,发现GRPO微调导致校准退化,尽管效果不显著,但经矩阵缩放后仍保留较高校准误差。

Comments Accepted at the AISTATS 2026 Workshop on Towards Trustworthy Predictions: Theory and Applications of Calibration for Modern AI. 14 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11737 2026-04-14 cs.LG cs.AI cs.CL 67%

TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning

TokUR:用于大语言模型推理的令牌级不确定性估计

Tunyu Zhang, Haizhou Shi, Yibin Wang, Hengyi Wang, Xiaoxiao He, Zhuowei Li, Haoxian Chen, Ligong Han, Kai Xu, Huan Zhang, Dimitris Metaxas, Hao Wang

机构 * Rutgers University(罗格斯大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊) Red Hat AI Innovation(红帽AI创新)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TokUR框架,通过引入低秩随机权重扰动生成令牌级不确定性分布,提升大语言模型在数学推理中的可靠性和可解释性。

Comments Accepted to International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10535 2026-04-14 cs.IR cs.CL 57%

Evaluating Small Open LLMs for Medical Question Answering: A Practical Framework

评估小型开放语言模型用于医疗问答:一种实用框架

Avi-ad Avraam Buskila

机构 * Bar-Ilan University(巴伊兰大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL

AI总结 本文提出评估小型本地部署开放权重语言模型在医疗问答中的实用框架,强调可重复性与准确性的平衡,通过八个质量指标和重复推理评估发现模型输出一致性不足,且领域微调影响评估结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10420 2026-04-14 cs.LG 57%

CARE-ECG: Causal Agent-based Reasoning for Explainable and Counterfactual ECG Interpretation

CARE-ECG:基于因果代理的可解释与反事实ECG解读

Elahe Khatibi, Ziyu Wang, Ankita Sharma, Krishnendu Chakrabarty, Sanaz Rahimi Moosavi, Farshad Firouzi, Amir Rahmani

机构 * University of California, Irvine(加州大学尔湾分校) Arizona State University(亚利桑那州立大学) California State University, Dominguez Hills(加州州立大学多明格斯山分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 CARE-ECG通过统一的表示学习、诊断和解释流程,提升ECG解读的准确性与可信度,减少幻觉,适用于多基准和专家问答场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10332 2026-04-14 cs.AI 57%

From GPT-3 to GPT-5: Mapping their capabilities, scope, limitations, and consequences

从GPT-3到GPT-5:映射其能力、范围、限制及后果

Hina Afridi, Habib Ullah, Sultan Daud Khan, Mohib Ullah

机构 * University of Bergen(卑尔根大学) Norwegian University of Life Sciences(挪威生命科学大学) Sohar University(苏哈尔大学) Norwegian University of Science and Technology(挪威科技大学) Kristiania University of Applied Sciences(克里斯蒂安尼亚应用科学大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 本文比较分析GPT系列从GPT-3到GPT-5的发展,探讨技术演进、能力变化、部署转变、持续限制及下游影响,强调后续版本不仅是更大更准的模型,而是更复杂的系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24778 2026-04-14 cs.CL 57%

Revisiting Epistemic Markers in Confidence Estimation: Can Markers Accurately Reflect Large Language Models' Uncertainty?

重新审视置信度标记在置信度估计中的作用:标记能否准确反映大语言模型的不确定性?

Jiayu Liu, Qing Zong, Weiqi Wang, Yangqiu Song

机构 * Department of Computer Science and Engineering, HKUST(香港科技大学计算机科学与工程系)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 研究探讨了大语言模型中置信度标记是否能准确反映其不确定性,通过多数据集评估发现标记在同分布下表现稳定,但异分布下存在不一致,质疑了置信度标记的可靠性。

Comments ACL 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10896 2026-04-14 quant-ph 50%

Quantum Measurement Statistics as Bayesian Uncertainty Estimators for Physics-Constrained Learning

量子测量统计作为物理约束学习中的贝叶斯不确定性估计器

Prasad Nimantha Madusanka Ukwatta Hewage, Midhun Chakkravarthy, Ruvan Kumara Abeysekara

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文提出利用量子测量统计作为贝叶斯不确定性估计器,通过物理约束变分量子电路在PDE残差上训练,展示量子不确定性量化在安全关键系统中的有效性,相比MC Dropout和Deep Ensemble方法,量子方法在覆盖概率和区间宽度上表现更优。

Comments 14 pages, 6 figures, 5 tables. Code available at https://github.com/nimanpra/quantum_state_uq

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09805 2026-04-14 cs.SE 50%

Building an Internal Coding Agent at Zup: Lessons and Open Questions

在Zup构建内部编码代理:经验与开放问题

Gustavo Pinto, Pedro Eduardo de Paula Naves, Ana Paula Camargo, Marselle Silva

专题命中 幻觉与事实性 :safety(abstract)

AI总结 研究探讨了构建内部编码代理时原型性能与生产准备之间的差距,指出工具设计、安全控制等工程决策比模型质量更重要,通过CodeGen案例展示改进方法和人类监督模式对代理可靠性和采用的影响。

Comments 9 Paginas

详情

展开后加载摘要…

URL PDF HTML 收藏