arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-22 至 2026-04-22 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 2 篇

2510.26566 2026-04-22 cs.LG cs.AI 73%

Multiclass Local Calibration with the Jensen-Shannon Distance

多类局部校准与 Jensen-Shannon 距离

Cesare Barbera, Lorenzo Perini, Giovanni De Toni, Andrea Passerini, Andrea Pugnana

机构 * University of Trento(特伦托大学) University of Pisa(比萨大学) Meta Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出多类局部校准概念,通过 Jensen-Shannon 距离改进神经网络的局部校准能力,解决现有方法在稀疏区域的校准偏差问题。

Comments Accepted at AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18963 2026-04-22 cs.LG cs.AI 62%

Distillation Traps and Guards: A Calibration Knob for LLM Distillability

知识蒸馏陷阱与守护:一种用于LLM可蒸馏性的校准调节器

Weixiao Zhan, Yongcheng Jing, Leszek Rutkowski, Dacheng Tao

机构 * Generative AI Lab, College of Computing and Data Science(生成人工智能实验室,计算与数据科学学院) Nanyang Technological University(南洋理工大学) Systems Research Institute of the Polish Academy of Sciences(波兰科学院系统研究所) AGH University of Krakow(克拉科夫AGH大学) SAN University(SAN大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文分析了知识蒸馏中的陷阱,提出了一种后处理校准方法,通过强化学习微调控制教师模型的可蒸馏性,提升蒸馏效果和模型安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏