arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-19 至 2026-03-19 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 4 篇

2511.07842 2026-03-19 cs.AI 88%

Safety-Preserving PTQ via Contrastive Alignment Loss

通过对比对齐损失实现安全性的PTQ

Sunghyun Wee, Suyoung Kim, Hyeonjin Kim, Kyomin Hwang, Nojun Kwak

机构 * Seoul National University(首尔国立大学) LG Electronics(LG电子)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 本文提出CAQ方法,通过引入对比对齐损失解决PTQ中安全对齐不足的问题,实现更稳健的4位量化,提升模型安全性而不牺牲通用能力。

Comments 9 pages, 4 figures. Includes 8 pages of supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01899 2026-03-19 cs.LG stat.ML 70%

Provably Safe Model Updates

可证明安全的模型更新

Leo Elmecker-Plakolm, Pierre Fasterling, Philip Sosnin, Calvin Tsay, Matthew Wicker

机构 * Department of Computing(计算系) Imperial College London(帝国理工学院伦敦分校) School of Computer and Comm. Sciences (IC)(计算机与通信科学系) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本文提出可证明安全的模型更新框架,通过计算最大局部不变域来确保模型更新的安全性,有效避免遗忘并提供形式化安全保证。

Comments 12 pages, 9 figures. This work has been accepted for publication at SaTML 2026. The final version will be available on IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17339 2026-03-19 cs.DL 50%

citecheck: An MCP Server for Automated Bibliographic Verification and Repair in Scholarly Manuscripts

citecheck: 一种MCP服务器,用于学术手稿中的自动文献验证与修复

Junhyeok Lee

专题命中 安全训练 :safety(abstract)

AI总结 citecheck通过自动化验证和修复学术手稿中的文献错误,包括识别错误、元数据不完整、作者归属错误及预印本与发表版本不一致等问题,提供结构化修复建议和安全诊断。

Comments 6 pages, 1 figure. Software paper on bibliography verification and repair for scholarly manuscripts; includes MCP server implementation and evaluation on repository-backed tests

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20095 2026-03-19 cs.CV 50%

WPT: World-to-Policy Transfer via Online World Model Distillation

WPT: 通过在线世界模型蒸馏实现世界到策略的迁移

Guangfeng Jiang, Yueru Luo, Jun Liu, Yi Huang, Yiyao Zhu, Zhan Qu, Dave Zhenyu Chen, Bingbing Liu, Xu Yan

机构 * University of Science and Technology of China(科学技术大学) CUHK-SZ(香港中文大学(深圳)) HKUST(香港理工大学) Huawei Foundation Model Department(华为基金会模型部)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出WPT方法,通过在线世界模型蒸馏实现策略迁移,提升规划性能并保持实时部署能力,实验表明其在开放环和闭合环基准上表现优异。

Comments CVPR2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏