arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-08 至 2026-06-08 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 2 篇

2606.06533 2026-06-08 cs.AI cs.CL 新提交 62%

Position: Don't Just "Fix it in Post": A Science of AI Must Study Training Dynamics

立场:不要仅仅“在后期修复它”:AI科学必须研究训练动态

Stella Biderman, Mohammad Aflah Khan, Niloofar Mireshghallah, Catherine Arnett, Fazl Barez, Naomi Saphra

机构 * Carnegie Mellon University(卡内基梅隆大学) Boston University(波士顿大学) Harvard University(哈佛大学) University of Oxford, Martian(牛津大学,火星) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文主张AI科学应超越事后分析,研究训练动态以预测、干预和设计模型行为,并指出当前在可解释性、公平性等领域的进展及开放问题。

Comments Accepted as an oral to the ICML: https://icml.cc/virtual/2026/poster/67142

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04349 2026-06-08 cs.CV cs.AI 版本更新 57%

MorphoQuant: Modality-Aware Quantization for Omni-modal Large Language Models

MorphoQuant: 面向全模态大语言模型的模态感知量化

Yue Wu, Changyuan Wang, Zixuan Wang, Shilin Ma, Yansong Tang

机构 * institutetext: MorphoQuant: Modality-Aware Quantization for Omni-modal Large Language Models Yue Wu Changyuan Wang Zixuan Wang Shilin Ma Yansong Tang(机构文本:MorphoQuant:多模态大语言模型的模态感知量化 Yue Wu 王昌元 王梓轩 马世林 唐彦松)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 提出MorphoQuant框架,通过分布感知偏差补偿和形态导向量化函数优化,解决全模态大语言模型在4比特后训练量化中的分布异质性和异常值问题,实现精度与效率的优异平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏