Intent-aligned AI systems deplete human agency: the need for agency foundations research in AI safety
专题命中 安全训练 :safety(title);AI safety(title);alignment(abstract);分类 cs.AI、cs.CY
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全训练 :safety(title);AI safety(title);alignment(abstract);分类 cs.AI、cs.CY
专题命中 安全训练 :safety(title,abstract);AI safety(title);分类 cs.AI、cs.LG
Comments 29 pages
通过拉格朗日奖励增强实现安全推理时对齐
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Independent Researcher(独立研究者)
专题命中 安全训练 :alignment(title,abstract);safety(abstract);harmlessness(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究提出拉格朗日奖励增强框架,从含奖励与成本模型的约束目标出发,经对偶化将问题转化为一维凸问题,校准对偶变量获增强奖励,提升推理时对齐的有益性与无害性权衡。
智能体安全是认知属性,而非行为属性
专题命中 安全训练 :safety(title,abstract);alignment(abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG
AI总结 本文提出AI安全应视为认知属性,强调系统需保持可教性(teachability),即在学习、适应和自修改过程中仍能被纠正。
Comments To appear in proceedings of ICML 2026
测试时强化学习中的放大效应:安全性和推理漏洞
机构 * Penn State University(宾夕法尼亚州立大学) ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Mitsubishi Electric Research Laboratories(三菱电机研究实验室)
专题命中 安全训练 :safety(title,abstract);jailbreak(abstract);prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究了测试时训练方法的安全性漏洞,发现测试时强化学习中有害提示注入会放大模型行为,导致推理能力下降。
机构 * Key Lab of Intelligent Information Processing, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(智能信息处理重点实验室,计算技术研究所,中国科学院) ; State Key Lab of AI Safety(人工智能安全国家重点实验室) ; University of Chinese Academy of Sciences, CAS(中国科学院大学) ; Zhejiang University(浙江大学)
专题命中 安全训练 :alignment(title,abstract);RLHF(abstract);harmlessness(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 19 pages, 3 figures. Accepted by ACL 2025 (main)
我们思考,因此我们对LLMs进行对齐,使其在出错前变得有益、无害和诚实
机构 * School of Computing Macquarie University(计算机学院麦Quarie大学)
专题命中 安全训练 :RLHF(abstract,abstract_cn);harmlessness(abstract,abstract_cn);alignment(abstract);trustworthy(abstract)
AI总结 本文提出AMBS框架,通过在1-to-N Transformer设置中参数化目标特定转换,解决LLM对齐中多个目标之间的干扰问题,提升HHH目标的联合满足能力。
机构 * KAIST(韩国科学技术院)
专题命中 安全训练 :safety(title,abstract);alignment(title);分类 cs.AI
Comments Under review
专题命中 安全训练 :safety(title,abstract);AI safety(title);分类 cs.CY
Comments 28 pages, 8 figures
机构 * IIIT Hyderabad(海德拉巴国家理工学院) ; NSUT Delhi(德里NSUT)
专题命中 安全训练 :safety(title,abstract);AI safety(title);分类 cs.CL
专题命中 安全训练 :safety(title,abstract);trustworthy(title);分类 cs.AI
Comments arXiv admin note: text overlap with arXiv:2406.10847
专题命中 安全训练 :safety(title,abstract);AI safety(title);分类 cs.AI
专题命中 安全训练 :safety(title);AI safety(title);alignment(abstract);分类 cs.LG
Comments 24 pages, 6 figures
利用文本拒绝方向实现多模态安全
机构 * University of Trento(特伦托大学)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG
AI总结 提出MARS方法,通过从LLM骨干提取的文本拒绝方向泛化到多模态,无需多模态安全数据即可提升安全性,在五个先进MLLM上验证了有效性。
Comments Preprint
AnchorKV: 通过拒绝锚点的软惩罚实现安全感知的KV缓存压缩
机构 * Department of Computer Science, Tufts University(塔夫茨大学计算机科学系) ; Department of Electrical and Computer Engineering, Tufts University(塔夫茨大学电气与计算机工程系)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG
AI总结 提出AnchorKV,一种通过软惩罚机制调整令牌保留分数以远离有害提示的KV缓存压缩方法,在保持实用性的同时显著提升安全性。
Lyapunov引导的自对齐:用于离线安全强化学习的测试时适应
机构 * Seoul National University(首尔国立大学)
专题命中 安全训练 :alignment(title,abstract);safety(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 本文提出SAS框架,通过自对齐机制在不重新训练的情况下实现离线安全强化学习的测试时适应,利用Lyapunov条件筛选可行轨迹并生成上下文提示,提升安全性与性能。
Comments Accepted at AISTATS 2026. First two authors contributed equally. Project page: https://seungyubhan.github.io/sas/. Code: https://github.com/seungyubhan/sas
Text2VLM: 将文本-only数据集适应于评估视觉语言模型对齐训练
机构 * Advai
专题命中 安全训练 :alignment(title,abstract);safety(abstract);prompt injection(abstract);分类 cs.CL、cs.AI
AI总结 Text2VLM通过将文本-only数据集转换为多模态格式,评估VLMs对提示注入攻击的鲁棒性,并揭示模型对齐中的关键弱点。
Comments 9 pages, 9 figures. Jake Thomas served as Editor for this manuscript
Journal ref Proceedings of the 2025 Conference on Applied Machine Learning for Information Security, Proceedings of Machine Learning Research PMLR Vol 299 pp 28 41
Reflect: 为大规模宪法对齐的透明原则引导推理
机构 * Duke University(杜克大学) ; Independent Researcher(独立研究者)
专题命中 安全训练 :alignment(title,abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.LG
AI总结 Reflect通过透明推理框架在不需训练数据的情况下提升大语言模型对多样原则的对齐能力,增强安全性和鲁棒性。
大语言模型在线性可分的表示中编码语义和对齐
机构 * Yale University(耶鲁大学) ; Foundation AI – Cisco Systems Inc(Foundation AI – 卡西欧系统公司)
专题命中 安全训练 :alignment(title,abstract);safety(abstract);prompt injection(abstract);分类 cs.CL、cs.LG
AI总结 本研究发现大语言模型通过线性可分的表示编码语义和对齐,提出基于潜在空间的MLP探测器有效提升安全防护。
Comments IJCNLP and the Asian Chapter of ACL
理解并保持在微调大语言模型中的安全性
机构 * Zhejiang University(浙江大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; University of Waterloo(滑铁卢大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Sun Yat-sen University(中山大学)
专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG
AI总结 本文提出安全保持微调(SPF)方法,通过分析安全性与实用性梯度的几何关系,有效解决微调过程中安全性与实用性之间的矛盾,保持模型性能并恢复预训练的安全性对齐。
COMPASS:一个评估大语言模型在组织特定政策对齐性的框架
机构 * AIM Intelligence(AIM智能科技) ; BMW Group(宝马集团) ; Yonsei University(延世大学) ; POSTECH ; Seoul National University(首尔国立大学)
专题命中 安全训练 :alignment(title,abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY
AI总结 COMPASS框架通过评估大语言模型在组织特定政策下的对齐性,揭示了模型在合规性与对抗性鲁棒性上的显著差异,为组织AI安全提供了关键评估工具。
机构 * Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学) ; Department of Computer Science and Engineering, Yonsei University(计算机科学与工程系,延世大学)
专题命中 安全训练 :alignment(title,abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
Comments Accepted at NeurIPS 2025. Code and models are available at https://ai-isl.github.io/safepath
专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG
机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) ; Imperial College London(帝国理工学院伦敦分校) ; University College London(伦敦大学学院) ; UCL Centre for Artificial Intelligence(UCL人工智能中心)
专题命中 安全训练 :alignment(title,abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.LG
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; Southern University of Science and Technology(南方科技大学)
专题命中 安全训练 :alignment(title,abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
机构 * The Hebrew University(希伯来大学)
专题命中 安全训练 :alignment(title,abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
专题命中 安全训练 :safety(title,abstract);alignment(abstract);harmlessness(abstract);分类 cs.CL、cs.AI
Comments 18 pages, 23 figures
专题命中 安全训练 :safety(title,abstract);alignment(abstract);harmlessness(abstract);分类 cs.CL、cs.LG
Comments 29pages
专题命中 安全训练 :alignment(title,abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
Comments Accepted by EMNLP 2024, 15 pages, 5 figures