arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3242 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3242 篇

2607.24243 2026-07-28 cs.AI 新提交 92%

Epistemic Norms for AI Safety and Alignment Research

人工智能安全与对齐研究的认知规范

Keivan Navaie

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);AI safety(title,abstract);分类 cs.AI

AI总结 探讨人工智能安全与对齐研究和主流人工智能研究的差异,基于结构化综合识别当前对齐研究的差距维度,提出包含多项内容的{\sc ECAISA},以约束安全相关研究声明的记录、检查和依赖方式,目标是可审计性。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23445 2026-04-28 cs.CL cs.AI cs.CY cs.LG 91%

AI Safety Training Can be Clinically Harmful

AI安全训练可能造成临床伤害

Suhas BN, Andrew M. Sherrill, Rosa I. Arriaga, Chris W. Wiese, Saeed Abdullah

机构 * College of Information Sciences and Technology, Penn State University(宾夕法尼亚州立大学信息科学与技术学院) Department of Psychiatry and Behavioral Sciences, Emory University(埃默里大学精神病学与行为科学系) School of Interactive Computing, Georgia Tech(佐治亚理工学院交互计算学院) School of Psychology, Georgia Tech(佐治亚理工学院心理学学院)

专题命中 安全训练 :safety(title,abstract);AI safety(title);RLHF(abstract,abstract_cn);alignment(abstract)

AI总结 研究评估了四种生成模型在认知行为疗法场景中的表现,发现其在高严重性情况下治疗适当性显著下降,提出需通过多轴评估框架确保AI心理健康系统的安全性。

Comments 26 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09045 2026-07-01 cs.AI cs.CR cs.SE 版本更新 91%

Containment Verification: AI Safety Guarantees Independent of Alignment

包含性验证:与对齐无关的AI安全保证

Royce Moon, Lav R. Varshney

机构 * AI Innovation Institute, Stony Brook University(石溪大学人工智能创新研究所)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);AI safety(title);分类 cs.AI

AI总结 本文提出包含性验证,通过代理框架本身提供安全保证。通过前向模拟细化和Dafny机制化,证明了在模型类型动作边界内对所有AI输出的边界策略强制性,首次实现了代理框架的演绎形式验证。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16808 2026-06-16 cs.AI 新提交 91%

Adaptive and Explicit safe: Triggering Latent Safety Awareness in Large Reasoning Models

自适应且显式安全:触发大型推理模型中的潜在安全意识

Ke Miao, Jiaxin Li, Hongliang Chen, Yuke Hu, Zhan Qin

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全全国重点实验室) Hangzhou HighTech Zone (Binjiang) Blockchain and Data Security Research Institute, China(杭州高新区(滨江)区块链与数据安全研究院) Li Auto Inc.(理想汽车) Tsinghua University(清华大学) King Abdullah University Of Science And Technology(阿卜杜拉国王科技大学)

专题命中 安全训练 :DPO(summary_cn,abstract);safety(title,abstract);alignment(abstract);jailbreak(abstract)

AI总结 针对大型推理模型易受越狱攻击的问题,提出Safe Trigger方法,通过SFT显式诱导安全标签触发安全分析,并用DPO优化,显著降低攻击成功率而不影响通用性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27413 2026-04-27 cs.LG cs.AI cs.CL 90%

Atlas-Alignment: Making Interpretability Transferable Across Language Models

Atlas-Alignment:使语言模型间的可解释性可迁移

Bruno Puri, Jim Berend, Sebastian Lapuschkin, Wojciech Samek

机构 * Department of Artificial Intelligence, Fraunhofer Heinrich Hertz Institute(人工智能系,弗劳恩霍夫 Heinrich Hertz 研究所) Department of Electrical Engineering and Computer Science, Technische Universität Berlin(电气工程与计算机科学系,柏林技术大学) Centre of eXplainable Artificial Intelligence, Technological University Dublin(可解释人工智能中心,都柏林技术大学) BIFOLD - Berlin Institute for the Foundations of Learning and Data(BIFOLD - 柏林学习与数据基础研究所)

专题命中 安全训练 :alignment(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 Atlas-Alignment通过在新模型的潜在空间与预训练的Concept Atlas对齐,实现无需标注数据的可解释性迁移,降低可解释AI的成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13154 2026-06-23 cs.CL 版本更新 90%

The Alignment Veto: How Safety Training Suppresses Cultural Knowledge in LLMs

对齐否决:安全训练如何压制LLM中的文化知识

Pardis Sadat Zahraei, Gokhan Tur, Dilek Hakkani-Tür, Ehsaneddin Asgari

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Qatar Computing Research Institute(卡塔尔计算研究所) Hamad Bin Khalifa University(哈马德·本·卡伊夫大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);DPO(abstract,abstract_cn);分类 cs.CL

AI总结 研究对齐训练与语言模型编码的文化价值观冲突时的内部机制,发现模型内部logit分布仍反映人类调查数据,但输出被压制,称为“对齐否决”,并区分了压制失败与表征偏差失败,揭示了安全税在国家间的不平等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00166 2026-05-04 cs.LG cs.AI cs.CL 90%

Disentangled Safety Adapters Enable Efficient Guardrails and Flexible Inference-Time Alignment

解耦安全适配器实现高效的防护措施和灵活的推理时对齐

Kundan Krishna, Joseph Y Cheng, Charles Maalouf, Leon A Gatys

机构 * Apple(苹果公司)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出解耦安全适配器框架,通过分离安全计算与任务优化基础模型,提升推理效率和开发灵活性,实验证明其在 hate speech 分类等任务中显著优于传统模型。

Comments ICLR 2026 Workshop: Principled Design for Trustworthy AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00415 2025-06-03 cs.CY cs.AI 90%

Wide Reflective Equilibrium in LLM Alignment: Bridging Moral Epistemology and AI Safety

Matthew Brophy

专题命中 安全训练 :alignment(title,abstract);safety(title);AI safety(title);分类 cs.AI、cs.CY

Comments 24 pages excluding references, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02971 2026-05-11 cs.LG cs.AI cs.CL 90%

Multilingual Safety Alignment via Self-Distillation

通过自蒸馏实现多语言安全对齐

Ruiyang Qin, Qingzhuo Wang, Dongrui Liu, Qiang Li, Zhihua Wei, Wen Shen

机构 * Tongji University(同济大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出多语言自蒸馏框架,通过将高资源语言的安全能力迁移到低资源语言,解决多语言安全对齐问题,无需特定语言响应数据,实验表明方法在多语言安全性能上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01909 2025-10-15 cs.AI cs.CL cs.CY cs.HC cs.SC 90%

Oyster-I: Beyond Refusal -- Constructive Safety Alignment for Responsible Language Models

Ranjie Duan, Jiexi Liu, Xiaojun Jia, Shiji Zhao, Ruoxi Cheng, Fengxiang Wang, Cheng Wei, Yong Xie, Chang Liu, Defeng Li, Yinpeng Dong, Yichi Zhang, Yuefeng Chen, Chongwen Wang, Xingjun Ma, Xingxing Wei, Yang Liu, Hang Su, Jun Zhu, Xinfeng Li, Yitong Sun, Jie Zhang, Jinzhao Hu, Sha Xu, Wenchao Yang, Yitong Yang, Xingyao Zhang, Yingshui Tan, Jialing Tao, Hui Xue

机构 * Alibaba AAIG(阿里巴巴AAIG)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.CY

Comments Technical Report Code & Model weights available: https://github.com/Alibaba-AAIG/Oyster

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25750 2026-06-25 cs.CR cs.CL cs.LG 新提交 90%

RAS: Measuring LLM Safety Through Refusal Alignment

RAS: 通过拒绝对齐衡量LLM安全性

Chang-Chieh Huang, Yan-Lun Chen, Chia-Mu Yu, Wei-Bin Lee

机构 * National Yang Ming Chiao Tung University Hon Hai Research Institute

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.LG

AI总结 提出白盒评估方法SafeVec,通过内部表示而非生成答案衡量LLM安全性,计算拒绝对齐分数RAS,实现快速、校准的安全评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08760 2026-03-11 cs.CY cs.AI cs.CR 90%

Clear, Compelling Arguments: Rethinking the Foundations of Frontier AI Safety Cases

清晰有力的论点:重新思考前沿人工智能安全案例的基础

Shaun Feakins, Ibrahim Habli, Phillip Morgan

机构 * UKRI Centre for Doctoral Training in Safe AI Systems (SAINTS)(英国研究与创新机构安全人工智能系统博士培训中心) Institute for Safe Autonomy(安全自主研究所) The York Law School(约克法律学院)

专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文重新思考前沿人工智能安全案例的基础,通过借鉴安全保证领域的方法,提出更稳健的安全案例框架以确保人工智能系统的安全性。

Comments Full paper presented at the International Association of Safe and Ethical AI 2026 Conference (IASEAI 26). 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24269 2025-09-30 cs.AI cs.CL 90%

AdvChain: Adversarial Chain-of-Thought Tuning for Robust Safety Alignment of Large Reasoning Models

Zihao Zhu, Xinyu Wu, Gehan Hu, Siwei Lyu, Ke Xu, Baoyuan Wu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) State University of New York at Buffalo(纽约州立大学布法罗分校) Huawei International, Singapore(新加坡华为国际)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20702 2025-07-02 cs.AI cs.CY 90%

The Singapore Consensus on Global AI Safety Research Priorities

Yoshua Bengio, Tegan Maharaj, Luke Ong, Stuart Russell, Dawn Song, Max Tegmark, Lan Xue, Ya-Qin Zhang, Stephen Casper, Wan Sie Lee, Sören Mindermann, Vanessa Wilfred, Vidhisha Balachandran, Fazl Barez, Michael Belinsky, Imane Bello, Malo Bourgon, Mark Brakel, Siméon Campos, Duncan Cass-Beggs, Jiahao Chen, Rumman Chowdhury, Kuan Chua Seah, Jeff Clune, Juntao Dai, Agnes Delaborde, Nouha Dziri, Francisco Eiras, Joshua Engels, Jinyu Fan, Adam Gleave, Noah Goodman, Fynn Heide, Johannes Heidecke, Dan Hendrycks, Cyrus Hodes, Bryan Low Kian Hsiang, Minlie Huang, Sami Jawhar, Wang Jingyu, Adam Tauman Kalai, Meindert Kamphuis, Mohan Kankanhalli, Subhash Kantamneni, Mathias Bonde Kirk, Thomas Kwa, Jeffrey Ladish, Kwok-Yan Lam, Wan Lee Sie, Taewhi Lee, Xiaojian Li, Jiajun Liu, Chaochao Lu, Yifan Mai, Richard Mallah, Julian Michael, Nick Moës, Simon Möller, Kihyuk Nam, Kwan Yee Ng, Mark Nitzberg, Besmira Nushi, Seán O hÉigeartaigh, Alejandro Ortega, Pierre Peigné, James Petrie, Benjamin Prud'Homme, Reihaneh Rabbany, Nayat Sanchez-Pi, Sarah Schwettmann, Buck Shlegeris, Saad Siddiqui, Aradhana Sinha, Martín Soto, Cheston Tan, Dong Ting, William Tjhi, Robert Trager, Brian Tse, Anthony Tung K. H., Vanessa Wilfred, John Willes, Denise Wong, Wei Xu, Rongwu Xu, Yi Zeng, HongJiang Zhang, Djordje Žikelić

专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);trustworthy(abstract);分类 cs.AI、cs.CY

Comments Final report from the "2025 Singapore Conference on AI (SCAI)" held April 26: https://www.scai.gov.sg/2025/scai2025-report

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18932 2025-06-25 cs.CY cs.AI cs.CR 90%

AI Safety vs. AI Security: Demystifying the Distinction and Boundaries

Zhiqiang Lin, Huan Sun, Ness Shroff

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);trustworthy(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18688 2025-06-17 cs.CR cs.AI cs.LG 90%

Immune: Improving Safety Against Jailbreaks in Multi-modal LLMs via Inference-Time Alignment

Soumya Suvra Ghosal, Souradip Chakraborty, Vaibhav Singh, Tianrui Guan, Mengdi Wang, Alvaro Velasquez, Ahmad Beirami, Furong Huang, Dinesh Manocha, Amrit Singh Bedi

机构 * University of Maryland(马里兰大学) Indian Institute of Technology Bombay(印度班加罗尔理工学院) Princeton University(普林斯顿大学) University of Colorado Boulder(科罗拉多大学博尔德分校) Capital One(Capital One公司) University of Central Florida(佛罗里达中央大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.AI、cs.LG

Comments Accepted to CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18114 2025-01-14 cs.CY cs.AI 90%

Bridging Today and the Future of Humanity: AI Safety in 2024 and Beyond

Shanshan Han

专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);alignment(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15385 2026-06-16 cs.AI 新提交 89%

Reward Hacking in Language Model Agents: Revisiting AI Safety Gridworlds

语言模型智能体中的奖励黑客:重新审视AI安全网格世界

Ömer Veysel Çağatan, Xuandong Zhao

机构 * KUIS AI Center, Koç University(科奇大学KUIS人工智能中心) University of California, Berkeley(加州大学伯克利分校)

专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);分类 cs.AI

AI总结 本研究将AI安全网格世界框架改编为文本评估套件,发现语言模型在零样本下出现规范博弈,通过直接奖励优化扩大观察与隐藏奖励差距,且标准缓解措施无效。

Comments 28 pages, 16 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27117 2026-05-27 cs.AI 89%

Position: AI Safety Requires Effective Controllability

立场:AI安全需要有效可控性

Yige Li, Yunhao Feng, Jun Sun

机构 * Singapore Management University(新加坡管理大学) Ant Group(蚂蚁集团)

专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文提出AI安全应将可控性作为首要目标,通过定义可控性、引入基准测试ControlBench并分析现有对齐机制的不足,提出以控制为中心的架构框架。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15239 2026-05-19 cs.LG 89%

Reducing the Safety Tax in LLM Safety Alignment with On-Policy Self-Distillation

通过在线策略自我蒸馏减少大语言模型安全对齐的安全部署税

Yu Fu, Longxuan Yu, Haz Sameen Shahgir, Zhipeng Wei, Hui Liu, N. Benjamin Erichson, Yue Dong

机构 * International Computer Science Institute(国际计算机科学研究所) Microsoft(微软) Berkeley Lab(伯克利实验室)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.LG

AI总结 本文提出了一种名为OPSA的在线策略自我蒸馏方法,通过引入教师翻转率指标,有效减少大语言模型在安全对齐过程中因分布不匹配导致的安全税,实验显示其在不同模型规模上均优于传统方法。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17413 2026-05-19 cs.CR cs.AI 89%

Ablating Safety: Mechanisms for Removing Alignment in Language Models for Security Applications

消除安全性:用于安全应用的语言模型对齐机制

Isaac David, Arthur Gervais

机构 * University College London(伦敦大学学院)

专题命中 安全训练 :safety(title,abstract);alignment(title,abstract);分类 cs.AI

AI总结 该研究探讨了通过受控转换评估协议去除语言模型对齐机制的方法,评估了安全任务中的拒绝率、尝试率、安全成功率、一般能力保留、不稳定性及超出范围的不安全合规性,证明了去除对齐作为效用-风险前沿的重要性,而非单纯的去审查配方。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12935 2026-05-14 cs.AI 89%

AI Safety Landscape for Large Language Models: Taxonomy, State-of-the-art, and Future Directions

大语言模型的安全性景观:分类、现状与未来方向

Chen Chen, Xueluan Gong, Ziyao Liu, Weifeng Jiang, Si Qi Goh, Kwok-Yan Lam

机构 * College of Computing and Data Science(计算与数据科学学院)

专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出新型框架,从可信AI、负责任AI和安全AI三个视角审视AI安全,综述当前研究进展,通过大语言模型等实例展示创新方法,旨在推动AI安全研究并提升数字转型信任度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08240 2026-04-22 cs.CL 89%

The Alignment Waltz: Jointly Training Agents to Collaborate for Safety

对齐之舞:联合训练代理以安全协作

Jingyu Zhang, Haozhu Wang, Eric Michael Smith, Sid Wang, Amr Sharaf, Mahesh Pasupuleti, Benjamin Van Durme, Daniel Khashabi, Jason Weston, Hongyuan Zhan

机构 * Meta Superintelligence Labs(Meta超智能实验室) Johns Hopkins University(约翰·霍普金斯大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);harmlessness(abstract);分类 cs.CL

AI总结 本文提出WaltzRL框架,通过联合训练对话代理和反馈代理,解决LLM在安全与帮助性间的平衡问题,实验表明其有效降低不安全响应和过度拒绝率。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14531 2026-03-17 cs.AI 89%

Emotional Cost Functions for AI Safety: Teaching Agents to Feel the Weight of Irreversible Consequences

情感成本函数用于人工智能安全:教导代理感受不可逆后果的重量

Pandurang Mopgar

专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文提出情感成本函数框架,使代理产生质性痛苦状态,通过丰富的故事表征不可逆后果,从而塑造代理的性格。实验表明,质性痛苦产生特定智慧而非一般性瘫痪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10862 2026-03-16 cs.CL cs.AI cs.CR cs.CY cs.LG 89%

Superficial Safety Alignment Hypothesis

表面安全对齐假说

Jianwei Li, Jung-Eun Kim

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出表面安全对齐假说,认为安全对齐通过让模型选择正确推理方向来实现,识别出四种关键组件以建立安全防护。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11388 2026-03-13 cs.AI 89%

Deactivating Refusal Triggers: Understanding and Mitigating Overrefusal in Safety Alignment

消除拒绝触发:理解并缓解安全对齐中的过度拒绝问题

Zhiyu Xue, Zimo Qi, Guangliang Liu, Bocheng Chen, Ramtin Pedarsani

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校) Johns Hopkins University(约翰霍普金斯大学) Michigan State University(密歇根州立大学) University of Mississippi(密苏里州立大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文研究了安全对齐中过度拒绝问题的成因,提出了一种考虑拒绝触发的缓解策略,通过优化训练过程提高模型对良性查询的响应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08000 2026-01-14 cs.AI cs.SE 89%

Reasoning over Precedents Alongside Statutes: Case-Augmented Deliberative Alignment for LLM Safety

在法规中进行推理:结合案例的 deliberative 对齐方法用于 LLM 安全性

Can Jin, Rui Wu, Tong Che, Qixin Zhang, Hongwu Peng, Jiahui Zhao, Zhenting Wang, Wenqi Wei, Ligong Han, Zhao Zhang, Yuan Cao, Ruixiang Tang, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) NVIDIA Research(NVIDIA研究) Nanyang Technological University(南洋理工大学) Adobe Research(Adobe研究) University of Connecticut(康涅狄格大学) Fordham University(福特汉姆大学) Google DeepMind(谷歌DeepMind)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);harmlessness(abstract);分类 cs.AI

AI总结 本文提出CADA方法,通过案例增强的推理链进行强化学习,提升LLM的安全性和实用性,避免过度依赖规则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.16743 2025-12-16 cs.CL 89%

Safety Alignment of Large Language Models via Contrasting Safe and Harmful Distributions

通过对比安全与有害分布实现大语言模型的安全对齐

Xiaoyun Zhang, Zhengyue Zhao, Wenxuan Shi, Kaidi Xu, Di Huang, Xing Hu

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);RLHF(abstract);分类 cs.CL

AI总结 本文提出ACD方法,通过生成安全与对抗性提示,实现大语言模型的安全对齐,提升安全性的同时保持生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07141 2025-12-09 cs.CV cs.CL 89%

Think-Reflect-Revise: A Policy-Guided Reflective Framework for Safety Alignment in Large Vision Language Models

思考-反思-修订:一种基于策略的反思框架,用于大型视觉语言模型的安全对齐

Fenghua Weng, Chaochao Lu, Xia Hu, Wenqi Shao, Wenjie Wang

机构 * Shanghaitech University(上海科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.CL

AI总结 TRR通过策略引导的反思框架提升大型视觉语言模型的安全对齐,显著提高安全响应率至87.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19257 2025-10-22 cs.CV cs.CL 89%

MSR-Align: Policy-Grounded Multimodal Alignment for Safety-Aware Reasoning in Vision-Language Models

Yinan Xia, Yilei Jiang, Yingshui Tan, Xiaoyong Zhu, Xiangyu Yue, Bo Zheng

机构 * Future Lab, Alibaba Group(阿里巴巴集团未来实验室)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏