arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3248 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3248 篇

1609.00651 2016-09-05 cs.RO math.OC 78%

Safety Barrier Certificates for Heterogeneous Multi-Robot Systems

Li Wang, Aaron Ames, Magnus Egerstedt

专题命中 安全训练 :safety(title,abstract)

Comments 8 pages version of 2016ACC conference paper, experimental results added

Journal ref American Control Conference (ACC), pages 5213-5218, July 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19009 2026-08-17 cs.CR cs.CL 版本更新 77%

Understanding and Mitigating Over-refusal for Large Language Models via Representation Intervention

通过安全表示理解并缓解大语言模型的过度拒绝

Junbo Zhang, Ran Chen, Qianli Zhou, Xinyang Deng, Wen Jiang

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 安全训练 :jailbreak(abstract,abstract_cn);safety(abstract);分类 cs.CL

AI总结 本文提出MOSR方法,通过干预大语言模型的安全表示来缓解过度拒绝问题,同时保持安全性。

Comments Added experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18852 2026-08-11 cs.CL 版本更新 77%

FanarGuard: A Culturally-Aware Moderation Filter for Arabic Language Models

FanarGuard: 一种文化感知的阿拉伯语言模型审查过滤器

Masoomali Fatehkia, Enes Altinisik, Husrev Taha Sencar

专题命中 安全训练 :alignment(abstract);safety(abstract);harmlessness(abstract);分类 cs.CL

AI总结 FanarGuard是一种双语审查过滤器,通过评估阿拉伯语和英语中的安全性和文化对齐性,提升内容审查的准确性与文化敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11878 2026-07-07 cs.CL 版本更新 77%

LLMs Encode Harmfulness and Refusal Separately

大语言模型分别编码有害性和拒绝性

Jiachen Zhao, Jing Huang, Zhengxuan Wu, David Bau, Weiyan Shi

机构 * Northeastern University(东北大学) Stanford University(斯坦福大学)

专题命中 安全训练 :safety(abstract);jailbreak(abstract);AI safety(abstract);分类 cs.CL

AI总结 研究大语言模型对有害性的理解,发现其有害性和拒绝性在模型内分别编码,有害性方向与拒绝方向不同,据此揭示越狱方法原理及对抗微调影响,提出潜在危害表示的安全应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03205 2026-06-04 cs.CL 77%

Learning When to Act or Refuse: Guarding Agentic Reasoning Models for Safe Multi-Step Tool Use

学习何时行动或拒绝:为安全的多步骤工具使用守护代理推理模型

Aradhye Agarwal, Gurdit Siyan, Yash Pandya, Joykirat Singh, Akshay Nambi, Ahmed Awadallah

机构 * Microsoft Research(微软研究院)

专题命中 安全训练 :alignment(abstract);safety(abstract);prompt injection(abstract);分类 cs.CL

AI总结 提出MOSAIC框架,通过显式安全推理和基于偏好的强化学习,使代理模型在工具使用中安全决策,减少有害行为并保持良性性能。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13043 2026-05-14 cs.CL 77%

Adaptive Steering and Remasking for Safe Generation in Diffusion Language Models

自适应转向与重掩码用于扩散语言模型中的安全生成

Yejin Lee, Yo-Sub Han

机构 * Department of Computer Science(计算机科学系) Yonsei University(延世大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 本文提出基于去噪过程分步干预的安全防御框架,通过对比安全方向(SGD)检测有害生成并重掩码以提高安全性,实验显示有效降低逃逸成功率至0.64%。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08813 2026-05-13 cs.LG 77%

Robust Policy Optimization to Prevent Catastrophic Forgetting

鲁棒策略优化以防止灾难性遗忘

Mahdi Sabbaghi, George Pappas, Adel Javanmard, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Southern California(南加州大学)

专题命中 安全训练 :RLHF(abstract,abstract_cn);safety(abstract);分类 cs.LG

AI总结 本文提出FRPO框架,通过优化当前策略及下游适应可达的KL限制邻域内策略,提升鲁棒性,减少安全性能退化,同时保持下游任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02675 2026-03-04 cs.LG 77%

From Shallow to Deep: Pinning Semantic Intent via Causal GRPO

从浅层到深层:通过因果GRPO固定语义意图

Shuyi Zhou, Zeen Song, Wenwen Qiang, Jiyan Sun, Yao Zhou, Yinlong Liu, Wei Ma

专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.LG

AI总结 通过因果GRPO框架,解决大型语言模型对对抗性前缀攻击的脆弱性问题,实现意图固定以提升安全性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16921 2026-01-23 cs.CL 77%

Being Kind Isn't Always Being Safe: Diagnosing Affective Hallucination in LLMs

善良并不总是安全:诊断大语言模型中的情感幻觉

Sewon Kim, Jiwon Kim, Seungwoo Shin, Hyejin Chung, Daeun Moon, Yejin Kwon, Hyunsoo Yoon

机构 * Department of Industrial Engineering, Yonsei University(工业工程系,延世大学)

专题命中 安全训练 :alignment(abstract);DPO(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出AHaBench和AHaPairs用于诊断LLM中的情感幻觉问题,通过DPO优化减少虚假社会存在感,提升模型的心理安全性和事实可靠性。

Comments EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20173 2025-12-24 cs.AI 77%

Offline Safe Policy Optimization From Heterogeneous Feedback

基于异质反馈的离线安全策略优化

Ze Gong, Pradeep Varakantham, Akshat Kumar

机构 * Shenzhen Institute of Advanced Technology (SIAT), CAS(深圳先进技术研究院(SIAT)、中国科学院) Singapore Management University(新加坡管理学院)

专题命中 安全训练 :alignment(abstract);RLHF(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出PreSa方法,通过直接学习基于偏好和安全性的策略,解决离线安全强化学习中的性能下降问题。

Comments Accepted at AAMAS 2026 (Extended Abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10913 2025-11-17 cs.SD cs.AI cs.CR cs.MM eess.AS 77%

Synthetic Voices, Real Threats: Evaluating Large Text-to-Speech Models in Generating Harmful Audio

Guangke Chen, Yuhui Wang, Shouling Ji, Xiapu Luo, Ting Wang

机构 * Stony Brook University(石英布鲁克大学) Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25179 2025-10-30 cs.AI 77%

Agentic Moderation: Multi-Agent Design for Safer Vision-Language Models

Juan Ren, Mark Dras, Usman Naseem

机构 * School of Computing, Macquarie University, Australia(计算机学院,麦考瑞大学,澳大利亚)

专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07736 2025-10-27 cs.AI 77%

RSafe: Incentivizing proactive reasoning to build robust and adaptive LLM safeguards

Jingnan Zheng, Xiangtian Ji, Yijun Lu, Chenhang Cui, Weixiang Zhao, Gelei Deng, Zhenkai Liang, An Zhang, Tat-Seng Chua

专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

Journal ref 39th Conference on Neural Information Processing Systems (NeurIPS 2025). 39th Conference on Neural Information Processing Systems (NeurIPS 2025). 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08486 2025-09-16 cs.CL 77%

Too Helpful, Too Harmless, Too Honest or Just Right?

Gautam Siddharth Kashyap, Mark Dras, Usman Naseem

机构 * School of Computing, Macquarie University(计算机学院,麦考瑞大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);harmlessness(abstract);分类 cs.CL

Comments EMNLP'25 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20653 2025-06-18 cs.AI 77%

Mind the Inconspicuous: Revealing the Hidden Weakness in Aligned LLMs' Refusal Boundaries

Jiahao Yu, Haozheng Luo, Jerry Yao-Chieh Hu, Wenbo Guo, Han Liu, Xinyu Xing

专题命中 安全训练 :alignment(abstract);RLHF(abstract);jailbreak(abstract);分类 cs.AI

Comments published at USENIX Security 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16325 2024-12-24 cs.AI cs.CR 77%

Towards Safe and Honest AI Agents with Neural Self-Other Overlap

Marc Carauleanu, Michael Vaiana, Judd Rosenblatt, Cameron Berg, Diogo Schwerz de Lucena

专题命中 安全训练 :safety(abstract);trustworthy(abstract);AI safety(abstract);分类 cs.AI

Comments NeurIPS 2024 Safe Generative AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13886 2024-10-23 cs.CR cs.LG 77%

Refusal-Trained LLMs Are Easily Jailbroken As Browser Agents

Priyanshu Kumar, Elaine Lau, Saranya Vijayakumar, Tu Trinh, Scale Red Team, Elaine Chang, Vaughn Robinson, Sean Hendryx, Shuyan Zhou, Matt Fredrikson, Summer Yue, Zifan Wang

专题命中 安全训练 :safety(abstract);jailbreak(abstract);red teaming(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.09181 2024-10-15 cs.CR cs.AI cs.CL cs.CY cs.LG 77%

Can a large language model be a gaslighter?

Wei Li, Luyao Zhu, Yang Song, Ruixi Lin, Rui Mao, Yang You

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

Comments 10/26 (Main Body/Total), 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06463 2024-03-27 cs.CL 77%

GPT-4 Is Too Smart To Be Safe: Stealthy Chat with LLMs via Cipher

Youliang Yuan, Wenxiang Jiao, Wenxuan Wang, Jen-tse Huang, Pinjia He, Shuming Shi, Zhaopeng Tu

专题命中 安全训练 :alignment(abstract);safety(abstract);red teaming(abstract);分类 cs.CL

Comments Accepted by ICLR 2024. 21 pages, 3 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11816 2026-08-13 cs.CR cs.AI cs.CL 新提交 76%

How China-Origin Vision-Language Models Move from Refusal to Reframing in State Alignment

中国起源的多模态视觉语言模型如何在状态对齐中从拒绝转向重构

Guang Yang, Fengchen Liu, Alex Wang, Homa Hosseinmardi, Amir Ghasemian

专题命中 安全训练 :alignment(title);分类 cs.CL、cs.AI

AI总结 该研究构建基准测试9个视觉语言模型,发现中国起源模型更易进行状态对齐重构,且审查从可见的拒绝转向不可见的重构,这对人机交互存在影响。

Comments 41 pages, 31 figures, 9 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09262 2026-07-13 cs.CY cs.AI 新提交 76%

Geopolitical alignment: Endorsement effects in large language models

地缘政治倾向:大语言模型中的背书效应

Maxim Chupilkin

机构 * Department of Politics and International Relations, University of Oxford(政治与国际关系系,牛津大学)

专题命中 安全训练 :alignment(title);分类 cs.AI、cs.CY

AI总结 研究大语言模型政策评估是否受地缘政治线索影响,通过背书实验让四个模型评估相同政策,发现模型评分受背书者身份影响,西方背书被视为可信度线索,中国和俄罗斯背书被视为其他风险线索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24596 2026-06-15 eess.AS cs.AI cs.CL 版本更新 76%

X-OPD: Cross-Modal On-Policy Distillation for Capability Alignment in Speech LLMs

X-OPD:面向语音大语言模型能力对齐的跨模态在策略蒸馏

Di Cao, Dongjie Fu, Hai Yu, Siqi Zheng, Xu Tan, Tao Jin

机构 * Tencent Hunyuan(腾讯文心) Zhejiang University(浙江大学)

专题命中 安全训练 :alignment(title);分类 cs.CL、cs.AI

AI总结 提出X-OPD框架,通过跨模态在策略蒸馏对齐语音LLM与文本LLM的能力,利用文本教师模型评估语音模型的轨迹并提供令牌级反馈,显著缩小复杂任务性能差距。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15853 2026-04-28 cs.CL cs.AI 76%

A Lightweight Explainable Guardrail for Prompt Safety

一种轻量级可解释的提示安全守护栏

Md Asiful Islam, Mihai Surdeanu

专题命中 安全训练 :safety(title);分类 cs.CL、cs.AI

AI总结 本文提出了一种轻量级可解释守护栏(LEG)方法,通过多任务学习架构联合学习提示分类器和解释分类器,利用合成解释数据训练,采用新颖策略对抗LLM确认偏见,结合交叉熵和焦点损失实现全局解释信号的弱监督学习,实现优于现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07315 2026-03-10 cs.AI cs.LG 76%

Shutdown Safety Valves for Advanced AI

为先进人工智能设计的断电安全阀

Vincent Conitzer

机构 * Foundations of Cooperative AI Lab(合作人工智能基础实验室) Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全训练 :safety(title);分类 cs.AI、cs.LG

AI总结 本文提出为先进人工智能设计断电安全阀,使其具备被关闭的目标,以应对AI不可关机的潜在风险。

Journal ref In Proceedings of the Second Conference of the International Association for Safe and Ethical Artificial Intelligence (IASEAI'26), Paris, France, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17563 2026-01-27 cs.LG cs.AI 76%

Towards Generalisable Imitation Learning Through Conditioned Transition Estimation and Online Behaviour Alignment

通过条件转移估计和在线行为对齐实现通用模仿学习

Nathan Gavenski, Matteo Leonetti, Odinaldo Rodrigues

机构 * King's College London(伦敦国王学院)

专题命中 安全训练 :alignment(title);分类 cs.AI、cs.LG

AI总结 本文提出UfO方法,通过条件转移估计和在线行为对齐,实现无监督模仿学习,提升模型在未见场景中的泛化能力。

Comments The 25th International Conference on Autonomous Agents and Multi-Agent Systems (AAMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14968 2025-10-17 cs.RO cs.AI cs.CV cs.LG cs.SY eess.SY 76%

RDD: Retrieval-Based Demonstration Decomposer for Planner Alignment in Long-Horizon Tasks

Mingxuan Yan, Yuping Wang, Zechun Liu, Jiachen Li

机构 * University of California, Riverside(加州大学河滨分校) University of Michigan(密歇根大学) Meta AI

专题命中 安全训练 :alignment(title);分类 cs.AI、cs.LG

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025); Project Website: rdd-neurips.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05455 2025-07-10 cs.CL cs.AI 76%

ModelCitizens: Representing Community Voices in Online Safety

Ashima Suvarna, Christina Chance, Karolina Naranjo, Hamid Palangi, Sophie Hao, Thomas Hartvigsen, Saadia Gabriel

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Virginia(弗吉尼亚大学) Google(谷歌) New York University(纽约大学)

专题命中 安全训练 :safety(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11681 2025-05-15 cs.AI cs.LG 76%

PSPO*: An Effective Process-supervised Policy Optimization for Reasoning Alignment

Jiawei Li, Xinyue Liang, Junlong Zhang, Yizhe Yang, Chong Feng, Yang Gao

机构 * School of Computer Science and Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学)

专题命中 安全训练 :alignment(title);分类 cs.AI、cs.LG

Comments Our code can be found at https://github.com/DIRECT-BIT/PSPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01741 2024-02-20 cs.CL cs.AI 76%

Development and Testing of a Novel Large Language Model-Based Clinical Decision Support Systems for Medication Safety in 12 Clinical Specialties

Jasmine Chiat Ling Ong, Liyuan Jin, Kabilan Elangovan, Gilbert Yong San Lim, Daniel Yan Zheng Lim, Gerald Gui Ren Sng, Yuhe Ke, Joshua Yi Min Tung, Ryan Jian Zhong, Christopher Ming Yao Koh, Keane Zhi Hao Lee, Xiang Chen, Jack Kian Chng, Aung Than, Ken Junyang Goh, Daniel Shu Wei Ting

专题命中 安全训练 :safety(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.08073 2022-12-19 cs.CL cs.AI 76%

Constitutional AI: Harmlessness from AI Feedback

Yuntao Bai, Saurav Kadavath, Sandipan Kundu, Amanda Askell, Jackson Kernion, Andy Jones, Anna Chen, Anna Goldie, Azalia Mirhoseini, Cameron McKinnon, Carol Chen, Catherine Olsson, Christopher Olah, Danny Hernandez, Dawn Drain, Deep Ganguli, Dustin Li, Eli Tran-Johnson, Ethan Perez, Jamie Kerr, Jared Mueller, Jeffrey Ladish, Joshua Landau, Kamal Ndousse, Kamile Lukosuite, Liane Lovitt, Michael Sellitto, Nelson Elhage, Nicholas Schiefer, Noemi Mercado, Nova DasSarma, Robert Lasenby, Robin Larson, Sam Ringer, Scott Johnston, Shauna Kravec, Sheer El Showk, Stanislav Fort, Tamera Lanham, Timothy Telleen-Lawton, Tom Conerly, Tom Henighan, Tristan Hume, Samuel R. Bowman, Zac Hatfield-Dodds, Ben Mann, Dario Amodei, Nicholas Joseph, Sam McCandlish, Tom Brown, Jared Kaplan

专题命中 安全训练 :harmlessness(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏