arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3248 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3248 篇

2607.01859 2026-07-03 cs.AI cs.CL 新提交 84%

Safety Targeted Embedding Exploit via Refinement

通过精炼的安全目标嵌入利用

Joshua Adrian Cahyono

机构 * Nanyang Technological University(南洋理工大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出STEER方法,通过梯度引导攻击识别并翻译关键词语到低资源语言,抑制大语言模型拒绝行为,在多个模型上实现高达96.7%的攻击成功率,揭示安全机制在多语言输入下的泛化缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22841 2026-06-23 cs.CL cs.LG 新提交 84%

IndicGuard: A Multilingual Safety Guard Model and Dataset for Indic Languages

IndicGuard:面向印度语言的多语言安全防护模型与数据集

Parth Bramhecha, Smit Deshmukh, Sairaj Bodhale, Adwait Borate, Raviraj Joshi

机构 * L3Cube-Labs, Pune(L3Cube实验室,浦那)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.LG

AI总结 提出IndicGuard,一个针对10种印度主要语言的多语言安全数据集和基于Gemma-3-4B-IT微调的4B参数安全防护模型,在内容审核和跨语言泛化上优于现有基线CultureGuard。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10310 2026-06-23 cs.AI cs.CY cs.HC q-bio.NC 版本更新 84%

Positive Alignment: Artificial Intelligence for Human Flourishing

积极对齐:人工智能促进人类繁荣

Ruben Laukkonen, Seb Krier, Chloé Bakalar, Shamil Chandaria, Morten Kringelbach, Adam Elwood, Daniel Ford, Fernando Rosas, Maty Bohacek, Matija Franklin, Nenad Tomašev, Stephanie Chan, Verena Rieser, Roma Patel, Michael Levin, Arun Rao

机构 * Department of Psychiatry, University of Oxford(牛津大学精神病学系) Flourishing Intelligence Program, Centre for Eudaimonia and Human Flourishing, Linacre College, University of Oxford(牛津大学幸福智能计划、幸福与人类繁荣中心、林acre学院) Google DeepMind(谷歌DeepMind) LIFE OpenAI Anthropic University of California, Los Angeles(加州大学洛杉矶分校) Aily Labs(Aily实验室) Stanford University(斯坦福大学) Tufts University(塔夫茨大学) Positive AI Labs(积极AI实验室) Department of Informatics, University of Sussex(Sussex大学信息学系) Department of Brain Sciences, Imperial College London(伦敦帝国理工学院脑科学系)

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出积极对齐,旨在通过支持人类和生态繁荣,同时确保安全与合作,推动AI发展。研究指出传统对齐关注安全,而积极对齐强调促进人类福祉,提出多项技术挑战与设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04051 2026-06-04 cs.LG cs.AI cs.CR 84%

RUBAS: Rubric-Based Reinforcement Learning for Agent Safety

RUBAS: 基于评分标准的强化学习用于智能体安全

Xian Qi Loye, Qinglin Su, Zhexin Zhang, Shiyao Cui, Qi Zhu, Fei Mi, Hongning Wang, Minlie Huang

机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华大学对话人工智能(CoAI)组,DCST,清华大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出RUBAS框架,通过将智能体行为分解为四个维度的评分标准提供细粒度奖励,利用强化学习在保证任务完成的同时提升工具使用安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04035 2026-06-04 cs.SE cs.AI cs.LG 84%

Unpredictable Safety: Domain-Dependent Compliance and the Transparency Gap in Open-Weight LLMs

不可预测的安全性:开放权重大语言模型中领域依赖的合规性与透明度差距

Zacharie Bugaud

机构 * Astera Institute(Astera研究院)

专题命中 安全训练 :safety(title,abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 通过7个伦理领域的标准化实验,发现开放权重大语言模型的合规率在14.7%到85.7%之间波动,且同一模型在不同领域表现高度不一致,揭示了安全机制缺乏透明度和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24583 2026-06-02 cs.LG cs.CL stat.ML 84%

Measuring Alignment-Induced Activation Shifts Correctly: A Template-Controlled Difference-in-Differences Protocol

正确测量对齐引起的激活偏移:一种模板控制的双重差分协议

Yuki Nakamura

机构 * The Open University of Japan(日本开放大学)

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 针对对齐前后模型内部激活比较中存在的聊天模板混淆问题,提出模板控制的双重差分协议,有效分离对齐偏移与格式效应,恢复拒绝方向并提升余弦对齐度。

Comments 11 pages, 1 figure. v3: substantially revised and reframed as a measurement-methodology paper. Code, data, and an immutable Zenodo archive are available at https://github.com/Nakammura/effective-rank-audit (DOI: 10.5281/zenodo.20341444)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17546 2026-05-12 cs.CL cs.LG 84%

Learning to Stay Safe: Adaptive Regularization Against Safety Degradation during Fine-Tuning

学习保持安全:在微调过程中对抗安全退化的一种自适应正则化方法

Jyotin Goel, Souvik Maji, Pratik Mazumder

机构 * Indian Institute of Technology Jodhpur(印度理工学院乔浦尔)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种自适应正则化框架,通过评估安全风险来维持模型在微调过程中的安全性,实验表明该方法能有效降低攻击成功率并保持下游性能。

Comments Work in progress (48 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05995 2026-05-11 cs.CR cs.AI cs.CL 84%

Safety Anchor: Defending Harmful Fine-tuning via Geometric Bottlenecks

安全锚:通过几何瓶颈防御有害微调

Guoxin Lu, Letian Sha, Qing Wang, Peijie Sun, Hao Zhou, Hua Dai, Fu Xiao

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出安全瓶颈正则化(SBR),通过几何瓶颈层限制有害查询的隐藏状态,以对抗有害微调攻击,实验表明单个安全锚即可显著降低有害分数。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23210 2026-04-28 cs.AI cs.CL 84%

Discovering Agentic Safety Specifications from 1-Bit Danger Signals

从1位危险信号中发现代理安全规范

Víctor Gallego

机构 * Komorebi AI

专题命中 安全训练 :safety(title,abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EPO-Safe框架,通过经验优化使LLM在仅接收二进制危险信号的情况下发现安全规范,展示LLM能在贫乏信号中进行安全推理,并验证了安全反思需配合专用安全通道以避免奖励黑客问题。

Comments Accepted to the Adaptive and Learning Agents Workshop (ALA 2026) @ AAMAS 2026. Code is available at github.com/vicgalle/experiential-prompt-optimization-safe

Journal ref Proc. of the Adaptive and Learning Agents Workshop (ALA 2026) @ AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15625 2026-03-31 eess.SY cs.AI cs.CL cs.SY 84%

CBF-LLM: Safe Control for LLM Alignment

CBF-LLM:安全控制用于大语言模型对齐

Yuya Miyaoka, Masaki Inoue

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于控制的对齐框架,利用控制屏障函数确保用户期望的文本生成,通过安全过滤器减少对齐任务的干预次数。

Journal ref IEEE Transactions on Control Systems Technology 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02229 2026-03-04 cs.LG cs.CL 84%

Safety Training Persists Through Helpfulness Optimization in LLM Agents

在LLM代理中通过帮助性优化保持安全性训练

Benjamin Plaut

机构 * Department of Computer Science, University of California, Berkeley, USA(计算机科学系,加州大学伯克利分校)

专题命中 安全训练 :safety(title,abstract);DPO(abstract);分类 cs.CL、cs.LG

AI总结 研究通过帮助性优化在LLM代理中保持安全性训练,发现单独训练或依次训练无法找到最佳策略,但所有配置接近帕累托前沿。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22146 2026-02-26 cs.LG cs.AI 84%

Provable Last-Iterate Convergence for Multi-Objective Safe LLM Alignment via Optimistic Primal-Dual

多目标安全大语言模型对齐的可证明最终迭代收敛性:基于乐观对偶算法

Yining Li, Peizhong Ju, Ness Shroff

专题命中 安全训练 :alignment(title,abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种乐观对偶算法,用于多目标安全大语言模型对齐,解决了传统方法在最终迭代中的不稳定问题,并证明了该算法的收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26752 2026-02-23 cs.AI cs.LG 84%

The Oversight Game: Learning to Cooperatively Balance an AI Agent's Safety and Autonomy

视角游戏:学习协作平衡AI代理的安全性与自主性

William Overman, Mohsen Bayati

机构 * Graduate School of Business(商学院) Stanford University(斯坦福大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种视角游戏框架,通过马尔可夫游戏模型平衡AI代理的安全性与自主性,减少开放环境中的安全违规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01685 2026-02-03 cs.LG cs.AI 84%

Semantic-aware Wasserstein Policy Regularization for Large Language Model Alignment

语义感知的Wasserstein策略正则化用于大语言模型对齐

Byeonghu Na, Hyungho Na, Yeongmin Kim, Suhyeon Jo, HeeSun Bae, Mina Kang, Il-Chul Moon

专题命中 安全训练 :alignment(title,abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Wasserstein策略正则化方法,通过语义感知的Wasserstein距离改进大语言模型对齐效果,实验表明其优于传统KL散度方法。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15412 2026-01-23 cs.HC cs.AI cs.CY 84%

A Checklist for Trustworthy, Safe, and User-Friendly Mental Health Chatbots

可信、安全且用户友好的心理健康聊天机器人清单

Shreya Haran, Samiha Thatikonda, Dong Whi Yoo, Koustuv Saha

机构 * University of Illinois Urbana-Champaign, Urbana, United States(伊利诺伊大学厄巴纳-香槟分校) Indiana University Indianapolis, Indianapolis, United States(印第安纳大学印第安纳波利斯分校)

专题命中 安全训练 :trustworthy(title,abstract);safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出了一套操作清单,旨在指导开发更可信、安全且用户友好的心理健康聊天机器人,以促进伦理和有效的设计实践。

Journal ref In 28th International Conference on Human-Computer Interaction, Springer LNCS, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16444 2026-01-21 cs.AI cs.LG 84%

Domain-Specific Constitutional AI: Enhancing Safety in LLM-Powered Mental Health Chatbots

领域特定的宪法AI:增强LLM驱动的心理健康聊天机器人安全性

Chenhan Lyu, Yutong Song, Pengfei Zhang, Amir M. Rahmani

专题命中 安全训练 :safety(title,abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用领域特定心理健康原则的宪法AI训练方法,以提升心理健康聊天机器人在安全性和领域适应性方面的表现。

Comments Accepted to 2025 IEEE 21st International Conference on Body Sensor Networks (BSN)

Journal ref 2025 IEEE 21st International Conference on Body Sensor Networks (BSN), pp. 1-4

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11574 2026-01-21 cs.LG cs.AI 84%

GRADE: Replacing Policy Gradients with Backpropagation for LLM Alignment

GRADE: 用反向传播替代策略梯度以实现大语言模型对齐

Lukas Abrie Nel

机构 * Lotus Health AI(Lotus健康AI)

专题命中 安全训练 :alignment(title,abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 GRADE通过可微松弛的离散令牌采样过程替代策略梯度,实现大语言模型对齐的更稳定和高效方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07200 2026-01-13 cs.LG cs.AI 84%

Safeguarding LLM Fine-tuning via Push-Pull Distributional Alignment

通过推拉分布对齐保障大语言模型微调安全

Haozhong Wang, Zhuo Li, Yibo Yang, He Zhao, Hongyuan Zha, Dandan Guo

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 SOT通过推拉分布对齐机制提升大语言模型微调的安全性与效用平衡

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11222 2025-12-08 cs.SE cs.AI cs.CL cs.IR 84%

ORFuzz: Fuzzing the "Other Side" of LLM Safety -- Testing Over-Refusal

ORFuzz: 测试LLM安全的'另一面' -- 检测过度拒绝

Haonan Zhang, Dongxia Wang, Yi Liu, Kexin Chen, Jiashui Wang, Xinlei Ying, Long Liu, Wenhai Wang

机构 * Zhejiang University(浙江大学) Zhejiang University Huzhou Institute of Industrial Control Technology(浙江大学湖州工业控制技术研究所)

专题命中 安全训练 :safety(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 ORFuzz通过进化测试框架系统检测LLM的过度拒绝现象,生成高覆盖率的测试用例并建立新基准,提升LLM安全性。

Comments Accepted by ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12398 2025-11-27 cs.CR cs.AI cs.CL 84%

Where to Start Alignment? Diffusion Large Language Model May Demand a Distinct Position

对齐何处开始?扩散大语言模型可能需要不同的位置

Zhixin Xie, Xurui Song, Jun Luo

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MOSA方法,通过强化学习对齐dLLM中间生成与安全拒绝,提升安全性。

Comments Accepted for oral presentation at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12497 2025-11-18 cs.CL cs.AI cs.CR 84%

SGuard-v1: Safety Guardrail for Large Language Models

JoonHo Lee, HyeonMin Cho, Jaewoong Yun, Hyunjae Lee, JunKyu Lee, Juree Seok

专题命中 安全训练 :safety(title,abstract);AI safety(abstract);分类 cs.CL、cs.AI

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01903 2025-11-12 cs.CL cs.AI 84%

STAR-1: Safer Alignment of Reasoning LLMs with 1K Data

Zijun Wang, Haoqin Tu, Yuhan Wang, Juncheng Wu, Yanqing Liu, Jieru Mei, Brian R. Bartoldson, Bhavya Kailkhura, Cihang Xie

机构 * UC Santa Cruz(加州大学圣克ruz分校) Google(谷歌) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17918 2025-10-22 cs.CL cs.AI 84%

JT-Safe: Intrinsically Enhancing the Safety and Trustworthiness of LLMs

Junlan Feng, Fanyu Meng, Chong Long, Pengyu Cong, Duqing Wang, Yan Zheng, Yuyao Zhang, Xuanchang Gao, Ye Yuan, Yunfei Ma, Zhijie Ren, Fan Yang, Na Wu, Di Jin, Chao Deng

机构 * China Mobile Jiutian Research(中国移动九天研究所)

专题命中 安全训练 :safety(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17368 2025-10-14 cs.LG cs.AI cs.CR 84%

SAFEx: Analyzing Vulnerabilities of MoE-Based LLMs via Stable Safety-critical Expert Identification

Zhenglin Lai, Mengyao Liao, Bingzhe Wu, Dong Xu, Zebin Zhao, Zhihang Yuan, Chao Fan, Jianqiang Li

机构 * School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院) ByteDance Inc(字节跳动公司)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22250 2025-09-29 cs.CL cs.AI 84%

Safety Compliance: Rethinking LLM Safety Reasoning through the Lens of Compliance

Wenbin Hu, Huihao Jing, Haochen Shi, Haoran Li, Yangqiu Song

机构 * Hong Kong University of Science and Technology(香港理工大学)

专题命中 安全训练 :safety(title,abstract);AI safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19212 2025-09-24 cs.CL cs.AI 84%

Steering Multimodal Large Language Models Decoding for Context-Aware Safety

Zheyuan Liu, Zhangchen Xu, Guangyao Dou, Xiangchi Yuan, Zhaoxuan Tan, Radha Poovendran, Meng Jiang

机构 * University of Notre Dame(notre dame 大学) University of Washington(华盛顿大学) Johns Hopkins University(约翰霍普金斯大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

Comments A lightweight and model-agnostic decoding framework that dynamically adjusts token generation based on multimodal context

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04512 2025-09-08 cs.CL cs.LG 84%

Scaling behavior of large language models in emotional safety classification across sizes and tasks

Edoardo Pinzuti, Oliver Tüscher, André Ferreira Castro

机构 * Leibniz Institute for Resilience Research(莱比锡韧性研究所) University Medical Center Halle(哈雷医学院) German Center for Mental Health (DZPG)(德国心理健康中心(DZPG)) University Medical Center of the Johannes Gutenberg-University Mainz(美因茨约瑟夫·冯·拉贝大学医学院)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18862 2025-08-14 cs.LG cs.AI 84%

One-shot Optimized Steering Vectors Mediate Safety-relevant Behaviors in LLMs

Jacob Dunefsky, Arman Cohan

机构 * Department of Computer Science(计算机科学系) Yale University(耶鲁大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

Comments Published at COLM 2025. 30 pages, 7 figures. Code is available at https://github.com/jacobdunefsky/one-shot-steering-repro and https://github.com/jacobdunefsky/one-shot-steering-misalignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02079 2025-08-05 cs.LG cs.AI 84%

AlignGuard-LoRA: Alignment-Preserving Fine-Tuning via Fisher-Guided Decomposition and Riemannian-Geodesic Collision Regularization

Amitava Das, Abhilekh Borah, Vinija Jain, Aman Chadha

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08054 2025-07-16 cs.CL cs.AI 84%

FalseReject: A Resource for Improving Contextual Safety and Mitigating Over-Refusals in LLMs via Structured Reasoning

Zhehao Zhang, Weijie Xu, Fanyou Wu, Chandan K. Reddy

机构 * The Ohio State University(俄亥俄州立大学) Amazon(亚马逊)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏