arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-11 至 2026-05-11 共收录 13 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 13 篇

2605.02971 2026-05-11 cs.LG cs.AI cs.CL 90%

Multilingual Safety Alignment via Self-Distillation

通过自蒸馏实现多语言安全对齐

Ruiyang Qin, Qingzhuo Wang, Dongrui Liu, Qiang Li, Zhihua Wei, Wen Shen

机构 * Tongji University(同济大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出多语言自蒸馏框架,通过将高资源语言的安全能力迁移到低资源语言,解决多语言安全对齐问题,无需特定语言响应数据,实验表明方法在多语言安全性能上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05995 2026-05-11 cs.CR cs.AI cs.CL 84%

Safety Anchor: Defending Harmful Fine-tuning via Geometric Bottlenecks

安全锚:通过几何瓶颈防御有害微调

Guoxin Lu, Letian Sha, Qing Wang, Peijie Sun, Hao Zhou, Hua Dai, Fu Xiao

机构 * Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出安全瓶颈正则化(SBR),通过几何瓶颈层限制有害查询的隐藏状态,以对抗有害微调攻击,实验表明单个安全锚即可显著降低有害分数。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07630 2026-05-11 cs.CL cs.AI cs.LG 82%

Safe, or Simply Incapable? Rethinking Safety Evaluation for Phone-Use Agents

安全,还是仅仅无能?重新思考手机使用代理的安全性评估

Zhengyang Tang, Yi Zhang, Chenxin Li, Xin Lai, Pengyuan Lyu, Yiduo Guo, Weinong Wang, Junyi Li, Yang Ding, Huawen Shen, Zhengyao Fang, Xingran Zhou, Liang Wu, Fei Tang, Sunqi Fan, Shangpin Peng, Zheng Ruan, Anran Zhang, Benyou Wang, Chengquan Zhang, Han Hu

机构 * Tencent Hunyuan(腾讯文言) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tsinghua University(清华大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出PhoneSafety基准,通过700个关键安全时刻评估手机使用代理的安全性,发现更强的通用能力不等于更安全的选择,且无能行为更像是能力信号而非安全信号。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06992 2026-05-11 cs.LG stat.ML 79%

Why Does Agentic Safety Fail to Generalize Across Tasks?

为何代理安全无法跨任务泛化?

Yonatan Slutzky, Yotam Alexander, Tomer Slor, Yoav Nagel, Nadav Cohen

机构 * Some Institute(某些研究所)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 本文探讨了代理安全在多任务场景中泛化失败的原因,指出安全要求使任务与安全执行的关系更为复杂,通过理论和实验表明需新的方法提升安全性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07324 2026-05-11 cs.CL cs.AI cs.CR cs.LG 75%

Activation Differences Reveal Backdoors: A Comparison of SAE Architectures

激活差异揭示后门:SAE架构的比较

Sachin Kumar

机构 * LexisNexis

专题命中 安全训练 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过对比稀疏自编码器架构,探讨如何通过激活差异检测语言模型中的后门,发现Diff-SAE在后门隔离中表现优于Crosscoders,且在不同层和微调策略下均有效。

Comments Accepted at IJCNN 2026 (IEEE WCCI). ©2026 IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01569 2026-05-11 cs.AI cs.CL 73%

InvThink: Premortem Reasoning for Safer Language Models

InvThink:用于更安全语言模型的预mortem推理

Yubin Kim, Taehan Kim, Eugene Park, Chunjong Park, Cynthia Breazeal, Daniel McDuff, Hae Won Park

机构 * MIT(麻省理工学院) Google Research(谷歌研究院) Google DeepMind(谷歌DeepMind) Samsung Research(三星研究)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 InvThink通过预mortem推理框架提升语言模型安全性,通过枚举、分析和约束潜在故障来生成响应,相比现有方法在安全性和减少有害行为方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07982 2026-05-11 cs.CL cs.CR 70%

GLiGuard: Schema-Conditioned Classification for LLM Safeguard

GLiGuard:面向LLM安全的模式条件分类

Urchade Zaratiana, Mary Newhauser, George Hurn-Maloney, Ash Lewis

机构 * Qwen Team(通义实验室)

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 GLiGuard通过模式条件编码实现高效多维度内容安全评估,在参数更小的情况下达到与大模型守卫模型相当的准确率,同时提升吞吐量和降低延迟。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07883 2026-05-11 cs.CL 70%

Beyond "I cannot fulfill this request": Alleviating Rigid Rejection in LLMs via Label Enhancement

超越'我无法完成此请求':通过标签增强缓解LLM中的刚性拒绝

Ying Zhang, Congyu Qiao, Xin Geng, Ning Xu

机构 * Southeast University, Nanjing, China(东南大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出LANCE方法,通过标签增强实现安全且灵活的响应,减少LLM中的刚性拒绝问题,提升交互自然性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03327 2026-05-11 cs.LG cs.AI 62%

DGPO: Distribution Guided Policy Optimization for Fine Grained Credit Assignment

DGPO:基于分布的策略优化用于细粒度信用分配

Hongbo Jin, Rongpeng Zhu, Zhongjing Du, Xu Jiang, Jingqi Tian, Qiaoman Zhang, Jiayu Ding

机构 * Peking University(北京大学) SJTU(上海交通大学) Tsinghua University(清华大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 DGPO通过引入分布引导的策略优化框架,解决传统方法在细粒度信用分配中的不足,通过Hellinger距离和熵门机制实现安全探索与有效区分真实推理突破,提升大语言模型在复杂推理任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07462 2026-05-11 cs.CL cs.AI 62%

The Moltbook Files: A Harmless Slopocalypse or Humanity's Last Experiment

Moltbook Files:一场无害的混乱还是人类的最后实验

William Brach, Federico Torrielli, Stine Lyngsø Beltoft, Annemette Brok Pirchert, Peter Schneider-Kamp, Lukas Galke Poech

机构 * Slovak University of Technology(斯洛伐克技术大学) University of Turin(都灵大学) University of Southern Denmark(南部丹麦大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究Moltbook平台上的群体行为,通过分析232k篇帖子和2.2M条评论,发现其数据对语言模型的影响,发现微调后真实性下降,但Reddit数据集也产生类似效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07396 2026-05-11 cs.LG cs.AI 62%

Rubric-based On-policy Distillation

基于评分标准的在线蒸馏

Junfeng Fang, Zhepei Hong, Mao Zheng, Mingyang Song, Gengsheng Li, Houcheng Jiang, Dan Zhang, Haiyun Guo, Xiang Wang, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Tencent(腾讯)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ROPD框架,利用教师生成的响应而非教师日志进行在线蒸馏,实现更灵活的黑盒兼容方案,实验显示在多数场景下性能优于基于日志的蒸馏方法,样本效率提升达10倍。

Comments Preprint. Code is available at https://github.com/Peregrine123/ROPD_official

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26272 2026-05-11 cs.CV cs.LG 57%

PRPO: Paragraph-level Policy Optimization for Vision-Language Deepfake Detection

PRPO:用于视觉-语言深度伪造检测的段级策略优化

Tuan Nguyen, Naseem Khan, Khang Tran, NhatHai Phan, Issa Khalil

机构 * Qatar Computing Research Institute, Hamad Bin Khalifa University, Doha, Qatar(卡塔尔计算研究所,哈马德·本·哈利法大学,多哈) New Jersey Institute of Technology, NJ, USA(新泽西理工学院)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出PRPO算法,通过段级相对策略优化提升深度伪造检测的准确性与推理能力,实验显示其在检测准确率和推理评分上均显著优于现有方法。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23251 2026-05-11 cs.CV 50%

Structure Over Scale: Learning Visual Reasoning from Pedagogical Video

结构优先于规模:从教育视频中学习视觉推理

Bishoy Galoaa, Xiangyu Bai, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 安全训练 :alignment(abstract)

AI总结 本文提出SoSVQA基准,利用教育视频中的结构化推理轨迹提升视觉语言模型的推理能力,通过GRPO优化在少量数据下实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏