arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-19 至 2026-03-19 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 3 篇

2603.17372 2026-03-19 cs.CV cs.AI 85%

Understanding and Defending VLM Jailbreaks via Jailbreak-Related Representation Shift

通过与劫持相关的表示转移理解并防御VLM劫持

Zhihua Wei, Qiang Li, Jian Ruan, Zhenxin Qin, Leilei Wen, Dongrui Liu, Wen Shen

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文研究VLM在视觉模态整合后安全对齐减弱的问题,发现劫持样本在表示空间中形成独特状态,提出通过移除劫持相关转移提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17123 2026-03-19 cs.CR cs.AI 57%

Security Assessment and Mitigation Strategies for Large Language Models: A Comprehensive Defensive Framework

大型语言模型的安全性评估与缓解策略:一种全面的防御框架

Taiwo Onitiju, Iman Vakilinia

机构 * School of Computing University of North Florida(北弗罗里达大学计算学院)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文评估了大型语言模型在关键基础设施中的安全风险,提出了一种标准化的评估框架和多层次防御系统,通过测试五种主流模型对1万多个对抗性提示的响应,揭示了安全差异,并开发了高准确率的防御框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17459 2026-03-19 cs.RO 50%

P$^{3}$Nav: End-to-End Perception, Prediction and Planning for Vision-and-Language Navigation

P$^{3}$Nav: 端到端感知、预测与规划用于视觉-语言导航

Tianfu Li, Wenbo Chen, Haoxuan Xu, Xinhu Zheng, Haoang Li

机构 * HKUST(GZ)(香港科技大学(广州))

专题命中 越狱攻击 :alignment(abstract)

AI总结 P$^{3}$Nav提出端到端框架,整合感知、预测与规划,提升视觉-语言导航agent的场景理解与导航成功率,实验显示在REVERIE、R2R-CE和RxR-CE基准上取得新状态-of-the-art性能。

详情

展开后加载摘要…

URL PDF HTML 收藏