arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-29 至 2026-04-29 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 5 篇

2604.25716 2026-04-29 cs.CL cs.AI 91%

Cross-Lingual Jailbreak Detection via Semantic Codebooks

通过语义代码本进行跨语言 jailbreak 检测

Shirin Alanova, Bogdan Minko, Sabrina Sadiekh, Evgeniy Kokuykin

机构 * AI Talent Hub, ITMO University(AI人才中心、ITMO大学)

专题命中 越狱攻击 :jailbreak(title,title_cn);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文研究通过语言无关的语义相似性检测跨语言 jailbreak 攻击,评估了四种语言、两种翻译流程、三种嵌入模型和三种目标 LLM 的效果,发现语义相似性在标准基准上表现良好,但在分布偏移情况下性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25102 2026-04-29 cs.CV 87%

One Perturbation, Two Failure Modes: Probing VLM Safety via Embedding-Guided Typographic Perturbations

一个扰动,两种失效模式:通过嵌入引导的字形扰动探测VLM安全性

Ravikumar Balakrishnan, Sanket Mendapara

机构 * Cisco Systems(思科系统)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);red teaming(abstract);prompt injection(abstract)

AI总结 本文通过实证研究揭示多模态嵌入距离对VLM攻击成功率的预测作用,并提出基于嵌入引导的字形扰动方法,验证了可读性与安全对齐的交互影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24983 2026-04-29 cs.AI 57%

Adaptive Prompt Embedding Optimization for LLM Jailbreaking

适应性提示嵌入优化用于大语言模型劫持

Miles Q. Li, Benjamin C. M. Fung, Boyang Li, Radin Hamidi Rad, Ebrahim Bagheri

机构 * School of Information Studies, McGill University, Montreal, QC, Canada(麦吉尔大学信息研究学院) Department of Computer Science, Kean University, Union, NJ, United States(凯恩大学计算机科学系) Mila - Quebec AI Institute, Montreal, QC, Canada(魁北克人工智能研究所) Faculty of Information, University of Toronto, Toronto, ON, Canada(多伦多大学信息学院)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 本文提出PEO方法,通过优化原始提示嵌入而非附加对抗性标记,实现更有效的白盒劫持,实验显示其在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24790 2026-04-29 cs.CR cs.AI 57%

Semantic Denial of Service in LLM-controlled robots

语义拒绝服务在LLM控制的机器人中

Jonathan Steinberg, Oren Gal

机构 * Swarms & AI Lab (SAIL) University of Haifa(群集与人工智能实验室(SAIL)海法大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文研究了LLM控制机器人中语义拒绝服务攻击,发现通过注入安全可信的短语可触发安全推理中断,提出防御策略需平衡攻击抑制与真实危险响应,强调系统架构而非提示级别的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15384 2026-04-29 cs.CR cs.AI cs.SE 57%

LinuxArena: A Control Setting for AI Agents in Live Production Software Environments

LinuxArena:AI代理在实时生产软件环境中的控制设置

Tyler Tracy, Ram Potham, Nick Kuhn, Myles Heller, Anshul Khandelwal, Cody Rushing, Henri Lemoine, Miguel Brandao, Tomas Turlik, Adam Hanson, Josh Hills, Amy Ngo, Ram Rachum, Nik Mitchell, Falko Galperin, Oscar Sykes, Pip Arnott, Samuel Prieto Lima, Carlos Giudice, Matt Goldwater, Daniel Popp, Drew de Wet, Ruben Castaing, Qi Guo, Douw Marx, Benjamin Shaffrey, Justin Shenk, Martin Milbradt, Hannah Meagher, Shaheen Ahmed-Chowdhury, Daniel O'Connell, Chris Canal, Buck Shlegeris, Aryan Bhatt

机构 * Redwood Research EquiStamp Senior Authors

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 LinuxArena是首个大规模多服务生产环境控制设置,包含20个环境、1671个合法任务和184个安全失败任务,用于评估AI代理在实时环境中的控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏