Few-Shot Truly Benign DPO Attack for Jailbreaking LLMs
少样本真正无害的DPO攻击用于对抗LLMs
机构 * Yonsei University(延世大学)
专题命中 偏好对齐 :DPO(title,title_cn);alignment(abstract);safety(abstract);分类 cs.AI
AI总结 研究提出一种利用10对无害偏好对的真正无害DPO攻击,通过优化模型偏好来减少拒绝行为,从而在对抗LLMs时取得高成功率。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
少样本真正无害的DPO攻击用于对抗LLMs
机构 * Yonsei University(延世大学)
专题命中 偏好对齐 :DPO(title,title_cn);alignment(abstract);safety(abstract);分类 cs.AI
AI总结 研究提出一种利用10对无害偏好对的真正无害DPO攻击,通过优化模型偏好来减少拒绝行为,从而在对抗LLMs时取得高成功率。
安全对齐作为持续学习:通过正交梯度投影缓解对齐税
机构 * School of Life Sciences, IDG/McGovern Institute for Brain Research(生命科学学院,IDG/麦戈文脑科学研究所) ; Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center(计算机科学与技术系,人工智能研究所,清华大学-博世联合机器学习中心,THBI实验室,BNRist中心) ; Tsinghua University, Beijing, China(清华大学,北京,中国)
专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);DPO(abstract,abstract_cn);分类 cs.CL、cs.LG
AI总结 本文通过持续学习视角研究安全对齐与通用能力退化之间的权衡,提出OGPSA方法通过正交梯度投影提升安全性和实用性,实验显示在不同训练流程中显著改善安全-效用权衡。
BSO:安全对齐是密度比匹配
机构 * Hanoi University of Science and Technology(河内科学技术大学) ; Deakin University(德金大学) ; Max Planck Research School for Intelligent Systems(马克斯·普朗克智能系统研究学校) ; VinUniversity(文大学) ; Monash University(墨尔本大学)
专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出BSO方法,通过密度比匹配实现安全对齐,简化了安全对齐流程,无需辅助模型,且能提升安全与有用性之间的权衡。
利用RAG实现无需训练的LLM对齐
机构 * Leidos(莱迪奥斯公司)
专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出RAG-Pref算法,通过对比信息提升对抗攻击拒绝能力,相比其他方法在五种主流LLM上提升3.7倍,同时保持计算效率。
Comments 19 pages, 4 figures, and 6 tables
StoicLLM:在小型语言模型中通过偏好优化实现哲学对齐
机构 * Tufts University(塔夫茨大学) ; Bose Corporation(博世公司)
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL
AI总结 研究通过偏好优化方法对小型语言模型进行微数据集训练,实现对斯多葛主义内在美德的强对齐,但发现模型在处理斯多葛主义外在义务时存在代表性限制。
HSUGA:基于层次语义理解与群体感知对齐的LLM增强推荐
专题命中 偏好对齐 :alignment(title,abstract)
AI总结 HSUGA通过引入层次语义理解和群体感知对齐模块,解决LLM增强推荐中用户语义嵌入提取与利用的可靠性与适应性问题,提升推荐性能。
Comments Accepted by ACL 2026 Findings
语义奖励崩溃与自适应AI系统中知识完整性保护
机构 * BDB Labs / BagelTech(BDB实验室/BagelTech)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);safety(abstract);分类 cs.AI
AI总结 研究探讨了自适应AI系统中语义奖励崩溃问题,指出其导致知识完整性受损,并提出宪法奖励分层框架以保护不同知识属性。
Comments 15 pages including references. Position and framework paper. Companion empirical work available at arXiv:2604.17587
通过失败轨迹实现的在线自我进化以实现代理安全对齐
机构 * National University of Singapore(新加坡国立大学)
专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI
AI总结 本文提出FATE框架,通过将验证者评分的失败轨迹转化为修复监督,结合Pareto-Front Policy Optimization方法,提升代理安全性同时保持有用行为,实验显示在不同模型和规模上均有效。
SafeSteer: 多模态大语言模型中的解码级防御机制
机构 * Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学) ; Kuaishou Technology(快手科技) ; School of Computer Science and Technology, Beihang University(北航计算机科学与技术学院) ; Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; Chongqing University(重庆大学) ; Wuhan University(武汉大学)
专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);harmlessness(abstract)
AI总结 本文提出SafeSteer,通过解码阶段的轻量探针和模态语义对齐向量,提升多模态大语言模型的安全性,实验表明其能提升33.40%的安全性而不需微调。
鲁棒策略优化以防止灾难性遗忘
机构 * University of Pennsylvania(宾夕法尼亚大学) ; University of Southern California(南加州大学)
专题命中 安全训练 :RLHF(abstract,abstract_cn);safety(abstract);分类 cs.LG
AI总结 本文提出FRPO框架,通过优化当前策略及下游适应可达的KL限制邻域内策略,提升鲁棒性,减少安全性能退化,同时保持下游任务表现。
一念之差:多轮对话中针对隐藏恶意意图的响应感知防御
机构 * Georgia Institute of Technology(佐治亚理工学院) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; UCSD(加州大学圣地亚哥分校) ; National Taiwan University(台湾大学) ; IBM Research(IBM研究院) ; Virtue AI
专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 本文提出TurnGate,通过检测最早使交互达到有害行为阈值的轮次,提升多轮对话中恶意意图检测效果,同时保持低拒绝率。
Comments Project Website: https://turn-gate.github.io/
序列行为水印用于LLM代理
机构 * Department of Computer Science(计算机科学系)
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 本文提出SeqWM,通过在历史条件下的转移模式中嵌入信号,实现对代理轨迹的无位置验证,提升水印鲁棒性与检测可靠性。
Comments 17 pages, 3 figures, preprint
基于指针知识图谱的项目级C到Rust翻译
机构 * Fudan University(复旦大学) ; Nanyang Technological University(南洋理工大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 本文提出基于指针知识图谱的项目级C到Rust翻译方法PtrTrans,通过增强代码依赖图的指针语义,提升生成Rust代码的安全性和正确性,实验表明其在安全性与功能性上均优于现有方法。
Comments Accepted by FSE'26
社会福利在异质时间偏好下的研究
专题命中 安全训练 :alignment(abstract)
AI总结 本文研究了在异质时间偏好下,如何通过社会福利最大化来制定最优策略,展示了即使所有主体获得相同奖励,最优策略也不再是位置性的,但策略结构仍保持简单。
Comments 14 pages including appendices, Accepted to IJCAI 2026
解释情境感知的人类偏好以实现多目标机器人导航
机构 * Hochschule Bonn-Rhein-Sieg, Germany(波恩-莱茵-锡格应用科学大学,德国) ; University of Bonn, Germany(波恩大学,德国) ; Lamarr Institute for Machine Learning and Artificial Intelligence, Germany(拉马尔机器学习与人工智能研究所,德国)
专题命中 安全训练 :safety(abstract)
AI总结 本文提出一种结合基础模型与多目标强化学习政策的框架,使机器人能理解并应用情境依赖的导航偏好,提升在共享人类环境中的适应性、透明性和可用性。
MT-JailBench: 一个多模块的多轮 jailbreak 攻击评估基准
机构 * International Computer Science Institute(国际计算机科学研究所) ; Berkeley Lab(伯克利实验室)
专题命中 越狱攻击 :jailbreak(title,title_cn);分类 cs.AI
AI总结 本文提出 MT-JailBench,一个用于评估多轮 jailbreak 攻击的模块化框架,揭示了资源预算和评估函数对攻击效果的影响,发现提示生成是性能变化的主要因素,而动态策略生成并非必要。
RACC:面向LLM安全测试的表示感知覆盖标准
机构 * Peking University(北京大学)
专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出RACC,一种专为LLM安全测试设计的覆盖标准,通过提取安全表示并评估测试提示的激活情况,有效提升测试套件质量,同时对冗余输入不敏感,适用于大规模神经网络的安全测试。
通过前缀共享KV缓存加速后缀劫持攻击
机构 * King Abdullah University of Science and Technology(卡塔尔国王阿卜杜勒阿齐兹大学) ; Zhejiang University(浙江大学)
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI
AI总结 本文提出PSKV技术,通过共享前缀KV缓存减少后缀劫持攻击的计算开销,实验表明在五种广泛部署的LLM上,PSKV将推理时间减少40%,峰值内存使用减少50%。
Comments 27 pages, 7 figures, preprint
授权-执行间隙是开放世界智能体中的主要安全和安全问题
机构 * Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) ; Nanjing University of Posts and Telecommunications, China(南京邮电大学) ; University of Oxford, UK(牛津大学) ; Chinese University of Hong Kong, China(香港中文大学) ; State University of New York at Buffalo, USA(纽约州立大学布法罗分校)
专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI
AI总结 本文指出开放世界智能体中授权-执行间隙(AEG)是安全和安全的关键问题,其源于授权意图与实际执行的差异,需通过源导向的诊断和防御来解决,强调执行中需进行授权完整性检查。
通过对比对偶搜索进行定向神经元调节
机构 * Nous Research(Nous研究)
专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);alignment(abstract);分类 cs.LG
AI总结 研究通过对比神经元属性识别有害与良性提示的区分神经元,实现无梯度的神经元干预,有效降低拒绝率并保持输出流畅性,展示了神经层面干预在行为引导中的优势。
隐喻并非注意力所需全部
机构 * Sapienza University of Rome Department of Computer, Control and Management Engineering(罗马大学Sapienza计算机、控制与管理工程系) ; DEXAI – Icaro Lab(DEXAI – Icaro实验室) ; University of Rome Tor Vergata(罗马大学Tor Vergata) ; Sant’Anna School of Advanced Studies(Sant’Anna高级研究学校)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.CY
AI总结 本文研究文学式绕过策略为何有效,发现其效果源于风格不规则性而非对文学格式的识别失败,表明安全机制需考虑风格变化对模型行为的影响。
单条消息能否瘫痪AI基础设施?通过针对性Mobius注入的AbO-DDoS攻击崛起
机构 * The Hong Kong Polytechnic University(香港理工大学) ; HKUST (GZ)(香港科技大学(广州))
专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
AI总结 研究揭示了通过Mobius注入攻击利用代理逻辑中的语义闭合漏洞,实现对AI基础设施的隐蔽攻击,展示了攻击的轻量、隐蔽性和高配置性,并提出基于组件能量分析的防御机制。
基于身份的对抗提示:多身份红队测试用于对抗发现与缓解
机构 * IBM Research(IBM研究院) ; Trinity College Dublin(都柏林大学)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.LG
AI总结 本文提出PCAP方法,通过多身份对抗搜索发现真实攻击场景,提升模型鲁棒性,生成多样化防御数据集。
通过上下文经验回放和语义保留提示重写对文本到图像模型进行红队测试
机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全中心) ; IBM Research(IBM 研究院) ; National Yang Ming Chiao Tung University(国立阳明交通大学)
专题命中 越狱攻击 :safety(abstract);分类 cs.CL、cs.LG
AI总结 本文提出ICER框架,通过提示重写和上下文经验回放生成流畅的对抗性提示,有效提升图像生成模型的安全性测试能力,实验表明其在多个安全机制上优于现有方法。
Comments The source code is available at https://github.com/zhiyichin/ICER
AI代理技能的行为完整性验证
机构 * Palo Alto Networks(帕洛阿尔托网络)
专题命中 越狱攻击 :safety(abstract);分类 cs.AI
AI总结 本文提出行为完整性验证(BIV)方法,通过类型集比较验证AI代理技能声明与实际能力的一致性,发现80%的技能存在描述与实现差距,并在恶意技能检测中取得高F1值。
FragBench:隐藏在看似无害片段中的跨会话攻击
机构 * New York University(纽约大学) ; Tufts University(塔夫茨大学) ; Distributed Systems(分布式系统) ; ERA(欧洲研究联盟) ; Lida Safety(Lida安全) ; Mila
专题命中 越狱攻击 :safety(abstract);分类 cs.AI
AI总结 FragBench通过24个真实网络攻击案例构建,评估LLM跨会话攻击检测,采用对抗重写和图基检测方法,实现事件级F1分数达0.88-0.96。
Comments preprint of submission
FlowSteer:仅凭提示的流程引导揭示多智能体LLM系统的规划时间漏洞
专题命中 越狱攻击 :safety(abstract)
AI总结 研究通过社会影响探测工作流识别高影响子任务,揭示恶意信号传播漏洞,提出FlowSteer攻击方法提升恶意成功率,并引入FlowGuard防御机制降低攻击效果。
IPI-proxy:一种用于对抗间接提示注入的拦截代理
机构 * Vulcan Research, AIFT(火山研究,AIFT)
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI
AI总结 本文提出IPI-proxy,一种开源工具,用于针对间接提示注入攻击的网络浏览AI代理进行红队测试。通过拦截代理重写白名单域的HTTP响应,嵌入攻击负载,支持多种嵌入技术与插入点,实现参数扫描评估。
Comments code: https://github.com/VulcanLab/IPI-Proxy/
智能体应取代窄预测AI作为6G AI-RAN的协调者
专题命中 提示注入 :alignment(abstract);prompt injection(abstract)
AI总结 本文主张为实现Level 5自主6G网络,AI-RAN应从碎片化的窄预测模型转向多模态大语言模型作为核心推理智能体,通过提升LLM作为认知操作系统,动态翻译人类意图并自主诊断网络异常。
代理安全中的粒度不匹配:论证层面的溯源解决了执行问题并隔离了LLM推理瓶颈
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院 Gallagher 学院) ; King Abdullah University of Science and Technology(国王 Abdullah 科学技术大学) ; Dongbei University of Finance and Economics(东北财经大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 本文提出PACT框架,通过论证层面的溯源解决代理安全中的粒度不匹配问题,隔离LLM推理瓶颈,提升安全性和实用性。