arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-14 至 2026-07-14 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 6 篇

2604.19274 2026-07-14 cs.CL 版本更新 85%

HarDBench: A Benchmark for Draft-Based Co-Authoring Jailbreak Attacks for Safe Human-LLM Collaborative Writing

HarDBench: 面向安全人机协作写作的基于草稿的合著越狱攻击基准

Euntae Kim, Soomin Han, Buru Chang

机构 * Korea University(韩国大学) Sogang University(ソガン大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL

AI总结 提出HarDBench基准,评估大语言模型在协作写作中面对恶意草稿填充的越狱攻击的鲁棒性,并通过偏好优化实现安全-效用平衡的对齐方法。

Comments ACL 2026 Main

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 40785-40831 July 2-7, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04673 2026-07-14 cs.AI 版本更新 77%

Trojan Horse Prompting: Jailbreaking Conversational Multimodal Models by Forging Assistant Message

木马提示:通过伪造助手消息来破解对话式多模态模型

Wei Duan, Li Qian

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 研究针对对话式多模态模型的安全漏洞,提出木马提示越狱技术,通过伪造对话历史绕过安全机制,在谷歌Gemini-2.0上实验显示其攻击成功率高于现有方法,揭示对话AI安全缺陷,呼吁转变验证范式。

Comments We stopped working on this idea because we realized that there was a paper submitted before it that took almost identical approach

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11070 2026-07-14 cs.CL 新提交 70%

MJ: Multi-turn LLM Jailbreaking via Decomposed Credit Assignment

MJ:通过分解信用分配实现多轮语言模型越狱

Junyoung Park, Namgyu Park, Sechan Lee, Yoon-Chan Jhi, Jihoon Cho, Sangdon Park

机构 * POSTECH GSAI(浦项科技大学全球人工智能学院) Samsung SDS(三星 SDS)

专题命中 越狱攻击 :jailbreak(abstract);red teaming(abstract);分类 cs.CL

AI总结 研究针对多轮语言模型越狱的信用分配难题,提出DC-GRPO框架,通过结合即时和未来信用为各轮次分配学习信号,经静态和动态加权规则实例化,在多模型和基准测试中显著优于现有方法,核心优势在于轮次级组相对信用分配。

Comments 29 pages. Warning: This paper contains examples of harmful content

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09787 2026-07-14 cs.CV cs.LG 新提交 61%

Adversarially Guided Diffusion for LiDAR Range Image Synthesis

用于激光雷达距离图像合成的对抗引导扩散

Stavros Bouras, Antonios Makris, Alexandros Gkillas, Aris S. Lalos, Konstantinos Tserpes

机构 * School of Electrical and Computer Engineering, National Technical University of Athens(雅典国立技术大学电气与计算机工程学院) Industrial Systems Institute, Athena Research Center(雅典娜研究中心工业系统研究所)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG;trustworthy(comments)

AI总结 研究针对二维距离图像分割的无限制对抗攻击,提出基于扩散并利用分割损失对抗引导的方法,在SemanticKITTI数据集实验,能跨架构转移,相比基线在有效性与现实性间有独特权衡,实现可控退化。

Comments Accepted at the 1st Workshop on Secure and Trustworthy AI (STAI 2026), co-located with the European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECML PKDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11751 2026-07-14 cs.CR cs.LG cs.MA 新提交 57%

When Local Monitors Miss Compositional Harm: Diagnosing Distributed Backdoors in Multi-Agent Systems

当局部监测器遗漏组合性危害时:诊断多智能体系统中的分布式后门

Yibo Hu, Ren Wang

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 研究多智能体系统中分布式后门问题及局部监测器漏洞,提出可观测性边界概念,通过实验证明局部监测器在局部无害时会失效,还展示了特定监测器和门的效果,指出找到能暴露负载的表示形式是未解决问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10630 2026-07-14 cs.RO cs.AI 新提交 57%

World Models as Adversaries: Multi-Agent Self-Play Fine-Tuning for Robust Motion Planning

作为对手的世界模型:用于鲁棒运动规划的多智能体自我博弈微调

Tong Nie, Yuewen Mei, Junlin He, Yihong Tang, Jian Sun, Wei Ma

机构 * The Hong Kong Polytechnic University(香港理工大学) Tongji University(同济大学) McGill University(麦吉尔大学) Mila-Quebec AI Institute(米拉-魁北克人工智能研究所)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 研究在密集交通中自动驾驶车辆鲁棒运动规划问题,提出对抗世界建模(AWM)框架,通过多智能体自我博弈微调,引入解耦求解器,经实验验证该方法能生成可转移对抗交互,使规划器在多种场景有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏