arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-27 至 2026-05-27 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 9 篇

2605.26365 2026-05-27 cs.CL 83%

Cultural Value Alignment Via Latent Activation Steering in Large Language Models

大型语言模型中通过潜在激活引导的文化价值对齐

Trung Duc Anh Dang, Sarah Masud

机构 * University of Copenhagen(哥本哈根大学)

专题命中 越狱攻击 :alignment(title,abstract);safety(abstract);分类 cs.CL

AI总结 提出一种基于场景行为探测和潜在激活引导的框架,用于评估和干预LLMs的文化价值,发现文化价值以耦合结构编码,限制了精确对齐。

Comments ACL 2026 Student Research Workshop (Non-Archival Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26158 2026-05-27 cs.CR cs.AI cs.LG 82%

Furina: Fragmented Uncertainty-Driven Refusal Instability Attack

Furina: 碎片化不确定性驱动的拒绝不稳定攻击

Tongxi Wu, Jian Zhang, Yang Gao

机构 * School of Intelligence Science and Technology(智能科学与技术学院) State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) Nanjing University(南京大学)

专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 通过揭示大语言模型安全行为存在不稳定区域,提出多指标诊断框架并开发Furina攻击方法,利用碎片化场景提示诱导不确定性放大,实现高效越狱。

Comments This work is accepted as a regular paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02958 2026-05-27 cs.CR cs.AI cs.CL cs.LG 82%

Tracing the Dynamics of Refusal: Exploiting Latent Refusal Trajectories for Robust Jailbreak Detection

追踪拒绝的动态:利用潜在拒绝轨迹进行鲁棒越狱检测

Xulin Hu, Che Wang, Wei Yang Bryan Lim, Jianbo Gao, Zhong Chen

机构 * Peking University(北京大学) Nanyang Technological University(南洋理工大学) Beijing Jiaotong University(北京交通大学)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过因果追踪识别出稀疏的“拒绝轨迹”激活模式,并提出轻量级白盒检测器SALO,基于隐藏状态窗口实现鲁棒越狱检测。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026). Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27025 2026-05-27 cs.CL cs.MM 79%

Attribute-Based Diagnosis of LLM Alignment with Hate Speech Annotations

基于属性的LLM与仇恨言论标注的对齐诊断

Mohammad Amine Jradi, Faeze Ghorbanpour, Alexander Fraser

机构 * School of Computation, Information and Technology, TU Munich(计算、信息与技术学院,慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 越狱攻击 :alignment(title,abstract);分类 cs.CL

AI总结 通过分析LLM在十个主观属性上的判断与人类标注的对齐情况,发现行为显式维度对齐良好而评价维度系统性反转,并提出基于置信度加权岭回归的属性组合方法,重构连续仇恨言论分数,R²达0.71。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07085 2026-05-27 cs.HC cs.AI cs.CY 73%

The AI Cognitive Trojan Horse: How Large Language Models May Bypass Human Epistemic Vigilance

AI认知特洛伊木马:大型语言模型如何绕过人类认知警觉

Andrew D. Maynard

机构 * School for the Future of Innovation in Society, Arizona State University(未来创新社会研究所,亚利桑那州立大学)

专题命中 越狱攻击 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 提出“认知特洛伊木马”假说,认为LLM通过优化产生的“诚实非信号”特征(流畅性、帮助性、表面无私)可能绕过人类进化出的认知警觉机制,导致用户高估其可信度。

Comments 16 pages, 20 references. v2: Added brief discussion situating "honest signals" terminology in evolutionary biology (Sec. 3), with two added citations (Zahavi 1975; Maynard Smith & Harper 2003). No changes to argument or conclusions

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26332 2026-05-27 cs.CV cs.AI 70%

Erased but Exploitable: Black-box Embedding-Aware Prompting Against Unlearned Text-to-Image Diffusion Models

被擦除但可被利用:针对已遗忘文本到图像扩散模型的黑盒嵌入感知提示攻击

Arian Komaei Koma, Seyed Amir Kasaei, AmirMahdi Sadeghzadeh, Mohammad Hossein Rohban

机构 * Department of Computer Engineering(计算机工程系)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 提出一种黑盒嵌入感知对抗提示攻击BEAP,利用大语言模型迭代生成有效对抗提示,以恢复被遗忘概念,并在攻击成功率上提升超过60%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27110 2026-05-27 cs.CR cs.CL 57%

BAIT: Boundary-Guided Disclosure Escalation via Self-Conditioned Reasoning

BAIT: 基于边界引导的自我条件推理披露升级

Xuan Luo, Yue Wang, Geng Tu, Jing Li, Ruifeng Xu

机构 * The Harbin Institute of Technology(哈尔滨工业大学) The Hong Kong Polytechnic University(香港理工大学) Shenzhen University(深圳大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL

AI总结 提出BAIT三步越狱框架,通过识别保护边界、细化边界和请求详细示例,利用模型自身推理和一致性倾向实现恶意目标披露,实验表明在多个基准上攻击成功率显著优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26526 2026-05-27 cs.LG cs.CR 57%

Open-Weight LLM Fine-Tuning Defenses are Susceptible to Simple Attacks

开源权重大语言模型微调防御易受简单攻击

Kevin Kuo, Chhavi Yadav, Virginia Smith

机构 * Carnegie Mellon University(卡内基梅隆大学) Simons Institute, UC Berkeley(Simons研究所,伯克利大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.LG

AI总结 本文发现针对开源权重大语言模型的防御措施易受abliteration和prefilling等低成本攻击,并提出abliteration-resistant tuning (ART) 方法将攻击成功率降低10%-20%。

Comments main body: 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26384 2026-05-27 cs.DC cs.PF cs.SY eess.SY 50%

GridPilot: Real-Time Grid-Responsive Control for AI Supercomputers

GridPilot:面向AI超级计算机的实时电网响应控制

Denisa-Andreea Constantinescu, David Atienza

专题命中 越狱攻击 :safety(abstract)

AI总结 提出GridPilot三层预测控制器,在GPU测试台上实现97.2毫秒的端到端电网响应,比北欧快速频率储备要求快6.9倍,并通过PUE感知控制消除冷却开销,证明兆瓦级AI/HPC负载可设计为可控的电网灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏