arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-12 至 2026-08-12 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 8 篇

2608.06110 2026-08-12 cs.AI cs.CL 版本更新 84%

ECHO: A Locally-Deployable Agentic Health Assistant with Temporal Memory, Safety Guardrails, and Speech Assessment

ECHO:具备时序记忆、安全护栏与语音评估功能的本地可部署智能体式健康助手

Abdulkadir Külçe, Alihan Esen, Çağla Fikir, Berke Kurt, Kuzey Arar, Gökhan Ercan, Faik Boray Tek

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 本文提出具备时序记忆、安全护栏与语音评估功能的本地可部署智能体式健康助手ECHO,其核心聊天机器人、安全层、语音评估模块均达特定性能指标,且可在消费级硬件运行,符合数据保护法规。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10621 2026-08-12 cs.LG 新提交 83%

ProbGuard: Calibrated Safety Risk Estimation from LLM Output Distributions

ProbGuard:基于大语言模型输出分布的校准安全风险估计

Xinzhe Huang, Biwu Yao, Kedong Xiu, Mengnan Zhao, Di Wang, Puning Zhao, Tianhang Zheng

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.LG

AI总结 研究针对现有LLM安全防护的确定性范式局限,提出概率架构无关防护框架ProbGuard,利用早期输出分布信号校准安全风险,实现提前终止不安全输出,在9种组合设置及6种越狱攻击中均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13661 2026-08-12 cs.CV 版本更新 78%

Fine-grained CLIP fine-tuning with self-annotated region alignment

基于自标注区域对齐的细粒度CLIP微调

Chenyang Zhao, Wei Lin, Janet H. Hsiao, Antoni B. Chan

机构 * City University of Hong Kong(香港城市大学) Hong Kong University of Science & Technology(香港科技大学)

专题命中 越狱攻击 :alignment(title,abstract)

AI总结 研究针对CLIP在细粒度表示上的局限,提出SFF-CLIP方法,仅用图像-文本对输入,通过运行时区域-短语对齐方案提升其细粒度表示能力,在相关任务中性能显著提升且维持原CLIP图像级任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11025 2026-08-12 cs.CL 新提交 70%

Data Attribution of Emergent Misalignment with Persona Features

基于角色特征的涌现失配数据归因

Clemens Vetter, David Kaczér, Lucie Flek, Florian Mai

机构 * Bonn-Aachen International Center for Information Technology, University of Bonn(波恩-亚琛信息技术中心,波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究院)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 本研究基于SAE分析揭示EM源于角色特征,操控特征可双向控制EM,发现人类文本无法可靠诱导EM而合成指令响应对可以,明确响应结构或模型措辞的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10537 2026-08-12 cs.AI cs.LG 新提交 62%

Measuring Semantic Abstractness of SAE Features via Nonlocality

通过非局部性测量SAE特征的语义抽象性

Chuqiao Lin, Shivaji Sondhi, Xiao-Liang Qi

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出特征非局部性(FNL)指标,可区分SAE特征的抽象层级,用于审计越狱缓解特征及引导DeepSeek-R1模型特征提升数学推理准确率。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10530 2026-08-12 cs.CR cs.AI 新提交 57%

On Understanding, Identifying, and Mitigating Vulnerabilities in Agentic Large Language Models

关于智能体大语言模型漏洞的理解、识别与缓解

Md Jafrin Hossain, Mohammad Arif Hossain, Nirwan Ansari

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

AI总结 本研究针对智能体大语言模型安全开展系统文献综述,提出四层漏洞分类法,发现攻击研究多于防御研究、感知层漏洞研究占比偏高等现状,识别7个开放问题及架构耦合的核心不安全根源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10405 2026-08-12 cs.SD cs.AI 新提交 57%

Never Stop Speaking: a Denial-of-Service Attack on End-to-End Speech Language Models

永不停止说话:针对端到端语音语言模型的拒绝服务攻击

Shuozhe Cheng, Kunlan Xiang, Mingxuan Li, Ji Zhang, Dongxiao Liu, Wenbo Jiang

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 本研究针对端到端语音语言模型提出基于扰动的拒绝服务攻击,通过优化声学扰动抑制EOS生成以延长解码,在三类开源模型上验证了其攻击有效性及安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22928 2026-08-12 cs.CR 版本更新 50%

SoK: The Attack Surface of Agentic AI - Tools and Autonomy

SoK:代理AI的攻击面——工具与自主性

Ali Dehghantanha, Sajad Homayoun

专题命中 越狱攻击 :prompt injection(abstract)

AI总结 本文系统分析了代理AI的安全风险,提出攻击分类与评估指标,探讨防御措施及开放研究挑战,帮助研究人员和工程师应对代理AI的安全威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏