arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-09 至 2026-03-09 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 2 篇

2509.11629 2026-03-09 cs.LG cs.AI 92%

Reasoned Safety Alignment: Ensuring Jailbreak Defense via Answer-Then-Check

理性安全对齐:通过答案后检查确保对抗攻击防御

Chentao Cao, Xiaojun Xu, Bo Han, Hang Li

机构 * TMLR Group, Department of Computer Science, Hong Kong Baptist University(TMLR小组,计算机科学系,香港 Baptist大学)

专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出答案后检查方法,通过推理增强模型对抗攻击防御能力,实验表明其在安全性和效率上的优势。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11247 2026-03-09 cs.CR cs.AI 57%

Peak + Accumulation: A Proxy-Level Scoring Formula for Multi-Turn LLM Attack Detection

峰值+累积:多轮LLM攻击检测的代理层评分公式

J Alex Corll

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

AI总结 提出一种基于峰值和累积的代理层评分公式,用于多轮LLM攻击检测,实现高召回率和低误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏