arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-23 至 2026-07-23 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 4 篇

2607.19829 2026-07-23 cs.CR 新提交 88%

DARWIN: Evolving Jailbreak Adversary and Guardrail for LLM Safety Evaluation and Protection

达尔文:为大语言模型安全评估与保护演化越狱对手及防护措施

Weiwei Qi, Zefeng Wu, Zhilin Guo, Tianhang Zheng, Chaochao Lu, Liang He, Zhan Qin, Kui Ren

专题命中 越狱攻击 :safety(title,abstract);jailbreak(title,abstract)

AI总结 针对现有大语言模型安全评估与防御方法的静态局限,提出达尔文演化攻击-防御框架,含通过策略发现等扩展能力的达尔文攻击及从新对抗样本中迭代学习的达尔文防护,在攻击成功率和防御召回率上表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19424 2026-07-23 cs.CR cs.AI cs.CL 新提交 86%

JailMeter: An Evidence-Based Evaluation Framework for Jailbreak Attacks on Large Language Models

JailMeter:一种基于证据的大语言模型越狱攻击评估框架

Qingjia Huang, Jingyu Zhang, Jianguo Wu, Yakai Li, Weijuan Zhang, Yankai Rong, Junyi Yao, Shengzhi Zhang, Xiaoqi Jia

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型越狱攻击评估标准和方法不一致的问题,提出基于证据评估框架JailMeter,受信息瓶颈理论启发用双反馈优化过滤噪声,在JailMeter-Eva上评估准确率达97.27%,还提炼出JailMeter\textsubscript{SLM}降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02187 2026-07-23 cs.CR cs.AI 版本更新 57%

Rewriting the Response Path: Silent Tampering and Provider-Signed Defense in BYOK LLM Agents

重写响应路径:BYOK LLM 代理中的静默篡改与提供者签名防御

Mingyu Luo, Zihan Zhang, Zesen Liu, Yuchong Xie, Zhixiang Zhang, Dung Hiu Hilton Yeung, Wai Ip Lai, Ping Chen, Ming Wen, Dongdong She

机构 * Fudan University(复旦大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 研究BYOK LLM代理响应路径完整性问题,发现中继可篡改响应。提出sign-c服务器端方案,能认证执行承载字段和查询,本地垫片验证,加密保护机密性,防御有效拒绝篡改响应,误拒率为零,延迟开销低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19545 2026-07-23 cs.CR 新提交 50%

When HTTP 402 Meets the Blockchain: Risks on Emerging x402 Payments

当HTTP 402遇上区块链:新兴x402支付的风险

Qinying Wang, Yong Yang, Yuan Chen, Shouling Ji, Mathias Payer

专题命中 越狱攻击 :safety(abstract)

AI总结 研究x402支付协议,通过系统研究确定促进者的安全规则,基于规则违规分析得出新攻击向量,提出半自动黑盒工具评估安全性,发现部署均有违规,还通过实证测量量化相关指标,揭示其安全风险。

Journal ref USENIX Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏