arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-13 至 2026-07-13 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 3 篇

2607.03968 2026-07-13 cs.SE cs.AI 新提交 83%

Refused in Chat, Written in Code: Workflow-Level Jailbreak Construction in IDE Coding Agents

在聊天中被拒绝,用代码编写:IDE 编码代理中的工作流级越狱构造

Abhishek Kumar, Carsten Maple

机构 * The Alan Turing Institute(阿尔法·图灵研究院)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI

AI总结 研究 IDE 编码代理安全评估问题,介绍工作流级越狱构造,通过对特定模型在不同基准测试下表现研究发现,对话拒绝基准可能高估其安全性,需跨多轮 IDE 工作流评估安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09076 2026-07-13 cs.AI 新提交 57%

Neuro-Agentic Control: A Deep Learning-based LLM-Powered Agentic AI Framework for Controlling Security Controls

神经代理控制:一种基于深度学习的由大型语言模型驱动的用于控制安全控制的代理人工智能框架

Saroj Gopali, Bipin Chhetri, Deepika Giri, Sima Siami-Namini, Akbar Siami Namin

机构 * Texas Tech University(德克萨斯理工大学) Cumberland University(坎伯兰大学) Advanced Academic Programs Science(高级学术项目科学部) Johns Hopkins University(约翰·霍普金斯大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 针对运营技术网络攻击问题,提出神经代理控制框架,结合基于LLM的规划器与预训练的TimesFM,并引入“反事实物理注入”机制,在工业数据集评估中表现优于基线,能有效保障关键基础设施中代理人工智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.00111 2026-07-13 cs.CR cs.LG cs.SE 版本更新 57%

Ruby: Unmasking Unsafe Rust in Stripped Binaries via Machine Learning

Ruby:通过机器学习揭示剥离二进制文件中的不安全Rust

Xiang Cheng, Sangdon Park, HyungSeok Han, Xiaokuan Zhang, Taesoo Kim

机构 * Georgia Institute of Technology(佐治亚理工学院) Pohang University of Science and Technology(釜山科学技术大学) Microsoft(微软公司) George Mason University(乔治·梅奥大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 研究旨在揭示Rust二进制文件中的不安全区域,核心方法是用机器学习工具Ruby捕获二进制指令差异,主要贡献为识别大部分不安全区域且误报率低,应用于指导符号执行和模糊测试有显著速度提升并帮助修复安卓库漏洞。

Comments Accepted to DSN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏