JustLLMGRPO: Radiographic Control for Chest X-Ray Generation
JustLLMGRPO:面向胸部X射线生成的放射学控制
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 JustLLMGRPO仅对LLM提示词策略应用GRPO,在冻结Sana生成器的前提下,提升了胸部X射线生成的质量,同时维持了提示词对齐度,实现了最优性能。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
JustLLMGRPO:面向胸部X射线生成的放射学控制
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 JustLLMGRPO仅对LLM提示词策略应用GRPO,在冻结Sana生成器的前提下,提升了胸部X射线生成的质量,同时维持了提示词对齐度,实现了最优性能。
Goedel-Code-Prover:面向开放状态的最新代码验证的分层证明搜索
机构 * ETH Zürich(苏黎世联邦理工学院) ; Princeton Language and Intelligence(普林斯顿语言与智能实验室) ; Department of Computer Science, Princeton University(普林斯顿大学计算机科学系) ; MiroMind
专题命中 安全训练 :alignment(abstract);分类 cs.AI
AI总结 本文提出Goedel-Code-Prover框架,通过分层证明搜索提升Lean4中代码验证的自动化水平,实现62%的成功率,优于现有基线方法。
Comments Published as a COLM paper
图形代理:用于科学代理的结构化执行图
机构 * School of Computer Science, McGill University(计算机科学学院,麦吉尔大学)
专题命中 安全训练 :safety(abstract);分类 cs.AI
AI总结 El Agente Gráfico通过结构化执行图和类型安全机制,实现科学代理的高效自动化,适用于复杂计算任务。
基于偏序集的机器学习与数据分析:一项综述
专题命中 安全训练 :safety(abstract);分类 cs.LG
AI总结 本综述针对偏序集在机器学习与数据分析应用的研究缺口,提出四轴分类体系,梳理相关模型算法与资源,并明确下一代序感知机器学习的研究议程。
安全起始:极端风险下决策的优化算法配置
专题命中 安全训练 :safety(abstract)
AI总结 针对极端风险下的随机优化问题,提出基于安全起始的解决方案,结合方差缩减保障运行时间,在投资组合优化和神经网络鲁棒分类中验证了方法有效性。
DiSCo:用于共享自主的扩散序列助手
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 安全训练 :alignment(abstract)
AI总结 DiSCo通过扩散策略规划与用户动作一致的动作序列,提升复杂系统控制性能,适用于模拟驾驶和机械臂任务。
Comments 10 pages, 5 figures, HRI '26: Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction
双对抗安全对齐:在大型推理模型(LRMs)中培养内在威胁理解
机构 * King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) ; Stony Brook University(石溪大学)
专题命中 越狱攻击 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.AI、cs.LG
AI总结 针对现有LRMs安全对齐方法依赖模式泛化不足的问题,提出双对抗框架AdvSafe,通过两阶段对抗博弈生成不安全知识数据集,使LRMs实现鲁棒安全对齐且权衡性能更优。
当语法引导攻击:利用结构化输出揭示LLM中的控制平面漏洞
机构 * SKLP, ICT, CAS & UCAS(SKLP、信息科技研究院、中国科学院及中国科学院大学) ; University of Aberdeen(阿伯丁大学) ; University of Leeds(利兹大学) ; SKLP, ICT, CAS(SKLP、信息科技研究院、中国科学院)
专题命中 越狱攻击 :jailbreak(summary_cn,abstract);alignment(abstract);safety(abstract);分类 cs.AI
AI总结 本文研究了通过结构化输出揭示LLM控制平面漏洞的问题,提出了一种名为Constrained Decoding Attack(CDA)的新类别的 jailbreak 方法,通过控制到语义的管道机制,利用schema-enforced logit masking注入恶意前缀,并由模型自身完成有害意图,展示了DictAttack在多个模型上的高攻击成功率,揭示了需要跨平面防御来弥合数据和控制平面之间的语义差距。
Comments To appear in CCS2026
谁搭建安全桥梁?识别并靶向跨语言共享安全路径
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);trustworthy(abstract);分类 cs.AI
AI总结 本研究识别出跨语言共享安全路径,提出基于该路径的靶向对齐方法,仅更新少量参数即可提升非高资源语言安全性并保留模型通用能力。
NeuroBreak:揭示大语言模型的内部越狱机制
机构 * Zhejiang University(浙江大学)
专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI
AI总结 NeuroBreak是一个自上而下的大语言模型越狱分析系统,可分析神经元级安全机制、关键神经元,经评估验证了有效性,为开发下一代防御策略提供机制见解。
Comments 11 pages, 10 figures. Accepted to IEEE VIS 2026
多模态大语言模型的演进安全态势:新兴威胁与防护措施综述
机构 * University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) ; NVIDIA(英伟达公司) ; Penn State University(宾夕法尼亚州立大学) ; Columbia University(哥伦比亚大学) ; University of Missouri-Kansas City(密苏里大学堪萨斯分校) ; Florida State University(佛罗里达州立大学) ; Auburn University(奥本大学)
专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.CY、cs.LG;trustworthy(comments)
AI总结 本综述针对多模态大语言模型(MLLMs)的新型安全威胁,提出多模态安全威胁分类法,梳理安全策略进展,探讨未来安全机制的研究方向。
Comments Accepted at the ICLR 2026 Workshop on Principled Design for Trustworthy AI
逐词进行:增量完成分解打破LLM安全
机构 * University of Michigan(密歇根大学) ; University of Toronto(多伦多大学)
专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL
AI总结 本文提出增量完成分解(ICD)策略,通过逐词生成恶意请求相关词来突破LLM安全机制,评估多种变体在多个基准测试中表现优异,并理论解释其有效性。
检索增强防御:针对大语言模型的自适应且可控制的越狱防范
机构 * Department of Engineering University of Cambridge(工程系剑桥大学)
专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL
AI总结 针对大语言模型越狱攻击的挑战,提出检索增强防御(RAD)框架,在StrongREJECT数据集上验证其可降低强力越狱攻击有效性,同时平衡安全性与实用性。
引导向量的安全代价是可分离且可降低的
专题命中 越狱攻击 :safety(title,abstract);分类 cs.CL、cs.LG
AI总结 本研究针对引导向量破坏LLM安全机制的问题,通过识别并移除其安全退化分量,提出带约束的原始对偶优化方法,可在保留引导效果的同时大幅降低安全退化。
Comments COLM 2026
恢复、解码、再防护:针对编码型VLM越狱的防护无关型防御放大技术
专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI、cs.LG
AI总结 本研究提出防护无关型的恢复-解码放大器,评估其对11种攻击集成的编码型VLM越狱防御效果,发现其存在安全-效用上限,贡献了放大器、集成评估方法及防御适用场景图谱。
自动化欺骗:可扩展的多轮LLM欺骗攻击
机构 * California Institute of Technology(加州理工学院) ; Evergreen Valley College(埃弗格林谷学院)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI、cs.LG
AI总结 本文提出自动化生成多轮LLM欺骗数据集的方法,揭示GPT家族模型在对话历史中的脆弱性,而Gemini 2.5 Flash则表现出极强的抗性。
迈向现实保证:一种概率证书用于SmoothLLM
机构 * California Institute of Technology(加州理工学院)
专题命中 越狱攻击 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种概率框架,通过(k, ε)-unstable假设提升LLM对抗劫持攻击的安全性保障。
语用攻击面:大语言模型中隐式上下文的漏洞
专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL
AI总结 本文提出大语言模型存在语用攻击面漏洞,利用人类语言解读与安全对齐的隐式上下文不匹配,所提攻击方法在各类模型上的成功率大幅优于基线方法。
用于自动驾驶汽车鲁棒交通标志感知的视觉-语言模型蒸馏
机构 * Clemson University(克莱姆森大学)
专题命中 越狱攻击 :alignment(abstract,abstract_cn);分类 cs.LG
AI总结 本研究提出LAMDA框架,通过冻结OpenCLIP文本编码器构建原型库监督视觉特征,在GTSRB和LISA数据集上,可同时提升TSR模型对三类物理攻击的鲁棒性且不降低干净准确率。
Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)
诱饵图像增强针对编码越狱的字幕介导防御
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 该研究发现附加诱饵图像可降低VLMs的编码越狱攻击成功率,通过编码输入检测器门控附加诱饵,可在保留安全增益的同时控制良性弃权率,该效应在多模型、多场景下可复现。
Comments There is bug in algorithm implementation
评估部署于智能电网操作中的LLM jailbreaking漏洞:与NERC标准的基准测试
机构 * ECE Department, University of Toronto(多伦多大学电子工程系) ; CIISE, Concordia University(麦吉尔大学CIISE)
专题命中 越狱攻击 :safety(abstract);分类 cs.AI
AI总结 本文评估了智能电网操作中部署LLM的jailbreaking漏洞,通过与NERC标准的基准测试,发现DeepInception方法攻击成功率最高,Claude 3.5 Haiku完全免疫,Gemini 2.0 Flash-Lite最易受攻击。
Comments \c{opyright} 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works
从不可听输入到模型失效:LALMs中的低频安全风险
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; Nanyang Technological University(南洋理工大学) ; JIUTIAN Research(九天研究院) ; Tencent ARC Lab(腾讯ARC实验室) ; Chongqing University of Posts and Telecommunications(重庆邮电大学)
专题命中 红队测试 :safety(title,abstract);red teaming(abstract);分类 cs.AI
AI总结 本文提出不可听红队测试方法ILL评估LALMs的低频安全风险,发现其可降低LALMs准确率达67个百分点,同时提出DRG防护方法可提升受攻击后的准确率,明确了LALMs此前被忽视的安全风险。
提示注入的剖析:用于结构化分析的组件模型
专题命中 提示注入 :prompt injection(title,abstract);jailbreak(abstract);分类 cs.AI
AI总结 本文提出七个组件的提示注入结构化分析模型,统一相关分类法,结合实例与CTI模式,助力标记、分析提示注入攻击。
防御检索增强型入侵检测系统免受知识投毒与提示注入攻击
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出RAG-IDS三层多智能体入侵检测框架,通过软信任评分、LECC和提示净化的检索边界防御,可在知识投毒与提示注入攻击下恢复分类质量,在CIC-UNSW-NB15数据集上表现出良好的防御效果。
Comments 14 pages with Appnedix, 11 figures. Submitted to IEEE CIC 2026, Research Track (double-blind review)
并非无障碍功能(A11y):安卓无障碍功能如何将移动智能体暴露于间接提示注入攻击
机构 * Radboud University Nijmegen(奈梅亨拉德堡德大学)
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI
AI总结 本文揭示安卓移动智能体框架因依赖未过滤的无障碍元数据,存在间接提示注入漏洞,经实证验证其攻击成功率达0.822,需强化零信任输入验证等安全措施。
迈向元认知少样本间接提示注入:基于结果条件反射的策略抽象
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL
AI总结 本文提出SAVOR方法,将攻击适配转向离线策略蒸馏,仅需一次目标智能体查询,在多基准与模型上攻击成功率显著优于现有方法,且记忆可跨防御迁移。
BASIS:基于预填充注意力探测的漏洞感知选择性提示注入防护
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.LG
AI总结 BASIS是一种基于预填充注意力探测的提示注入防御方法,通过级联门控的稀疏线性探测器实现精准检测,可在保持高注入检测率的同时减少不必要的过度拒绝。
SALLIE:防范潜在语言与图像攻击
机构 * Intuit
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI
AI总结 SALLIE是一种轻量级运行时检测框架,通过机制可解释性提取模型内部激活信号,有效应对文本和图像攻击,无需性能降级或架构修改。
Comments 17 pages, 5 figures, 17 tables. Preprint under review. v2: substantially revised - new title expansion, reworked method presentation, added calibration-regime analysis (shared / threshold-only / fully calibrated) and matched-protocol comparison with RCS-KCD; technical appendices A-H now included
通道卫士:安全模型无法组合成安全的多智能体系统
机构 * College of Engineering and Computer Science, University of Central Florida(工程与计算机科学学院,中央佛罗里达大学) ; Department of Computer Science and Engineering, North South University(计算机科学与工程系,北南大学) ; Computer Science and Engineering, Ahsanullah University of Science and Technology(计算机科学与工程,阿沙努拉科学与技术大学) ; Department of Electrical and Computer Engineering, Purdue University Fort Wayne(电气与计算机工程系,普渡大学弗拉特沃恩分校)
专题命中 提示注入 :alignment(abstract);safety(abstract);prompt injection(abstract);分类 cs.AI
AI总结 研究多智能体大语言模型应用程序中智能体间通道安全问题,提出ChannelGuard深度防御框架,在通道设信息瓶颈门,通过文本与对抗短语库评分处理信息,能有效阻止工具中毒攻击,降低提示注入攻击成功率,保持准确率,白盒自适应释义可规避嵌入门。
SkillsMetric:映射恶意智能体技能静态分析的检测边界
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 本研究提出五阶段静态分析框架SkillsMetric,构建含2266个技能的对抗性数据集,发现静态分析对部分攻击检测不足,需结合静态预筛选与语义审查的纵深防御架构。
Comments 6 pages, 3 figures, 3 tables