Usability as a Weapon: Attacking the Safety of LLM-Based Code Generation via Usability Requirements
可用性作为武器:通过可用性需求攻击基于LLM的代码生成的安全性
专题命中 越狱攻击 :safety(title)
AI总结 研究通过可用性需求攻击LLM生成代码的安全性,提出U-SPLOIT框架,利用可用性压力导致安全约束被忽略,成功率达98.1%。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
可用性作为武器:通过可用性需求攻击基于LLM的代码生成的安全性
专题命中 越狱攻击 :safety(title)
AI总结 研究通过可用性需求攻击LLM生成代码的安全性,提出U-SPLOIT框架,利用可用性压力导致安全约束被忽略,成功率达98.1%。
不依赖特定大语言模型的语义表示攻击
机构 * JC STEM Lab of Machine Learning and Computer Vision(机器学习与计算机视觉的JC STEM实验室) ; Hong Kong Jockey Club Charities Trust(香港赛马会慈善信托基金) ; Global STEM Professorship Scheme of the Hong Kong Special Administrative Region (SAR)(香港特别行政区(SAR)的全球STEM教授计划) ; National Natural Science Foundation of China(中国国家自然科学基金委员会) ; Northwestern Polytechnical University(西北工业大学) ; The Hong Kong Polytechnic University(香港理工大学) ; School of Electronics and Information(电子与信息学院) ; Department of Electrical and Electronic Engineering(电气与电子工程系) ; Hong Kong Institute of AI for Science(香港人工智能科学研究院) ; City University of Hong Kong(香港城市大学)
专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出语义表示攻击(SRA),通过重新定义对抗目标从精确文本到恶意语义,解决传统方法的收敛性、提示自然性和跨模型泛化问题,实现99.71%的攻击成功率。
Comments arXiv admin note: substantial text overlap with arXiv:2509.19360
通过干扰-校正平滑实现保证的对抗防御
机构 * Xidian University(西安电子科技大学) ; Xi’an Jiaotong University(西安交通大学)
专题命中 越狱攻击 :harmlessness(abstract);分类 cs.AI
AI总结 本文提出了一种基于平滑的新型防御方法,通过干扰-校正机制提升大语言模型对劫持攻击的防御能力,理论分析提供了防御成功的紧界和干扰强度要求,实验表明其在安全性和有用性上优于现有方法。
当提示成为载荷:一种缓解大型语言模型驱动应用中SQL注入攻击的框架
机构 * Hasso Plattner Institute, University of Potsdam, Germany(波茨坦大学霍斯曼-普拉特研究所, 德国) ; Chemnitz University of Technology, Chemnitz, Germany(Chemnitz技术大学, Chemnitz, 德国)
专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI
AI总结 本文提出一种多层安全框架,通过提示清洗、威胁检测和签名控制层缓解LLM介导的SQL注入攻击,实验表明其在检测精度和误报率方面表现优异。
Comments 11 pages
Journal ref ICAART 2026, 18th Int. Conf. on Agents and Artificial Intelligence, pp. 1380-1390, 2026
当子代理继承:在多代理网络中建模和利用子代理生成
机构 * University of Louisiana at Lafayette(路易斯安那州立大学拉弗奈分校)
专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI
AI总结 本文研究多代理网络中子代理继承带来的安全风险,指出继承内存可能传播恶意指令,提出通过显式安全不变量进行防御。
针对物联网代理中任务路由的技能描述欺骗攻击
专题命中 越狱攻击 :trustworthy(abstract)
AI总结 本文提出技能描述欺骗攻击模型,通过生成虚假技能描述影响任务路由决策,实验显示攻击成功率高达98%,揭示了物联网代理系统的新安全漏洞。
Comments Submitted to IEEE Globecom 2026
BadDLM:针对扩散语言模型的多样化目标后门攻击研究
专题命中 越狱攻击 :alignment(abstract)
AI总结 本文提出BadDLM框架,研究扩散语言模型的后门攻击,通过触发感知训练目标和理论证明,展示其在概念注入、语义属性引导等目标上的有效性,揭示扩散生成中的新安全风险。
Comments 21 pages, Preprint
MalTool:针对LLM代理的恶意工具攻击
专题命中 越狱攻击 :safety(abstract)
AI总结 研究提出MalTool框架,系统分析恶意工具代码实现,展示恶意行为分类及生成方法,揭示现有检测方法对恶意工具的局限性。
PersonaTeaming: 支持基于人设的生成AI红队测试
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Apple(苹果公司)
专题命中 红队测试 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY
AI总结 本文提出PersonaTeaming方法,通过整合人设提升红队测试的自动化与人机协作能力,实验显示其在攻击成功率和提示多样性方面优于现有方法,并通过用户界面促进人机协同创新。
AutoRedTrader: 通过合成虚假信息注入实现交易代理的自主红队测试
专题命中 红队测试 :red teaming(title)
AI总结 本文提出AutoRedTrader框架,通过行为偏差操控、微小文本扰动和重写策略生成金融领域虚假信息,评估其对交易代理的影响及历史市场证据的稳定性。
Comments Work in progress
ClawGuard:一种用于对抗间接提示注入的工具增强LLM代理运行时安全框架
机构 * Singapore Management University(新加坡国立管理学院)
专题命中 提示注入 :prompt injection(title,abstract);alignment(abstract);分类 cs.AI
AI总结 ClawGuard通过在工具调用边界实施用户确认规则集,有效阻止间接提示注入攻击,无需修改模型或基础设施,实验显示其在多个基准测试中均能提供可靠保护。
通过类型引导的特权分离防止提示注入
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.LG
AI总结 本文提出一种类型引导的特权分离技术,通过将不可信数据转换为受控的数据类型,有效防止提示注入攻击,同时保持系统的实用性和兼容性。
Comments Revised manuscript
CachePrune: 通过KV缓存编辑教LLMs不遵循指令
机构 * Adobe Research(Adobe研究院) ; University of California San Diego(加州大学圣地亚哥分校) ; University of New South Wales(新南威尔士大学)
专题命中 提示注入 :DPO(abstract,abstract_cn);prompt injection(abstract);分类 cs.AI
AI总结 CachePrune通过KV缓存编辑识别并修剪指令跟随相关神经元,降低间接提示注入攻击成功率,同时保持LLM执行用户指令的能力。
基于神经拍卖的大型语言模型广告
机构 * Tsinghua University(清华大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Harvard University(哈佛大学)
专题命中 提示注入 :alignment(abstract);prompt injection(abstract);分类 cs.AI、cs.LG
AI总结 本文提出神经拍卖机制,通过在LLM内部表示中进行拍卖,解决广告嵌入中的收益、平台收入与用户体验平衡问题,实现策略-proof且优化平台收益。
Comments 17 pages, 9 figures, including appendices
对抗鲁棒性增强方法研究:用于医疗决策任务的对抗鲁棒大语言模型智能体
机构 * Pace University(帕克大学)
专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.AI、cs.LG
AI总结 本文提出ARSM-Agent框架,通过多模块协同提升医疗决策智能体的对抗鲁棒性与安全性,实验表明其在多种攻击下攻击成功率降低至8.7%。
Comments 5 pages, 2 figures, 1 table.Accepted for oral presentation at AINIT 2026
CALYREX:跨注意力层扩展变换器用于系统提示锚定
机构 * Cornell University(康奈尔大学)
专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.LG
AI总结 CALYREX通过跨注意力机制在系统提示和输入之间建立结构隔离,提升模型在指令遵循和多轮指令遵守任务中的性能,同时降低 jailbreaking 攻击成功率。
Comments Preprint. 25 pages, 4 figures, 9 tables
通过隐含特征引导缓解对齐传染
机构 * IBM Research Yorktown Heights(IBM研究院Yorktown Heights)
专题命中 提示注入 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 研究探讨了多智能体交互中对齐传染问题,提出通过隐含特征引导技术维持模型初始亲社会行为,有效缓解因恶意引导导致的反社会倾向。
Oracle Poisoning:污染知识图谱以武器化AI代理推理
机构 * Microsoft(微软) ; UNSW Canberra(新南威尔士大学堪培拉分校) ; SAP ; OWASP Gen AI Security Project(OWASP生成式人工智能安全项目)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 本文研究了通过污染知识图谱来破坏AI代理推理的攻击方法,展示了六个针对生产级代码知识图谱的攻击场景,揭示了攻击者熟练度对信任度的影响,并评估了多种防御措施的有效性。
Comments 26 pages, 3 fugres, 16 tables
enclawed:一个可配置、无扇区偏见的单用户AI助手网关加固框架
机构 * Metere Consulting, LLC(梅特尔咨询公司)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 enclawed为需要可验证的对等信任、默认拒绝外部连接、签名模块加载和可篡改审计追踪的部署提供加固框架,通过两种风味实现数据驱动的分类和高保证的对等认证。
WebTrap: 隐秘的中任务劫持攻击浏览器代理在导航过程中的行为
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; City University of Hong Kong(香港城市大学) ; City University of Macau(澳门城市大学)
专题命中 提示注入 :prompt injection(abstract);分类 cs.AI
AI总结 WebTrap通过多步骤指令融合引导实现浏览器代理在导航任务中的隐秘劫持,提升攻击成功率同时保持系统可用性。
Comments 31 pages, 4 figures, 10 tables. Code: https://github.com/liuyaojialiuyaojia/WebTrap
通过激励与修正实现AI对齐
机构 * Princeton University(普林斯顿大学)
专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 本文从法律经济学威慑模型视角探讨AI对齐问题,提出通过激励机制和修正过程解决AI行为与对齐目标的平衡问题,构建双代理模型分析奖励设计对求解器和审计器行为的影响。
元认知探测:用于大语言模型的五种行为校准诊断
机构 * Independent Researcher(独立研究者)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出元认知探测工具,通过五个维度评估大语言模型的自信行为,揭示模型在特定领域的过度自信问题,展示了Gemini 2.5 Flash在不同任务中的显著差异。
Comments 27 pages, 13 tables. Code, data, prompts, and rubrics released with the paper. OSF deposit pending; DOI in v2
可靠推断的基础:可靠性与效率的协同设计
机构 * The Department of Engineering(工程系) ; King’s College London(伦敦国王学院)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG
AI总结 本文探讨如何高效实现可靠推断,通过统一框架从两个视角出发,解决可靠性与效率的协同设计问题。
Comments PhD Thesis
通过不确定性减少解决道路使用者互动中的空间共享冲突:一种基于主动推断的计算模型
机构 * Department of Cognitive Robotics, Delft University of Technology, Netherlands(德鲁特理工大学认知机器人学系) ; Waymo LLC, Mountain View, CA, USA(Waymo公司)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI
AI总结 本文提出一种基于主动推断的计算模型,用于模拟道路使用者互动中的空间共享冲突解决,通过隐含沟通、规范预期和显性沟通机制提升冲突解决效率,但需考虑对方行为是否符合预期。
为AI赋能的材料发现培养学生:一种与工作流程对齐的AI素养、公平性及科学判断框架
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CY
AI总结 本文提出一种与工作流程对齐的AI素养框架,强调通过提升学生在材料信息学中的数据溯源、领域特定特征化等能力,促进AI在材料发现中的公平应用与科学判断。
Comments 22 pages, 4 figures, and 5 tables
代码调酒师:构建代码混合LLM的从业者指南
机构 * Arizona State University(亚利桑那州立大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL
AI总结 本文探讨了代码混合和切换在大语言模型中的挑战,提出统一的分类体系和实用指南,涵盖数据、建模和评估方法,分析现有评估实践并讨论安全问题。
Comments 8 pages main paper, 13 pages total
探究在可控反事实扰动下的视觉语义对齐中的各向异性
机构 * Department of Engineering(工程系)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI
AI总结 本文研究了在可控反事实扰动下视觉语义对齐中的各向异性影响,通过对比两种不同嵌入几何的模型发现,余弦相似度与近似行为无显著关联,表明各向异性不足以解释反事实错误。
Comments To be published in the proceedings of the 5th Explainable AI for Computer Vision (XAI4CV) Workshop at CVPR 2026
基于大语言模型的多阶段检索在运营技术网络安全合规中的应用:铁路案例研究
机构 * Digital Transit Limited, 3M Buckley Innovation Centre(数字交通有限公司,3M Buckley创新中心) ; Department of Computer Science at University of Huddersfield(赫德瑟尔大学计算机科学系)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI
AI总结 本文提出利用大语言模型和多阶段检索提升铁路网络安全合规性验证,通过对比不同模型展示PCA在合规性验证中的有效性,建立评估指标并指出LLM在合规性验证中的优势与局限。
Thermal-Det: 语言引导的跨模态蒸馏用于开放词汇热成像目标检测
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Kitware ; DEVCOM Army Research Laboratory(国防部陆军研究实验室)
专题命中 幻觉与事实性 :alignment(abstract)
AI总结 本文提出Thermal-Det,首个针对热成像的开放词汇检测器,通过合成数据集和跨模态蒸馏提升热成像目标检测性能,实验显示在公开基准上取得2-4%的AP提升。
Comments Accepted at CVPR 26
GONE: 通过邻域扩展分布塑造实现结构知识卸载
机构 * University of Nevada, Las Vegas(内华达大学拉斯维加斯分校) ; Indian Institute of Technology Guwahati(印度理工学院古瓦哈提分校)
专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.LG
AI总结 本文提出GONE基准,用于评估LLM在结构知识图谱中的知识卸载能力,引入NEDS框架通过图连接性识别相关邻居,实现精确的遗忘边界划分,展示出在知识编辑和卸载任务中的优越性能。