arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1359 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 86 篇

2601.12349 2026-07-16 cs.CR cs.AI cs.SE 版本更新 57%

Mind the Gap: Action Rebinding Attacks against Android GUI Agents

零权限操纵:我们能否信任由大型多模态模型驱动的GUI代理?

Yi Qian, Kunwei Qian, Xingbang He, Ligeng Chen, Jikang Zhang, Tiantai Zhang, Haiyang Wei, Linzhang Wang, Hao Wu, Bing Mao

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Hornor Device Co., Ltd(Hornor设备有限公司) Institute of Dataspace, Hefei Comprehensive National Science Center(数据空间研究所,合肥综合性国家科学中心)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 研究揭示了由大型多模态模型驱动的GUI代理在Android中存在视觉原子性假设的漏洞,通过零权限攻击实现对代理执行的重新绑定,并利用意图对齐策略绕过验证门,展示了代理-操作系统集成中的安全缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.00111 2026-07-13 cs.CR cs.LG cs.SE 版本更新 57%

Ruby: Unmasking Unsafe Rust in Stripped Binaries via Machine Learning

Ruby:通过机器学习揭示剥离二进制文件中的不安全Rust

Xiang Cheng, Sangdon Park, HyungSeok Han, Xiaokuan Zhang, Taesoo Kim

机构 * Georgia Institute of Technology(佐治亚理工学院) Pohang University of Science and Technology(釜山科学技术大学) Microsoft(微软公司) George Mason University(乔治·梅奥大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 研究旨在揭示Rust二进制文件中的不安全区域,核心方法是用机器学习工具Ruby捕获二进制指令差异,主要贡献为识别大部分不安全区域且误报率低,应用于指导符号执行和模糊测试有显著速度提升并帮助修复安卓库漏洞。

Comments Accepted to DSN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08169 2026-07-03 cs.AI 版本更新 57%

Activation Steering for Aligned Open-ended Generation without Sacrificing Coherence

激活引导用于不牺牲连贯性的对齐开放式生成

Niklas Herbster, Martin Zborowski, Alberto Tosato, Gauthier Gidel, Tommaso Tosato

机构 * Tara Research Technical University of Munich(慕尼黑工业大学) Mila Quebec AI Institute(Mila魁北克人工智能研究所)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 本文提出激活引导方法,通过在生成过程中持续修正偏差激活,提升大模型的对齐性能,实验表明StTP和StMP在保持连贯性的同时更有效维护通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16707 2026-06-23 cs.CR cs.LG 版本更新 57%

On-Device Interpretable Tsetlin Machine-Based Intrusion Detection for Secure IoMT

设备端可解释的基于Tsetlin机的入侵检测系统用于安全的物联网医疗设备

Rahul Jaiswal, Per-Arne Andersen, Linga Reddy Cenkeramaddi, Lei Jiao, Ole-Christoffer Granmo

机构 * Department of ICT, University of Agder, Norway(阿格德大学信息与通信技术系)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种基于Tsetlin机的设备端可解释入侵检测系统,用于IoMT环境中的入侵检测,通过逻辑规则和特征贡献提升透明度和性能,达到97.83%的分类准确率。

Comments 8 pages, 11 figures, 7 tables, accepted at the IEEE Intelligent Conference on Intelligence and Security Informatics (ISI-2026), Cambridge, UK

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01359 2026-06-17 cs.CR cs.AI 版本更新 57%

Breaking the Code: Security Assessment of AI Code Agents Through Systematic Jailbreaking Attacks

破解代码:通过系统性越狱攻击对AI代码代理进行安全评估

Shoumik Saha, Jifan Chen, Sam Mayers, Sanjay Krishna Gouda, Zijian Wang, Varun Kumar

机构 * University of Maryland – College Park(马里兰大学-College Park) AWS AI Labs(AWS人工智能实验室) Meta Superintelligence Labs(Meta超智能实验室)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 提出JAWS-Bench基准测试,通过三级工作区评估代码LLM代理的越狱风险,发现代理化使攻击成功率提升1.6倍,并揭示可执行攻击代码的高比例。

Comments 22 pages, 18 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01529 2026-06-11 cs.LG cs.CR 版本更新 57%

Bypassing Prompt Guards in Production with Controlled-Release Prompting

绕过生产环境中的提示守卫:受控释放提示攻击

Jaiden Fairoze, Sanjam Garg, Keewoo Lee, Mingyuan Wang

机构 * UC Berkeley(加州大学伯克利分校) zkBricks Inc(zkBricks公司) Ethereum Foundation(以太坊基金会) NYU Shanghai(纽约大学上海分校)

专题命中 越狱攻击 :alignment(abstract);分类 cs.LG

AI总结 针对AI对齐的提示过滤存在理论上的不可能性,本文提出受控释放提示攻击,利用轻量级输入过滤器与主模型之间的资源不对称性,在实际部署的大语言模型系统中成功绕过提示守卫。

Comments Accepted to USENIX Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04266 2026-06-09 cs.CR cs.LG 版本更新 57%

State Backdoor: Towards Stealthy Real-world Poisoning Attack on Vision-Language-Action Model in State Space

状态后门:针对状态空间中视觉-语言-动作模型的隐蔽现实世界投毒攻击

Ji Guo, Wenbo Jiang, Yansong Lin, Yijing Liu, Ruichen Zhang, Guomin Lu, Aiguo Chen, Xinshuo Han, Hongwei Li

机构 * Laboratory Of Intelligent Collaborative Computing, University of Electronic Science and Technology of China(智能协同计算实验室,电子科学与技术大学) National Key Laboratory of Wireless Communications, University of Electronic Science and Technology of China(无线通信国家重点实验室,电子科学与技术大学) School of Computer Science and Engineering, University of Electronic Science and Technology of China(计算机科学与工程学院,电子科学与技术大学) College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(计算机科学与技术学院,南京航空航天大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 提出状态后门攻击,利用机器人手臂初始状态作为触发器,通过偏好引导遗传算法优化触发器的隐蔽性和有效性,在五个VLA模型和五个真实任务中实现超过90%的攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14289 2026-06-08 cs.AI 版本更新 57%

EVA: Evolving Semantic Adversaries for Red-Teaming GUI Agents Against Environmental Injection Attacks

EVA: 针对环境注入攻击的红队GUI智能体的演化语义对抗方法

Yijie Lu, Manman Zhao, Tianjie Ju, Zihe Yan, Xinbei Ma, Yuan Guo, Daizong Ding, Gongshen Liu, Zhuosheng Zhang

机构 * School of Cyber Science and Engineering, Wuhan University(武汉大学计算机科学与工程学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Independent Researcher(独立研究者)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 提出EVA框架,通过演化语义对抗载荷攻击多模态大语言模型驱动的GUI智能体,揭示语义欺骗是攻击成功的关键,实现85%攻击成功率且快速收敛。

Comments Accepted by

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22928 2026-08-12 cs.CR 版本更新 50%

SoK: The Attack Surface of Agentic AI - Tools and Autonomy

SoK:代理AI的攻击面——工具与自主性

Ali Dehghantanha, Sajad Homayoun

专题命中 越狱攻击 :prompt injection(abstract)

AI总结 本文系统分析了代理AI的安全风险,提出攻击分类与评估指标,探讨防御措施及开放研究挑战,帮助研究人员和工程师应对代理AI的安全威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04469 2026-08-06 cs.CR cs.MA 版本更新 50%

Cross-Layer Semantic Flow Reconstruction for Attack Detection in Agentic Systems

超越输入防护:为执行感知攻击检测重建跨代理语义流

Qizhi Cai, Yangyang Wei, Zhipeng Chen, Shouling Ji, Zhenyuan Li

专题命中 越狱攻击 :prompt injection(abstract)

AI总结 SysName通过重建跨代理语义流,实现执行感知的攻击检测,有效识别多种复合攻击向量,提升多代理系统安全性。

Comments 16 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20851 2026-08-05 cs.CV 版本更新 50%

Poisoning Prompt-Guided Sampling in Video Large Language Models

针对视频大语言模型中提示引导采样的投毒攻击

Yuxin Cao, Wei Song, Jingling Xue, Jin Song Dong

机构 * National University of Singapore(新加坡国立大学) University of New South Wales(新南威尔士大学) CSIRO’s Data61(CSIRO数据61)

专题命中 越狱攻击 :safety(abstract)

AI总结 该研究针对视频大语言模型的提示引导采样提出PoisonVID投毒攻击,在多种模型与采样器组合上实现高攻击成功率,揭示了PGS存在的结构性安全隐患。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06409 2026-07-22 cs.CR 版本更新 50%

VENOMREC: Cross-Modal Interactive Poisoning for Targeted Promotion in Multimodal LLM Recommender Systems

VENOMREC: 多模态交互性污染用于多模态大语言模型推荐系统中的定向推广

Guowei Guan, Yurong Hao, Jiaming Zhang, Tiantong Wu, Fuyao Zhang, Tianxiang Chen, Longtao Huang, Cyril Leung, Wei Yang Bryan Lim

专题命中 越狱攻击 :alignment(abstract)

AI总结 VENOMREC通过跨模态交互性污染技术,在多模态大语言模型推荐系统中实现定向推广,有效提升推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12497 2026-07-10 cs.CR 版本更新 50%

Demystifying LLM Supply Chain Vulnerabilities in the Wild: Distribution, Root Cause, and Real-World Impact

揭开大语言模型供应链在实际应用中的漏洞:分布、根源及现实世界影响

Shenao Wang, Yanjie Zhao, Zhao Liu, Quanchen Zou, Haoyu Wang

专题命中 越狱攻击 :safety(abstract)

AI总结 该研究首次系统大规模实证分析大语言模型供应链漏洞,分析529个实际漏洞,发现漏洞集中在应用层等,特定漏洞源于独特特征,还研究了现实影响,提炼5条见解,为保障供应链安全提供数据基础与研究方向。

Comments Accepted by Internetware 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21664 2026-07-08 cs.CV 版本更新 50%

HumanOmni-Speaker: Identifying Who said What and When

HumanOmni-Speaker: 识别说话者说了什么以及何时

Detao Bai, Zhiheng Ma, Xihan Wei

机构 * Tongyi Lab Alibaba Group(阿里云实验室) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 越狱攻击 :alignment(abstract)

AI总结 本文提出HumanOmni-Speaker,通过视觉注册说话人辨识与识别方法,解决多人物对话中说话者身份与时间的识别问题,实现端到端的多模态协同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02964 2026-07-08 cs.CR 版本更新 50%

External Data Extraction Attacks against Retrieval-Augmented Large Language Models

针对检索增强型大语言模型的外部数据提取攻击

Yu He, Yifei Chen, Yiming Li, Shuo Shao, Leyi Qi, Boheng Li, Dacheng Tao, Zhan Qin

专题命中 越狱攻击 :jailbreak(abstract)

AI总结 研究针对检索增强型大语言模型的外部数据提取攻击,提出统一框架并开发SECRET攻击方法,该方法含自适应优化与聚类聚焦触发策略,实验显示其显著优于先前攻击,能有效提取数据,呼吁关注此新兴威胁。

Comments Accepted by IEEE TIFS

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04356 2026-07-07 cs.CV 版本更新 50%

Stage-wise Attention-Guided Region Sequencing for Adversarial Attacks on Large Vision-Language Models

用于对大型视觉语言模型进行对抗攻击的逐阶段注意力引导区域排序

Jaehyun Kwak, Nam Cao, Boryeong Cho, Segyu Lee, Sumyeong Ahn, Se-Young Yun

机构 * KAIST(韩国科学技术院) KENTECH(KENTECH研究院)

专题命中 越狱攻击 :safety(abstract)

AI总结 研究针对大型视觉语言模型的有针对性对抗攻击,基于注意力分析提出逐阶段注意力引导区域排序,介绍了黑盒区域排序框架SAGA,在多个模型上取得了最先进的攻击成功率和最佳不可感知性。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01410 2026-06-16 cs.HC 版本更新 50%

What LLMs Must Forget to Teach Effectively: A DIY Approach to Premodern Japanese Language Pedagogy

LLM必须忘记什么才能有效教学:前现代日语教学法的DIY方法

Ariel Stilerman, Andrew Nelson, Alan Cheng, Caleb Langley, Sera Wang, Camilla Piana, Pelin Çılgın, Qianhe Qin, Teisha Nishimitsu, Liaoliao Zhang, Huiting Liu, Josh Eyre, Gavin Sherry

专题命中 越狱攻击 :alignment(abstract)

AI总结 本文提出一种基于大型语言模型(LLM)的DIY教学框架,通过提示工程创建定制工具,避免LLM过度解释或产生幻觉,从而促进前现代日语文学和语言课程中的主动理解与教学对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15125 2026-06-08 cs.CR 版本更新 50%

From Storage to Steering: Memory Control Flow Attacks on LLM Agents

从存储到操控:针对LLM代理的内存控制流攻击

Zhenlin Xu, Xiaogang Zhu, Yu Yao, Minhui Xue, Yiliao Song

专题命中 越狱攻击 :safety(abstract)

AI总结 本文研究了内存控制流攻击对LLM代理的影响,提出MEMFLOW框架以系统识别和量化此类攻击,发现超过90%的测试在严格安全约束下仍易受攻击,揭示了严重的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 红队测试 9 篇

2606.25476 2026-07-22 cs.CL cs.AI 版本更新 84%

A Red Teaming Framework for Large Language Models: A Case Study on Faithfulness Evaluation

大型语言模型的红队框架:以忠实性评估为例

Abrar Alotaibi, Raed Mughus, Moataz Ahmed

机构 * King Fahd University of Petroleum & Minerals(法赫德国王石油矿产大学) Imam Abdulrahman Bin Faisal University(伊玛目阿卜杜勒拉赫曼·本·费萨尔大学) SDAIA-KFUPM Joint Research Center for Artificial Intelligence(沙特数据与人工智能局-法赫德国王石油矿产大学人工智能联合研究中心)

专题命中 红队测试 :red teaming(title,abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 提出一种多角色红队框架,通过攻击者和陪审模型暴露LLM的不忠实问题,在问答任务中攻击成功率提升7.9%,并揭示结构约束和架构设计对安全性的影响。

Comments Preprint submitted to SQJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08876 2026-08-04 cs.LG 版本更新 74%

OTora: A Unified Red Teaming Framework for Reasoning-Level Denial-of-Service in LLM Agents

OTora:一种用于LLM代理推理层面拒绝服务攻击的统一红队框架

Xinyu Li, Ronghui Mu, Lin Li, Tianjin Huang, Gaojie Jin

机构 * Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系) Department of Computer Science, University of Oxford(牛津大学计算机科学系) Department of Mathematics and Computer Science, Eindhoven University of Technology(埃因霍温理工大学数学与计算机科学系)

专题命中 红队测试 :red teaming(title);分类 cs.LG

AI总结 OTora是首个统一的两阶段红队框架,用于实现推理层面拒绝服务攻击,通过优化对抗触发器和生成代理感知的推理负载,提升推理token数量和延迟,同时保持任务准确性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22063 2026-07-03 cs.SE cs.AI 版本更新 74%

RedCoder: Automated Multi-Turn Red Teaming for Code LLMs

RedCoder: 面向代码大语言模型的自动化多轮红队测试

Wenjie Jacky Mo, Qin Liu, Xiaofei Wen, Dongwon Jung, Hadi Askari, Wenxuan Zhou, Zhe Zhao, Muhao Chen

机构 * University of California, Davis(加州大学戴维斯分校) University of Southern California(南加州大学)

专题命中 红队测试 :red teaming(title);分类 cs.AI

AI总结 提出RedCoder,一个通过多轮对话诱导代码大模型生成漏洞代码的自动化红队测试智能体,采用多智能体博弈生成原型对话和攻击策略库,并微调LLM作为骨干,实验表明其优于现有单轮和多轮方法。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21735 2026-07-31 cs.AI cs.CR 版本更新 70%

What AI Red-Team Evaluations Can and Cannot Prove

人工智能红队评估能证明什么以及不能证明什么

Bandana Kaur

机构 * APIsec Research Labs(APIsec研究实验室)

专题命中 红队测试 :safety(abstract);red teaming(abstract);分类 cs.AI

AI总结 研究人工智能红队评估能证与不能证之事,通过定义证据上限确定界限,发现高于某危害率基准可证类别,低于则否,该界限不限于基准,审核评估套件发现当前基准对高频危害足够,对罕见灾难性不足。

Comments 21 pages, 4 figures, 5 tables. Code and data links provided in the manuscript. v2: corrected Figure 1(b); corrected required sample sizes in Table 4 and in Sections 4.2, 4.6 and 5.2, which had been rounded rather than taken to the ceiling; corrected the sample-size expression stated in Methods; minor corrections to Table 1 and the Figure 2 caption. No theorem, result or conclusion is affected

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18263 2026-07-28 cs.AI 版本更新 70%

Position: AI/ML Deepfake Research is Misaligned with AI-Generated Non-Consensual Intimate Imagery (AIG-NCII)

立场:人工智能/机器学习领域对深度伪造的研究与人工智能生成的非自愿亲密图像(AIG-NCII)不一致

Li Qiwei, Wells Lucas Santo, Sarita Schoenebeck, Eric Gilbert

专题命中 红队测试 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 研究指出人工智能/机器学习领域对深度伪造的研究与AIG-NCII不一致,现有技术干预忽略AIG-NCII,现有干预只关注观众认知危害,忽略主体尊严危害,建议更新威胁模型,在安全研究中解决AIG-NCII,同时警告研究人员涉足该领域需谨慎并做好防护。

Comments ICML 2026. Outstanding position paper honorable mention

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07121 2026-08-04 cs.LG cs.AI cs.NE 版本更新 62%

Quality-Diversity Red-Teaming: Automated Generation of High-Quality and Diverse Attackers for Large Language Models

质量-多样性红队测试:针对大语言模型的高质量多样化攻击者自动生成

Ren-Jian Wang, Ke Xue, Zeyu Qin, Ziniu Li, Sheng Tang, Hao-Tian Li, Shengcai Liu, Zhi Yu, Yuanpeng Tan, Chao Qian

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong, Shenzhen(香港大学深圳校区) Southern University of Science and Technology(南方科技大学)

专题命中 红队测试 :safety(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出QDRT框架,通过训练多专用攻击者生成高质量多样化攻击,提升LLM安全评估的多样性与有效性,支持LLM负责任部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12290 2026-07-31 cs.CR cs.CY cs.HC 版本更新 57%

Secure human oversight of AI: Threat modeling in a socio-technical context

安全的人工智能人类监督:社会技术背景下的威胁建模

Jonas C. Ditz, Veronika Lazar, Elmar Lichtmeß, Carola Plesch, Matthias Heck, Kevin Baum, Markus Langer

专题命中 红队测试 :safety(abstract);分类 cs.CY

AI总结 本文从安全角度提出人工智能人类监督的威胁建模方法,系统分析其安全风险并提出缓解策略,以保障AI系统的监督过程安全可靠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12993 2026-07-28 cs.CL 版本更新 57%

Tailored untruths: How personalisation challenges LLM safeguards

量身定制的虚假信息:个性化如何挑战大语言模型的安全防护

João A. Leite, João Luz, Silvia Gargova, Arnav Arora, Gustavo Sampaio, Ian Roberts, Carolina Scarton, Kalina Bontcheva

机构 * University of Sheffield(谢菲尔德大学) University of Copenhagen(哥本哈根大学) Big Data for Smart Society Institute (GATE)(大数据智能社会研究所(GATE)) University of São Paulo(圣保罗大学)

专题命中 红队测试 :safety(abstract);分类 cs.CL

AI总结 研究LLMs针对特定角色生成虚假信息的情况,采用红队测试方法创建数据集,发现安全防护在多数情况下失效,各模型能有效定制输出,还揭示了特定语言和心理模式及安全防护有效性差异,凸显加强多语言安全防护的必要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00553 2026-07-01 cs.LG 版本更新 57%

Stable-GFlowNet: Toward Diverse and Robust LLM Red-Teaming via Contrastive Trajectory Balance

Stable-GFlowNet: 通过对比轨迹平衡实现多样且鲁棒的LLM红队测试

Minchan Kwon, Sunghyun Baek, Minseo Kim, Jaemyung Yu, Dongyoon Han, Junmo Kim

机构 * Naver AI Lab(Naver AI实验室)

专题命中 红队测试 :safety(abstract);分类 cs.LG

AI总结 针对大语言模型红队测试中有效性与多样性难以兼顾的问题,提出Stable-GFlowNet方法,通过消除配分函数估计和对比轨迹平衡实现稳定训练,在保持最优策略的同时提升攻击性能与多样性。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 提示注入 48 篇

2603.13026 2026-07-24 cs.LG cs.CR 版本更新 86%

PISmith: Reinforcement Learning-based Red Teaming for Prompt Injection Defenses

PISmith: 基于强化学习的提示注入防御红队测试

Chenlong Yin, Runpeng Geng, Yanting Wang, Jinyuan Jia

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 提示注入 :prompt injection(title,abstract);red teaming(title);分类 cs.LG

AI总结 本文提出PISmith框架,通过强化学习评估现有提示注入防御的鲁棒性,发现标准GRPO在攻击强防御时表现不佳,引入自适应熵正则化和动态优势加权以提升探索能力,实验表明最新防御仍易受适应性攻击影响。

Comments To appear in COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21151 2026-07-28 cs.AI 版本更新 85%

V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure

V-DEAL:将视频安全去校准诊断为理解-拒绝耦合失败

Zhetong Zhang, Honghao Fu, Miao Xu, Yiwei Wang, Yujun Cai

机构 * University of Queensland(昆士兰大学) University of California, Merced(加州大学默塞德分校)

专题命中 提示注入 :safety(title,abstract);alignment(abstract);prompt injection(abstract);分类 cs.AI

AI总结 研究视频大语言模型安全对齐问题,提出V-DEAL三级诊断框架分析漏洞机制,通过测试发现模型识别有害视频内容有一定准确率,但配对有害视频与良性查询时攻击成功率高,视觉理解激活拒绝倾向弱,还引入提示注入干预方法降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20597 2026-08-13 cs.LG cs.AI cs.CR 版本更新 84%

BrowseSafe: Understanding and Preventing Prompt Injection Within AI Browser Agents

BrowseSafe: 理解和防止AI浏览器代理中的提示注入

Kaiyuan Zhang, Mark Tenenholtz, Kyle Polley, Jerry Ma, Denis Yarats, Ninghui Li

机构 * Purdue University(普渡大学) Perplexity AI

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI、cs.LG

AI总结 BrowseSafe通过构建现实场景下的提示注入攻击基准,提出多层次防御策略,旨在提升AI浏览器代理的安全性。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏