arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1717 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1717 篇

2607.10630 2026-07-14 cs.RO cs.AI 新提交 57%

World Models as Adversaries: Multi-Agent Self-Play Fine-Tuning for Robust Motion Planning

作为对手的世界模型:用于鲁棒运动规划的多智能体自我博弈微调

Tong Nie, Yuewen Mei, Junlin He, Yihong Tang, Jian Sun, Wei Ma

机构 * The Hong Kong Polytechnic University(香港理工大学) Tongji University(同济大学) McGill University(麦吉尔大学) Mila-Quebec AI Institute(米拉-魁北克人工智能研究所)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 研究在密集交通中自动驾驶车辆鲁棒运动规划问题,提出对抗世界建模(AWM)框架,通过多智能体自我博弈微调,引入解耦求解器,经实验验证该方法能生成可转移对抗交互,使规划器在多种场景有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09076 2026-07-13 cs.AI 新提交 57%

Neuro-Agentic Control: A Deep Learning-based LLM-Powered Agentic AI Framework for Controlling Security Controls

神经代理控制:一种基于深度学习的由大型语言模型驱动的用于控制安全控制的代理人工智能框架

Saroj Gopali, Bipin Chhetri, Deepika Giri, Sima Siami-Namini, Akbar Siami Namin

机构 * Texas Tech University(德克萨斯理工大学) Cumberland University(坎伯兰大学) Advanced Academic Programs Science(高级学术项目科学部) Johns Hopkins University(约翰·霍普金斯大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 针对运营技术网络攻击问题,提出神经代理控制框架,结合基于LLM的规划器与预训练的TimesFM,并引入“反事实物理注入”机制,在工业数据集评估中表现优于基线,能有效保障关键基础设施中代理人工智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.00111 2026-07-13 cs.CR cs.LG cs.SE 版本更新 57%

Ruby: Unmasking Unsafe Rust in Stripped Binaries via Machine Learning

Ruby:通过机器学习揭示剥离二进制文件中的不安全Rust

Xiang Cheng, Sangdon Park, HyungSeok Han, Xiaokuan Zhang, Taesoo Kim

机构 * Georgia Institute of Technology(佐治亚理工学院) Pohang University of Science and Technology(釜山科学技术大学) Microsoft(微软公司) George Mason University(乔治·梅奥大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 研究旨在揭示Rust二进制文件中的不安全区域,核心方法是用机器学习工具Ruby捕获二进制指令差异,主要贡献为识别大部分不安全区域且误报率低,应用于指导符号执行和模糊测试有显著速度提升并帮助修复安卓库漏洞。

Comments Accepted to DSN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06807 2026-07-09 cs.CR cs.AI 新提交 57%

When Agents Go Rogue: Activation-Based Detection of Malicious Behaviors in Multi-Agent Systems

当智能体行为异常时:基于激活的多智能体系统恶意行为检测

Haowen Xu, Xue Tan, Lei Ma, Zhihao Zhang, Chao Wang, Qingze Wang, Ping Chen, Jun Dai, Xiaoyan Sun

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 针对多智能体系统面临的安全挑战,提出基于激活的框架AcMAS,通过分析智能体激活空间中的推理状态检测隐蔽攻击,不依赖交互图,还能恢复受损智能体功能,在检测隐蔽攻击上显著优于基线方法。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06643 2026-07-09 cs.CR cs.LG 新提交 57%

The Power of Backdoor Absorption in Community Training

社区训练中后门吸收的力量

Issam Seddik, Sami Souihi, Mohamed Tamaazousti, Sara Tucci Piergiovanni

机构 * Université Paris-Saclay, CEA LIST(巴黎萨克雷大学,CEA LIST)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 研究在分散训练中后门攻击问题,通过量化最小审计开销,将注入-吸收动态形式化为离散时间马尔可夫链,证明结合自然吸收等策略可使对手成功概率降为零,实证显示能有效抑制后门且效用无退化,为安全关键型AI提供高效防御。

Comments Technical Report, CEA-LIST. 15 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08169 2026-07-03 cs.AI 版本更新 57%

Activation Steering for Aligned Open-ended Generation without Sacrificing Coherence

激活引导用于不牺牲连贯性的对齐开放式生成

Niklas Herbster, Martin Zborowski, Alberto Tosato, Gauthier Gidel, Tommaso Tosato

机构 * Tara Research Technical University of Munich(慕尼黑工业大学) Mila Quebec AI Institute(Mila魁北克人工智能研究所)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 本文提出激活引导方法,通过在生成过程中持续修正偏差激活,提升大模型的对齐性能,实验表明StTP和StMP在保持连贯性的同时更有效维护通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29649 2026-06-30 cs.CL 57%

Resolution Thresholds in VLM Detection of Harmful ASCII Art Across Construction Modes and Languages

VLM检测有害ASCII艺术的分辨率阈值:跨构建模式与语言的研究

Yikai Hua, Peter West

机构 * Department of Computer Science(计算机科学系) The University of British Columbia(不列颠哥伦比亚大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL

AI总结 研究图像分辨率如何影响VLM检测有害ASCII艺术,发现检测率在特定分辨率阈值以上急剧下降,且基于单词的模式最难检测,揭示了VLM内容审核系统的系统性漏洞。

Comments 13 pages, 9 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23496 2026-06-23 cs.LG cs.CR 新提交 57%

TROPT: An Open Framework for Unifying and Advancing Discrete Text Optimization

TROPT:统一和推进离散文本优化的开放框架

Matan Ben-Tov, Mahmood Sharif

机构 * Tel Aviv University(特拉维夫大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.LG

AI总结 提出TROPT,首个统一离散优化器执行与开发的开源框架,支持30+优化方案,降低应用门槛并促进新策略研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16707 2026-06-23 cs.CR cs.LG 版本更新 57%

On-Device Interpretable Tsetlin Machine-Based Intrusion Detection for Secure IoMT

设备端可解释的基于Tsetlin机的入侵检测系统用于安全的物联网医疗设备

Rahul Jaiswal, Per-Arne Andersen, Linga Reddy Cenkeramaddi, Lei Jiao, Ole-Christoffer Granmo

机构 * Department of ICT, University of Agder, Norway(阿格德大学信息与通信技术系)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种基于Tsetlin机的设备端可解释入侵检测系统,用于IoMT环境中的入侵检测,通过逻辑规则和特征贡献提升透明度和性能,达到97.83%的分类准确率。

Comments 8 pages, 11 figures, 7 tables, accepted at the IEEE Intelligent Conference on Intelligence and Security Informatics (ISI-2026), Cambridge, UK

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20470 2026-06-19 cs.CR cs.AI 新提交 57%

Analyzing Defensive Misdirection Against Model-Guided Automated Attacks on Agentic AI Systems

分析针对基于模型引导的自动化攻击的防御性误导策略在智能体AI系统中的应用

Reza Soosahabi, Vivek Namsani

机构 * Application & Threat Intelligence Research Center(应用与威胁情报研究中心)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 本文通过概率模型分析智能体AI系统的攻击-防御场景,提出“检测-误导”策略(如CMPE)以替代传统“检测-拦截”方法,通过产生误导性响应降低攻击者成功率,并在基准测试中将攻击成功率上限降低两个数量级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15531 2026-06-17 cs.LG cs.CR 新提交 57%

Greedy Coordinate Diffusion: Effective and Semantically Coherent Adversarial Attacks via Diffusion Guidance

贪婪坐标扩散:通过扩散引导实现有效且语义一致的对抗攻击

Bohdan Turbal, Blossom Metevier, Max Springer, Aleksandra Korolova

机构 * University of Maryland(马里兰大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 提出贪婪坐标扩散方法,利用扩散模型引导生成语义连贯的对抗样本,在保持自然性的同时实现高攻击成功率。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01359 2026-06-17 cs.CR cs.AI 版本更新 57%

Breaking the Code: Security Assessment of AI Code Agents Through Systematic Jailbreaking Attacks

破解代码:通过系统性越狱攻击对AI代码代理进行安全评估

Shoumik Saha, Jifan Chen, Sam Mayers, Sanjay Krishna Gouda, Zijian Wang, Varun Kumar

机构 * University of Maryland – College Park(马里兰大学-College Park) AWS AI Labs(AWS人工智能实验室) Meta Superintelligence Labs(Meta超智能实验室)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 提出JAWS-Bench基准测试,通过三级工作区评估代码LLM代理的越狱风险,发现代理化使攻击成功率提升1.6倍,并揭示可执行攻击代码的高比例。

Comments 22 pages, 18 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12709 2026-06-12 cs.MA cs.CR cs.LG 新提交 57%

Smarter Saboteurs, Better Fixers: Scaling & Security in Linear Multi-Agent Workflows

更聪明的破坏者,更好的修复者:线性多智能体工作流中的规模与安全性

Timothy McAllister, Sina Abdidizaji, Ivan Garibay, Ozlem Ozmen Garibay

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 研究模型规模对线性多智能体工作流安全性的影响,发现大模型更易执行恶意指令,但轻量级修复阶段可恢复性能,表明线性结构在适当校正下具有鲁棒性。

Comments 16 pages (4 are main text), 2 figures, 6 tables. Accepted to the AIWILD Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11648 2026-06-11 cs.CR cs.CL 新提交 57%

Dummy Backdoor as a Defense: Removing Unknown Backdoors via Shared Internal Mechanisms for Generative LLMs

虚拟后门作为防御:通过共享内部机制移除生成式大语言模型中的未知后门

Kazuki Iwahana, Masaru Matsubayashi, Takuma Koyama, Toshiki Shibahara, Kenichiro Omintato, Akira Ito

机构 * NTT Social Informatics Laboratories(NTT社会信息实验室) Tohoku University(东北大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL

AI总结 提出一种基于共享内部机制的后门移除方法,通过嵌入已知触发器的虚拟后门并微调移除,从而降低未知后门攻击成功率,同时保持模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01529 2026-06-11 cs.LG cs.CR 版本更新 57%

Bypassing Prompt Guards in Production with Controlled-Release Prompting

绕过生产环境中的提示守卫:受控释放提示攻击

Jaiden Fairoze, Sanjam Garg, Keewoo Lee, Mingyuan Wang

机构 * UC Berkeley(加州大学伯克利分校) zkBricks Inc(zkBricks公司) Ethereum Foundation(以太坊基金会) NYU Shanghai(纽约大学上海分校)

专题命中 越狱攻击 :alignment(abstract);分类 cs.LG

AI总结 针对AI对齐的提示过滤存在理论上的不可能性,本文提出受控释放提示攻击,利用轻量级输入过滤器与主模型之间的资源不对称性,在实际部署的大语言模型系统中成功绕过提示守卫。

Comments Accepted to USENIX Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10571 2026-06-10 cs.CV cs.AI cs.CR 新提交 57%

Improving Adversarial Transferability on Vision-Language Pre-training Models via Surrogate-Specific Bias Correction

通过代理特定偏差校正提高视觉-语言预训练模型上的对抗迁移性

Lijia Yu, Jiuxin Cao, Yuchen Qiang, Changhao Chen, Yifei Huang, Bo Liu

机构 * School of Cyber Science and Engineering, Southeast University(东南大学网络空间安全学院) Purple Mountain Laboratories(紫金山实验室) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 提出DeBias-Attack方法,通过梯度校正消除代理特定偏差,提高对抗样本在VLP模型间的迁移性,实验验证其在多种模型和任务上的有效性。

Comments 17 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09084 2026-06-09 cs.CR cs.AI 新提交 57%

Context-Fractured Decomposition Attacks on Tool-Using LLM Agents: Exploiting Artifact Provenance Gaps

上下文碎片化解构攻击:利用工具使用LLM代理的工件来源鸿沟

Xiaofeng Lin, Yukai Yang, Daniel Guo, Sahil Arun Nale, Charles Fleming, Guang Cheng

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 针对工具使用LLM代理,提出上下文碎片化解构(CFD)攻击,利用跨上下文工件来源鸿沟实现多步越狱,成功率提升高达28.3个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04266 2026-06-09 cs.CR cs.LG 版本更新 57%

State Backdoor: Towards Stealthy Real-world Poisoning Attack on Vision-Language-Action Model in State Space

状态后门:针对状态空间中视觉-语言-动作模型的隐蔽现实世界投毒攻击

Ji Guo, Wenbo Jiang, Yansong Lin, Yijing Liu, Ruichen Zhang, Guomin Lu, Aiguo Chen, Xinshuo Han, Hongwei Li

机构 * Laboratory Of Intelligent Collaborative Computing, University of Electronic Science and Technology of China(智能协同计算实验室,电子科学与技术大学) National Key Laboratory of Wireless Communications, University of Electronic Science and Technology of China(无线通信国家重点实验室,电子科学与技术大学) School of Computer Science and Engineering, University of Electronic Science and Technology of China(计算机科学与工程学院,电子科学与技术大学) College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(计算机科学与技术学院,南京航空航天大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 提出状态后门攻击,利用机器人手臂初始状态作为触发器,通过偏好引导遗传算法优化触发器的隐蔽性和有效性,在五个VLA模型和五个真实任务中实现超过90%的攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04633 2026-06-09 cs.HC cs.CY cs.RO 57%

"Can you be my mum?": Manipulating Social Robots in the Large Language Models Era

你能做我的妈妈吗?:在大型语言模型时代操纵社交机器人

Giulio Antonio Abbo, Gloria Desideri, Tony Belpaeme, Micol Spitale

机构 * IDLab-AIRO , Ghent University – imec(IDLab-AIRO 和根特大学-imec) DEIB , Politecnico di Milano(DEIB 和米兰理工学院)

专题命中 越狱攻击 :safety(abstract);分类 cs.CY

AI总结 研究探讨了在大型语言模型时代,用户如何利用机器人违反伦理原则,通过三种场景测试发现五种操纵技术,旨在为设计更安全的伦理人机交互提供参考。

Comments 10 pages, 2 figures

Journal ref HRI '25: Proceedings of the 2025 ACM/IEEE International Conference on Human-Robot Interaction

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14289 2026-06-08 cs.AI 版本更新 57%

EVA: Evolving Semantic Adversaries for Red-Teaming GUI Agents Against Environmental Injection Attacks

EVA: 针对环境注入攻击的红队GUI智能体的演化语义对抗方法

Yijie Lu, Manman Zhao, Tianjie Ju, Zihe Yan, Xinbei Ma, Yuan Guo, Daizong Ding, Gongshen Liu, Zhuosheng Zhang

机构 * School of Cyber Science and Engineering, Wuhan University(武汉大学计算机科学与工程学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Independent Researcher(独立研究者)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 提出EVA框架,通过演化语义对抗载荷攻击多模态大语言模型驱动的GUI智能体,揭示语义欺骗是攻击成功的关键,实现85%攻击成功率且快速收敛。

Comments Accepted by

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05779 2026-06-05 cs.CR cs.AI stat.ML 57%

TinyML-Driven Cybersecurity for Autonomous Spacecraft: Latency-Accuracy Analysis for SPARTA RF and Cyber Threat Detection

TinyML驱动的自主航天器网络安全:SPARTA射频与网络威胁检测的延迟-精度分析

Van Le, Trevor Tran, Tan Le

机构 * Virginia Tech(弗吉尼亚理工学院) Hampton University(哈姆普顿大学)

专题命中 越狱攻击 :trustworthy(abstract);分类 cs.AI

AI总结 针对自主航天器,基于SPARTA攻击模型分析TinyML兼容经典模型(随机森林、逻辑回归、SVM、MLP)在检测多种网络射频威胁时的延迟-精度权衡,发现逻辑回归在微秒级推理下仅比随机森林精度低1%,适合作为机载自主基线。

Comments Twenty Fifth International Conference on Security & Management (SAM'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04027 2026-06-04 cs.CR cs.AI 57%

MaskForge: Structure-Aware Adaptive Attacks for Jailbreaking Diffusion Large Language Models

MaskForge:用于越狱扩散大语言模型的结构感知自适应攻击

Yingzi Ma, Zhengyue Zhao, Xiaogeng Liu, Minhui Xue, Yue Zhao, Chaowei Xiao

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Johns Hopkins University(约翰霍普金斯大学) University of Southern California(南加州大学) Responsible AI Research (RAIR) Centre, The University of Adelaide(阿德莱德大学负责任人工智能研究中心)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 提出MaskForge,一种全黑盒自适应攻击方法,通过优化结构模式库实现扩散大语言模型的红队测试,平均攻击成功率达79.3%。

Comments 28 pages, 7 figures, 11 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03695 2026-06-03 cs.CL 57%

Don't Forget Your Embeddings: Robust Knowledge Erasure via Precise Editing of Embeddings

不要忘记你的嵌入:通过精确编辑嵌入实现鲁棒的知识擦除

Clara Haya Suslik, Or Shafran, Mor Geva

机构 * Blavatnik School of Computer Science and AI, Tel Aviv University(巴尔-艾赫伦计算机科学与人工智能学院,特拉维夫大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.CL

AI总结 提出 EMBER 模块,利用稀疏矩阵分解精确擦除词嵌入中的概念相关特征,增强现有知识擦除方法的鲁棒性和特异性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03136 2026-06-03 cs.CR cs.CL 57%

PsychoPass: Geometric Profiling of Multi-Turn Adversarial LLM Conversations

PsychoPass: 多轮对抗性LLM对话的几何轮廓分析

Muberra Ozmen, Subhabrata Majumdar

机构 * Coveo Montreal, QC, Canada(加拿大蒙特利尔 Coveo) Indian Institute of Management Bangalore(班加罗尔印度管理学院)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.CL

AI总结 提出PsychoPass框架,通过提取对话轨迹在嵌入空间中的几何特征,在有害内容生成前预测多轮越狱攻击,并发现早期几何信号具有鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01494 2026-06-02 cs.CR cs.AI cs.SE 57%

ClawHub Security Signals: When VirusTotal, Static Analysis, and SkillSpector Disagree

ClawHub安全信号:当VirusTotal、静态分析和SkillSpector意见不一致时

Vincent Koc, Patrick Erichsen, Jacob Tomlinson, Agustin Rivera, Michael Appel, Nir Paz

机构 * OpenClaw Foundation USA(OpenClaw基金会美国) NVIDIA United Kingdom(NVIDIA英国分公司) NVIDIA USA(NVIDIA美国)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 研究ClawHub中67,453个公开技能版本,通过VirusTotal、静态启发式分析和NVIDIA SkillSpector三种扫描器的分歧,揭示智能体技能安全需要分层治理而非单一扫描器决策。

Comments 10 pages, 1 figure, 7 tables, 1 supplimentary dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01441 2026-06-02 cs.AI 57%

Dive into Ambiguity: A*-Inspired Multi-Agents Commonsense Obfuscation Attack on LLM Prompts

深入歧义:基于A*的多智能体常识混淆攻击LLM提示

Boxuan Wang, Zhuoyun Li, Xiaowei Huang, Yi Dong

机构 * University of Liverpool(利物浦大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 提出一种基于A*的事实错误诱导框架,通过层次化重写策略和动态语义分散系数生成语义对齐但混淆的提示,以高效攻击LLM的常识推理。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09456 2026-06-02 cs.CV cs.CL cs.CR 57%

IAG: Input-aware Backdoor Attack on VLM-based Visual Grounding

IAG: 基于输入感知的后门攻击针对VLM视觉定位

Junxian Li, Beining Xu, Simin Chen, Jiatong Li, Jingdi Lei, Haodong Zhao, Di Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Columbia University(哥伦比亚大学) Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学)

专题命中 越狱攻击 :trustworthy(abstract);分类 cs.CL

AI总结 提出IAG方法,通过文本条件UNet动态生成输入感知的触发器,实现首个多目标后门攻击VLM视觉定位,在多个模型和基准上达到最佳攻击成功率且不影响正常性能。

Comments Accepted by CVPR 2026; Code is at https://github.com/lijunxian111/IAG

Journal ref https://openaccess.thecvf.com/content/CVPR2026/papers/Li_IAG_Input-aware_Backdoor_Attack_on_VLM-based_Visual_Grounding_CVPR_2026_paper.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31593 2026-06-01 cs.CR cs.AI 57%

Stateful Online Monitoring Catches Distributed Agent Attacks

有状态在线监控捕获分布式智能体攻击

Davis Brown, Samarth Bhargav, Arav Santhanam, Kasper Hong, Ivan Zhang, Matan Shtepel, Steffi Chern, Alexander Robey, Eric Wong, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 针对分布式智能体攻击中跨账户聚合的恶意行为难以被单上下文监控检测的问题,提出一种基于实时聚类的有状态在线监控方法,能够更早、更有效地捕获分布式攻击,同时保持低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30667 2026-06-01 cs.CR cs.AI 57%

Automatically Attacking Software Reverse Engineering AI Agents

自动攻击软件逆向工程AI代理

Brian Crawford, Justin Phillips, Patrick McClure

机构 * Naval Postgraduate School(海军学院)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

AI总结 提出基于遗传算法的对抗性提示生成技术(AutoDAN变体),通过注入无关字符串变量欺骗LLM驱动的反汇编与反编译系统,导致其错误分析二进制可执行文件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29910 2026-05-29 cs.SE cs.AI 57%

Agora: Toward Autonomous Bug Detection in Production-Level Consensus Protocols with LLM Agents

Agora: 面向生产级共识协议中自主漏洞检测的LLM智能体

Xiang Liu, Sa Song, Zhaowei Zhang, Huiying Lan, Jason Zeng, Ming Wu, Michael Heinrich, Yong Sun, Ceyao Zhang

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Information and Telecommunication Engineering, Beijing University of Posts and Telecommunications(北京邮电大学信息与电信工程学院) Peking University(北京大学) G Labs(0G实验室)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 提出Agora,一个领域感知的多智能体框架,通过假设驱动测试和LLM协作,在Raft、EPaxos、HotStuff、BullShark四个共识实现中发现15个未知协议级逻辑漏洞,而现有LLM方法未能检测到任何此类漏洞。

Comments 35 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏