arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1721 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1721 篇

2602.18079 2026-02-23 cs.CR cs.RO 50%

Dynamic Deception: When Pedestrians Team Up to Fool Autonomous Cars

动态欺骗:当行人联手欺骗自动驾驶汽车

Masoud Jamshidiyan Tehrani, Marco Gabriel, Jinhan Kim, Paolo Tonella

机构 * Università della Svizzera italiana(瑞士意大利大学)

专题命中 越狱攻击 :safety(abstract)

AI总结 本文提出通过多个动态元素协作放大对抗信号,以引发自动驾驶车辆的系统级故障,展示动态协作在对抗攻击中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01068 2026-02-17 cs.CR 50%

Post-Quantum Cryptography for Intelligent Transportation Systems: An Implementation-Focused Review

面向智能交通系统的后量子密码学:一项以实现为导向的综述

Abdullah Al Mamun, Akid Abrar, Mizanur Rahman, M Sabbir Salek, Mashrur Chowdhury

专题命中 越狱攻击 :safety(abstract)

AI总结 本文综述了智能交通系统中后量子密码学的实现挑战与未来研究方向,旨在提升ITS在量子计算时代的安全性和可靠性。

Comments This is a preprint version of a manuscript currently under second-round peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06630 2026-02-09 cs.CR 50%

TrapSuffix: Proactive Defense Against Adversarial Suffixes in Jailbreaking

TrapSuffix: 对抗对抗性后缀的主动防御在劫持中

Mengyao Du, Han Fang, Haokai Ma, Gang Yang, Quanjun Yin, Shouling Ji, Ee-Chien Chang

专题命中 越狱攻击 :jailbreak(abstract)

AI总结 TrapSuffix通过主动防御机制,使攻击者陷入无赢困境,有效降低劫持攻击成功率并提高可追溯性。

Comments 23 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03489 2026-02-04 cs.CR 50%

Detecting and Explaining Malware Family Evolution Using Rule-Based Drift Analysis

基于规则的漂移分析检测和解释恶意软件家族演变

Olha Jurečková, Martin Jureček

专题命中 越狱攻击 :trustworthy(abstract)

AI总结 本文提出基于规则的漂移分析方法,用于检测和解释恶意软件家族演变,通过比较规则集识别特征变化,提供可操作的恶意软件行为洞察。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01290 2026-02-03 cs.NI 50%

AOASS: Adaptive Obstacle-Aware Square Spiral Framework for Single-mobile Anchor-Based WSN Localization

AOASS:自适应障碍感知正方形螺旋框架用于单移动锚点基于WSN定位

Abdelhady Naguib

专题命中 越狱攻击 :safety(abstract)

AI总结 AOASS通过自适应障碍检测和优化运动模式,提升WSN中单移动锚点的定位精度与能耗效率,适用于现实物联网应用。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21380 2026-01-30 cs.CR 50%

RerouteGuard: Understanding and Mitigating Adversarial Risks for LLM Routing

RerouteGuard: 理解并缓解LLM路由中的对抗风险

Wenhui Zhang, Huiyu Xu, Zhibo Wang, Zhichao Li, Zeqing He, Xuelin Wei, Kui Ren

专题命中 越狱攻击 :safety(abstract)

AI总结 RerouteGuard通过动态嵌入检测和自适应阈值,有效检测并缓解LLM路由中的对抗风险,提升多模型AI系统的安全性。

Comments 15 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19051 2026-01-28 cs.CR 50%

Proactive Hardening of LLM Defenses with HASTE

通过HASTE主动增强LLM防御

Henry Chen, Victor Aranda, Samarth Keshari, Ryan Heartfield, Nicole Nichols

专题命中 越狱攻击 :prompt injection(abstract)

AI总结 HASTE通过主动生成对抗样本提升LLM防御效果,有效降低基线检测器误报率并优化检测模型性能。

Comments Accepted at peer review NDSS 2026, Last-X workshop. Camera ready copy forthcoming

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15786 2026-01-23 cs.CE 50%

Endowing Molecular Language with Geometry Perception via Modality Compensation for High-Throughput Quantum Hamiltonian Prediction

通过模态补偿赋予分子语言几何感知能力以实现高通量量子哈密顿量预测

Zhenzhong Wang, Yongjie Hou, Chenggong Huang, Yuxuan Du, Dacheng Tao, Min Jiang

专题命中 越狱攻击 :alignment(abstract)

AI总结 通过模态补偿赋予分子语言几何感知能力,利用 SMILES 实现高通量量子哈密顿量预测,提高计算效率与数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09129 2026-01-15 cs.CR 50%

KryptoPilot: An Open-World Knowledge-Augmented LLM Agent for Automated Cryptographic Exploitation

KryptoPilot: 一种面向开放世界的知识增强型大语言模型代理用于自动化密码学利用

Xiaonan Liu, Zhihao Li, Xiao Lan, Hao Ren, Haizhou Wang, Xingshu Chen

专题命中 越狱攻击 :alignment(abstract)

AI总结 KryptoPilot通过开放世界知识增强和受控推理,提升LLM在密码学CTF挑战中的自动化解决能力。

Comments 14 Pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17221 2026-01-01 cs.CV 50%

DAVE: A VLM Vision Encoder for Document Understanding and Web Agents

DAVE: 一种用于文档理解与网络代理的视觉编码器

Brandon Huang, Hang Hua, Zhuoran Yu, Trevor Darrell, Rogerio Feris, Roei Herzig

机构 * MIT-IBM Watson AI Lab(MIT-IBM Watson AI实验室) UC Berkeley(加州大学伯克利分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 越狱攻击 :alignment(abstract)

AI总结 DAVE是一种专为文档理解和网络代理设计的视觉编码器,通过自监督和监督预训练结合模型融合策略,提升对文档和网络任务的适应性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20290 2026-01-01 cs.CR 50%

APT-CGLP: Advanced Persistent Threat Hunting via Contrastive Graph-Language Pre-Training

APT-CGLP: 通过对比图-语言预训练实现高级持续威胁狩猎

Xuebo Qiu, Mingqi Lv, Yimei Zhang, Tieming Chen, Tiantian Zhu, Qijie Song, Shouling Ji

专题命中 越狱攻击 :alignment(abstract)

AI总结 APT-CGLP通过对比图-语言预训练实现高级持续威胁狩猎,提升跨模态语义匹配的准确性和效率。

Comments Accepted by SIGKDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18536 2026-01-01 cs.IR 50%

Illusions of Relevance: Arbitrary Content Injection Attacks Deceive Retrievers, Rerankers, and LLM Judges

相关性错觉:任意内容注入攻击欺骗检索器、重排序器和LLM判断者

Manveer Singh Tamber, Jimmy Lin

专题命中 越狱攻击 :safety(abstract)

AI总结 本文揭示了任意内容注入攻击可欺骗检索器、重排序器和LLM判断者,指出模型在安全性和鲁棒性上的弱点,并呼吁进一步研究。

Comments AACL Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15790 2025-12-19 cs.CR 50%

Bilevel Optimization for Covert Memory Tampering in Heterogeneous Multi-Agent Architectures (XAMT)

针对异构多智能体架构中的隐蔽内存篡改的双层优化

Akhil Sharma, Shaikh Yaser Arafat, Jai Kumar Sharma, Ken Huang

专题命中 越狱攻击 :safety(abstract)

AI总结 XAMT通过双层优化方法针对异构多智能体架构中的隐蔽内存篡改问题,提出了一种新的训练时威胁模型,以提升系统安全性。

Comments 10 pages, 5 figures, 4 tables. Conference-style paper (IEEEtran). Proposes unified bilevel optimization framework for covert memory poisoning attacks in heterogeneous multi-agent systems (MARL + RAG)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19312 2025-12-16 cs.HC 50%

Human-AI Teaming Under Deception: An Implicit BCI Safeguards Drone Team Performance in Virtual Reality

人类与人工智能协同工作中的欺骗:一种隐式脑机接口保护虚拟现实中的无人机团队性能

Christopher Baker, Stephen Hinton, Akashdeep Nijjar, Riccardo Poli, Caterina Cinel, Tom Reed, Stephen Fairclough

专题命中 越狱攻击 :safety(abstract)

AI总结 隐式脑机接口通过解耦神经信号与行为,提升虚拟现实无人机团队在AI欺骗下的鲁棒性与安全性。

Comments 30 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15316 2025-11-20 cs.CV 50%

What Your Features Reveal: Data-Efficient Black-Box Feature Inversion Attack for Split DNNs

Zhihan Ren, Lijun He, Jiaxi Liang, Xinzhu Fu, Haixia Bi, Fan Li

机构 * Xi’an Jiaotong University(西安交通大学)

专题命中 越狱攻击 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13535 2025-11-19 cs.CV 50%

Accuracy is Not Enough: Poisoning Interpretability in Federated Learning via Color Skew

Farhin Farhad Riya, Shahinul Hoque, Jinyuan Stella Sun, Olivera Kotevska

专题命中 越狱攻击 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11961 2025-11-18 cs.HC 50%

"Power of Words": Stealthy and Adaptive Private Information Elicitation via LLM Communication Strategies

Shuning Zhang, Jiaqi Bai, Linzhi Wang, Shixuan Li, Xin Yi, Hewu Li

专题命中 越狱攻击 :trustworthy(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07315 2025-11-11 cs.CR 50%

JPRO: Automated Multimodal Jailbreaking via Multi-Agent Collaboration Framework

Yuxuan Zhou, Yang Bai, Kuofeng Gao, Tao Dai, Shu-Tao Xia

专题命中 越狱攻击 :jailbreak(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24034 2025-10-29 cs.CV 50%

AutoPrompt: Automated Red-Teaming of Text-to-Image Models via LLM-Driven Adversarial Prompts

Yufan Liu, Wanqian Zhang, Huashan Chen, Lin Wang, Xiaojun Jia, Zheng Lin, Weiping Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) School of Cyberspace, Hangzhou Dianzi University(杭州电子科技大学网络空间学院) Nanyang Technological University(南洋理工大学)

专题命中 越狱攻击 :safety(abstract)

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19911 2025-10-28 cs.CV 50%

Attention! Your Vision Language Model Could Be Maliciously Manipulated

Xiaosen Wang, Shaokang Wang, Zhijin Ge, Yuyang Luo, Shudong Zhang

专题命中 越狱攻击 :trustworthy(abstract)

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21214 2025-10-27 cs.CR 50%

Enhanced MLLM Black-Box Jailbreaking Attacks and Defenses

Xingwei Zhong, Kar Wai Fok, Vrizlynn L. L. Thing

专题命中 越狱攻击 :jailbreak(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21189 2025-10-27 cs.CR 50%

Adjacent Words, Divergent Intents: Jailbreaking Large Language Models via Task Concurrency

Yukun Jiang, Mingjie Li, Michael Backes, Yang Zhang

专题命中 越狱攻击 :jailbreak(abstract)

Comments Accepted in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13451 2025-10-16 cs.CR 50%

Toward Efficient Inference Attacks: Shadow Model Sharing via Mixture-of-Experts

Li Bai, Qingqing Ye, Xinwei Zhang, Sen Zhang, Zi Liang, Jianliang Xu, Haibo Hu

专题命中 越狱攻击 :alignment(abstract)

Comments To appear in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11246 2025-10-14 cs.CR 50%

Collaborative Shadows: Distributed Backdoor Attacks in LLM-Based Multi-Agent Systems

Pengyu Zhu, Lijun Li, Yaxing Lyu, Li Sun, Sen Su, Jing Shao

专题命中 越狱攻击 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23594 2025-09-30 cs.CR cs.CV 50%

StolenLoRA: Exploring LoRA Extraction Attacks via Synthetic Data

Yixu Wang, Yan Teng, Yingchun Wang, Xingjun Ma

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 越狱攻击 :safety(abstract)

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12824 2025-09-18 cs.IR 50%

DiffHash: Text-Guided Targeted Attack via Diffusion Models against Deep Hashing Image Retrieval

Zechao Liu, Zheng Zhou, Xiangkun Chen, Tao Liang, Dapeng Lang

专题命中 越狱攻击 :alignment(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10563 2025-09-16 cs.CR 50%

Enhancing IoMT Security with Explainable Machine Learning: A Case Study on the CICIOMT2024 Dataset

Mohammed Yacoubi, Omar Moussaoui, C. Drocourt

专题命中 越狱攻击 :safety(abstract)

Journal ref The Third Edition of the International Conference on Connected Objects and Artificial Intelligence (COCIA'2025), Apr 2025, Casablanca (Maroc), Morocco

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04227 2025-09-12 cs.CR 50%

Can LLMs Hack Enterprise Networks? Autonomous Assumed Breach Penetration-Testing Active Directory Networks

Andreas Happe, Jürgen Cito

专题命中 越狱攻击 :safety(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19521 2025-08-22 cs.CR 50%

Security Steerability is All You Need

Itay Hazan, Idan Habler, Ron Bitton, Itsik Mantin

专题命中 越狱攻击 :prompt injection(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06154 2025-08-22 cs.CV 50%

GLOV: Guided Large Language Models as Implicit Optimizers for Vision Language Models

M. Jehanzeb Mirza, Mengjie Zhao, Zhuoyuan Mao, Sivan Doveh, Wei Lin, Paul Gavrikov, Michael Dorkenwald, Shiqi Yang, Saurav Jha, Hiromi Wakaki, Yuki Mitsufuji, Horst Possegger, Rogerio Feris, Leonid Karlinsky, James Glass

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Sony(索尼) Weizmann Institute of Science(魏茨曼科学研究院) JKU(约翰纳斯堡大学) Tübingen AI Center(图宾根人工智能中心) UVA(乌得勒支大学) UNSW(新南威尔士大学) TU Graz(格拉茨技术大学) MIT-IBM(麻省理工学院-IBM)

专题命中 越狱攻击 :safety(abstract)

Comments Code: https://github.com/jmiemirza/GLOV

详情

展开后加载摘要…

URL PDF HTML 收藏