arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1721 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 1721 篇

2401.11030 2024-01-23 cs.CR cs.AR cs.LG cs.SY eess.SY 57%

Exploring Highly Quantised Neural Networks for Intrusion Detection in Automotive CAN

Shashwat Khandelwal, Shreejith Shanker

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

Comments 7 pages, 5 figures, 6 tables. arXiv admin note: substantial text overlap with arXiv:2401.10724

Journal ref 2023 33rd International Conference on Field-Programmable Logic and Applications (FPL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10689 2024-01-22 cs.CR cs.LG cs.SY eess.SY 57%

A Lightweight Multi-Attack CAN Intrusion Detection System on Hybrid FPGAs

Shashwat Khandelwal, Shreejith Shanker

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

Comments 5 pages, 2 figures, 6 tables

Journal ref 32nd International Conference on Field-Programmable Logic and Applications (FPL) FPL 2022, 425-429

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10674 2024-01-22 cs.CR cs.LG 57%

Deep Learning-based Embedded Intrusion Detection System for Automotive CAN

Shashwat Khandelwal, Eashan Wadhwa, Shreejith Shanker

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

Comments 5 pages, 1 figure, 8 tables

Journal ref IEEE 33rd International Conference on Application-specific Systems, Architectures and Processors (ASAP), Gothenburg, Sweden, 2022, pp. 88-92

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.05509 2024-01-12 cs.CR cs.AI 57%

Optimized Ensemble Model Towards Secured Industrial IoT Devices

MohammadNoor Injadat

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

Comments Accepted and presented in 24th International Arab Conference on Information Technology (ACIT'2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04736 2024-01-11 eess.SY cs.AI cs.SY 57%

Exploring Attack Resilience in Distributed Platoon Controllers with Model Predictive Control

Tashfique Hasnine Choudhury

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

Comments Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01895 2024-01-05 cs.CR cs.LG 57%

A Robust Adversary Detection-Deactivation Method for Metaverse-oriented Collaborative Deep Learning

Pengfei Li, Zhibo Zhang, Ameena S. Al-Sumaiti, Naoufel Werghi, Chan Yeob Yeun

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.04782 2023-12-11 cs.CR cs.LG 57%

Make Them Spill the Beans! Coercive Knowledge Extraction from (Production) LLMs

Zhuo Zhang, Guangyu Shen, Guanhong Tao, Siyuan Cheng, Xiangyu Zhang

专题命中 越狱攻击 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17391 2023-11-30 cs.CL 57%

Unveiling the Implicit Toxicity in Large Language Models

Jiaxin Wen, Pei Ke, Hao Sun, Zhexin Zhang, Chengfei Li, Jinfeng Bai, Minlie Huang

专题命中 越狱攻击 :safety(abstract);分类 cs.CL

Comments EMNLP 2023 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.05225 2023-11-03 cs.CV cs.CR cs.LG 57%

Boosting Adversarial Transferability by Achieving Flat Local Maxima

Zhijin Ge, Hongying Liu, Xiaosen Wang, Fanhua Shang, Yuanyuan Liu

专题命中 越狱攻击 :trustworthy(abstract);分类 cs.LG

Comments Accepted by the Neural Information Processing Systems (NeurIPS 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.13131 2023-07-31 cs.CR cs.AI 57%

Why Don't You Clean Your Glasses? Perception Attacks with Dynamic Optical Perturbations

Yi Han, Matthew Chan, Eric Wengrowski, Zhuohuan Li, Nils Ole Tippenhauer, Mani Srivastava, Saman Zonouz, Luis Garcia

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.14667 2022-11-29 cs.CR cs.AI 57%

Deep Fake Detection, Deterrence and Response: Challenges and Opportunities

Amin Azmoodeh, Ali Dehghantanha

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.13618 2022-11-18 cs.CV cs.CR cs.LG 57%

Phantom Sponges: Exploiting Non-Maximum Suppression to Attack Deep Object Detectors

Avishag Shapira, Alon Zolfi, Luca Demetrio, Battista Biggio, Asaf Shabtai

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.09405 2022-10-19 cs.LG cs.CR 57%

Towards Generating Adversarial Examples on Mixed-type Data

Han Xu, Menghai Pan, Zhimeng Jiang, Huiyuan Chen, Xiaoting Li, Mahashweta Das, Hao Yang

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.07315 2022-09-21 cs.LG 57%

Learn2Weight: Parameter Adaptation against Similar-domain Adversarial Attacks

Siddhartha Datta

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

Comments Accepted in COLING 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.13838 2022-08-31 cs.LG cs.CR 57%

Towards Adversarial Purification using Denoising AutoEncoders

Dvij Kalaria, Aritra Hazra, Partha Pratim Chakrabarti

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

Comments Submitted to AAAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.08433 2022-08-18 cs.CR cs.HC cs.LG eess.SP 57%

Label Flipping Data Poisoning Attack Against Wearable Human Activity Recognition System

Abdur R. Shahid, Ahmed Imteaj, Peter Y. Wu, Diane A. Igoche, Tauhidul Alam

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

Comments Submitted to IEEE SSCI 2022 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.08578 2022-07-22 cs.LG stat.ML 57%

An Equivalence Between Data Poisoning and Byzantine Gradient Attacks

Sadegh Farhadkhani, Rachid Guerraoui, Lê-Nguyên Hoang, Oscar Villemaud

专题命中 越狱攻击 :trustworthy(abstract);分类 cs.LG

Comments arXiv admin note: text overlap with arXiv:2106.02398

Journal ref ICML 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.02764 2022-07-07 cs.LG 57%

Enhancing Adversarial Attacks on Single-Layer NVM Crossbar-Based Neural Networks with Power Consumption Information

Cory Merkel

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.09975 2022-04-26 cs.LG 57%

Eliminating Backdoor Triggers for Deep Neural Networks Using Attention Relation Graph Distillation

Jun Xia, Ting Wang, Jiepin Ding, Xian Wei, Mingsong Chen

专题命中 越狱攻击 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.10377 2022-02-22 cs.CR cs.AI 57%

A Tutorial on Adversarial Learning Attacks and Countermeasures

Cato Pauling, Michael Gimson, Muhammed Qaid, Ahmad Kida, Basel Halak

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.10076 2022-01-25 cs.CR cs.AI 57%

MixDefense: A Defense-in-Depth Framework for Adversarial Example Detection Based on Statistical and Semantic Analysis

Yijun Yang, Ruiyuan Gao, Yu Li, Qiuxia Lai, Qiang Xu

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.05367 2021-12-13 cs.LG cs.CR math.OC stat.ML 57%

Efficient Action Poisoning Attacks on Linear Contextual Bandits

Guanlin Liu, Lifeng Lai

专题命中 越狱攻击 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.08111 2021-11-30 stat.AP cs.LG cs.SY eess.SY 57%

Multivariable Fractional Polynomials for lithium-ion batteries degradation models under dynamic conditions

Clara Bertinelli Salucci, Azzeddine Bakdi, Ingrid K. Glad, Erik Vanem, Riccardo De Bin

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

Comments 45 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.05825 2021-09-29 cs.CR cs.AR cs.LG 57%

HASI: Hardware-Accelerated Stochastic Inference, A Defense Against Adversarial Machine Learning Attacks

Mohammad Hossein Samavatian, Saikat Majumdar, Kristin Barber, Radu Teodorescu

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

Journal ref Secure and Private Systems for Machine Learning Workshop 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.04990 2021-09-16 cs.CL 57%

Perturbing Inputs for Fragile Interpretations in Deep Natural Language Processing

Sanchit Sinha, Hanjie Chen, Arshdeep Sekhon, Yangfeng Ji, Yanjun Qi

专题命中 越狱攻击 :trustworthy(abstract);分类 cs.CL

Comments EMNLP-BlackboxNLP, 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.01746 2021-08-10 cs.LG 57%

Data-driven Operation of the Resilient Electric Grid: A Case of COVID-19

Hossein Noorazar, Anurag. k. Srivastava, K. Sadanandan Sajan, Sanjeev Pannala

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.14100 2021-07-30 cs.CY 57%

Smart Band: An Integrated Device for Emergency Management

A. Jackulin Mahariba, Shivam Patel

专题命中 越狱攻击 :safety(abstract);分类 cs.CY

Comments 3 pages, 6 figures

Journal ref International Journal of Engineering and Advanced Technology, Volume-8 Issue-4S2, April 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.07110 2021-03-15 cs.CR cs.AI 57%

Explaining Network Intrusion Detection System Using Explainable AI Framework

Shraddha Mane, Dattaraj Rao

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.02132 2020-11-30 cs.CV cs.CR cs.LG cs.RO 57%

SADA: Semantic Adversarial Diagnostic Attacks for Autonomous Applications

Abdullah Hamdi, Matthias Müller, Bernard Ghanem

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

Comments Accepted at AAAI'20

Journal ref AAAI 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.00540 2020-11-03 cs.CR cs.LG 57%

Unsupervised Intrusion Detection System for Unmanned Aerial Vehicle with Less Labeling Effort

Kyung Ho Park, Eunji Park, Huy Kang Kim

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

Comments 14 pages, 4 tables, 3 figures, 5 equations, In Proceeding of WISA 2020 (THE 21ST WORLD CONFERENCE ON INFORMATION SECURITY APPLICATIONS)

详情

展开后加载摘要…

URL PDF HTML 收藏