arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3248 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3248 篇

2307.08602 2023-08-15 cs.RO cs.LG cs.MA cs.SY eess.SY math.OC 79%

CaRT: Certified Safety and Robust Tracking in Learning-based Motion Planning for Multi-Agent Systems

Hiroyasu Tsukamoto, Benjamin Rivière, Changrak Choi, Amir Rahmani, Soon-Jo Chung

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments IEEE Conference on Decision and Control (CDC), Preprint Version, Accepted July, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03176 2023-08-08 cs.AI 79%

Building Safe and Reliable AI systems for Safety Critical Tasks with Vision-Language Processing

Shuang Ao

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

Comments 4 pages

Journal ref 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.02164 2023-07-06 cs.AI 79%

Safety Shielding under Delayed Observation

Filip Cano Córdoba, Alexander Palmisano, Martin Fränzle, Roderick Bloem, Bettina Könighofer

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

Comments 6 pages, Published at ICAPS 2023 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.05596 2023-03-29 eess.SY cs.LG cs.RO cs.SY 79%

Geometry of Radial Basis Neural Networks for Safety Biased Approximation of Unsafe Regions

Ahmad Abuaish, Mohit Srinivasan, Patricio A. Vela

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments Accepted into American Control Conference (ACC) 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.02386 2023-03-07 cs.RO cs.LG cs.SY eess.SY 79%

Modular Safety-Critical Control of Legged Robots

Berk Tosun, Evren Samur

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments Submitted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.08969 2023-02-20 cs.IT cs.LG math.IT 79%

Deep Reinforcement Learning for mmWave Initial Beam Alignment

Daniel Tandler, Sebastian Dörner, Marc Gauger, Stephan ten Brink

专题命中 安全训练 :alignment(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.06998 2022-12-15 cs.LG cs.RO 79%

Safety Correction from Baseline: Towards the Risk-aware Policy in Robotics via Dual-agent Reinforcement Learning

Linrui Zhang, Zichen Yan, Li Shen, Shoujie Li, Xueqian Wang, Dacheng Tao

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments The 2022 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.07874 2022-12-07 cs.SE cs.LG 79%

Ergo, SMIRK is Safe: A Safety Case for a Machine Learning Component in a Pedestrian Automatic Emergency Brake System

Markus Borg, Jens Henriksson, Kasper Socha, Olof Lennartsson, Elias Sonnsjö Lönegren, Thanh Bui, Piotr Tomaszewski, Sankar Raman Sathyamoorthy, Sebastian Brink, Mahshid Helali Moghadam

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments Accepted for publication in Software Quality Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.01498 2022-11-04 cs.LG stat.ML 79%

On the Safety of Interpretable Machine Learning: A Maximum Deviation Approach

Dennis Wei, Rahul Nair, Amit Dhurandhar, Kush R. Varshney, Elizabeth M. Daly, Moninder Singh

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments Published at NeurIPS 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.05077 2022-10-17 cs.SE cs.LG 79%

Black-box Safety Analysis and Retraining of DNNs based on Feature Extraction and Clustering

Mohammed Oualid Attaoui, Hazem Fahmy, Fabrizio Pastore, Lionel Briand

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments 41 pages, 12 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.05969 2022-09-12 cs.LG cs.CR cs.SE 79%

Safety and Performance, Why not Both? Bi-Objective Optimized Model Compression toward AI Software Deployment

Jie Zhu, Leye Wang, Xiao Han

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments Accepted by ASE2022. Camera-ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.04803 2022-08-10 cs.LG cs.RO 79%

Exploring the trade off between human driving imitation and safety for traffic simulation

Yann Koeberle, Stefano Sabatini, Dzmitry Tsishkou, Christophe Sabourin

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.07369 2022-07-25 cs.LG cs.SY eess.SY math.OC 79%

Learning for MPC with Stability & Safety Guarantees

Sébastien Gros, Mario Zanon

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.00886 2022-06-03 cs.RO cs.LG 79%

Watch Out for the Safety-Threatening Actors: Proactively Mitigating Safety Hazards

Saurabh Jha, Shengkun Cui, Zbigniew Kalbarczyk, Ravishankar K. Iyer

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.01419 2022-05-04 cs.RO cs.CV cs.FL cs.LG cs.SY eess.SY 79%

An Empirical Analysis of the Use of Real-Time Reachability for the Safety Assurance of Autonomous Vehicles

Patrick Musau, Nathaniel Hamilton, Diego Manzanas Lopez, Preston Robinette, Taylor T. Johnson

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments 30 pages, 12 Figures, Submitted to Artificial Intelligence's Special Issue on "Risk-Aware Autonomous Systems: Theory and Practice."

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.12045 2022-04-15 cs.LG cs.SE 79%

How to Certify Machine Learning Based Safety-critical Systems? A Systematic Literature Review

Florian Tambon, Gabriel Laberge, Le An, Amin Nikanjam, Paulina Stevia Nouwou Mindom, Yann Pequignot, Foutse Khomh, Giulio Antoniol, Ettore Merlo, François Laviolette

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments 60 pages (92 pages with references and complements), submitted to a journal (Automated Software Engineering). Changes: Emphasizing difference traditional software engineering / ML approach. Adding Related Works, Threats to Validity and Complementary Materials. Adding a table listing papers reference for each section/subsections

Journal ref Autom Softw Eng 29, 38 (2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.05135 2022-03-30 cs.LG cs.CV 79%

PixMix: Dreamlike Pictures Comprehensively Improve Safety Measures

Dan Hendrycks, Andy Zou, Mantas Mazeika, Leonard Tang, Bo Li, Dawn Song, Jacob Steinhardt

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments CVPR 2022. Code and models are available at https://github.com/andyzoujm/pixmix

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.02331 2022-02-22 cs.AI 79%

Safety Enhancement for Deep Reinforcement Learning in Autonomous Separation Assurance

Wei Guo, Marc Brittain, Peng Wei

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.01781 2022-02-07 cs.CV cs.AI 79%

Predicting the impact of urban change in pedestrian and road safety

Cristina Bustos, Daniel Rhoads, Agata Lapedriza, Javier Borge-Holthoefer, Albert Solé-Ribalta

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.12210 2021-12-30 cs.LG cs.SY eess.SY 79%

ProBF: Learning Probabilistic Safety Certificates with Barrier Functions

Athindran Ramesh Kumar, Sulin Liu, Jaime F. Fisac, Ryan P. Adams, Peter J. Ramadge

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments Presented at NeurIPS 2021 workshop - Safe and Robust Control of Uncertain Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.14324 2021-11-30 cs.LG 79%

Is the Rush to Machine Learning Jeopardizing Safety? Results of a Survey

Mehrnoosh Askarpour, Alan Wassyng, Mark Lawford, Richard Paige, Zinovy Diskin

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.12151 2021-11-25 cs.LG stat.ML 79%

Best Arm Identification with Safety Constraints

Zhenlin Wang, Andrew Wagenmaker, Kevin Jamieson

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.04865 2021-11-11 cs.LG 79%

On Assessing The Safety of Reinforcement Learning algorithms Using Formal Methods

Paulina Stevia Nouwou Mindom, Amin Nikanjam, Foutse Khomh, John Mullins

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.00099 2021-11-01 cs.LG 79%

Multi-Objective SPIBB: Seldonian Offline Policy Improvement with Safety Constraints in Finite MDPs

Harsh Satija, Philip S. Thomas, Joelle Pineau, Romain Laroche

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.14325 2021-09-30 cs.RO cs.AI 79%

Improving Safety in Deep Reinforcement Learning using Unsupervised Action Planning

Hao-Lun Hsu, Qiuhua Huang, Sehoon Ha

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.11288 2021-09-24 cs.RO cs.LG 79%

Enhancing Navigational Safety in Crowded Environments using Semantic-Deep-Reinforcement-Learning-based Navigation

Linh Kästner, Junhui Li, Zhengcheng Shen, Jens Lambrecht

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments 7 pages, 5 figures, 2021 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.07316 2021-07-16 cs.RO cs.AI 79%

Minimizing Safety Interference for Safe and Comfortable Automated Driving with Distributional Reinforcement Learning

Danial Kamran, Tizian Engelgeh, Marvin Busch, Johannes Fischer, Christoph Stiller

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.09726 2021-03-18 cs.LG cs.SY eess.SY 79%

Weakly Supervised Reinforcement Learning for Autonomous Highway Driving via Virtual Safety Cages

Sampo Kuutti, Richard Bowden, Saber Fallah

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments Published in Sensors

Journal ref Sensors 2021, 21, 2032

详情

展开后加载摘要…

URL PDF HTML 收藏
2012.00314 2020-12-02 cs.LG stat.ML 79%

Decentralized Multi-Agent Linear Bandits with Safety Constraints

Sanae Amani, Christos Thrampoulidis

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2010.16001 2020-11-02 eess.SY cs.LG cs.SY math.OC stat.ML 79%

Guaranteeing Safety of Learned Perception Modules via Measurement-Robust Control Barrier Functions

Sarah Dean, Andrew J. Taylor, Ryan K. Cosner, Benjamin Recht, Aaron D. Ames

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏