arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3278 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3278 篇

2304.13191 2023-04-27 cs.AI cs.CL 62%

Towards Explainable and Safe Conversational Agents for Mental Health: A Survey

Surjodeep Sarkar, Manas Gaur, L. Chen, Muskan Garg, Biplav Srivastava, Bhaktee Dongaonkar

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

Comments 10 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.01728 2023-04-25 cs.LG cs.AI cs.RO 62%

Guarded Policy Optimization with Imperfect Online Demonstrations

Zhenghai Xue, Zhenghao Peng, Quanyi Li, Zhihan Liu, Bolei Zhou

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted at ICLR 2023 (top 25%)

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.12558 2023-04-24 cs.LG cs.AI 62%

Wasserstein Auto-encoded MDPs: Formal Verification of Efficiently Distilled RL Policies with Many-sided Guarantees

Florent Delgrange, Ann Nowé, Guillermo A. Pérez

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments ICLR 2023, 10 pages main text, 14 pages appendix (excluding references)

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.09448 2023-04-20 cs.LG cs.CL cs.CV 62%

EC^2: Emergent Communication for Embodied Control

Yao Mu, Shunyu Yao, Mingyu Ding, Ping Luo, Chuang Gan

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG

Comments Published in CVPR2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.06281 2023-04-14 cs.LG cs.AI cs.MA cs.RO 62%

Model-based Dynamic Shielding for Safe and Efficient Multi-Agent Reinforcement Learning

Wenli Xiao, Yiwei Lyu, John Dolan

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted in AAMAS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.03081 2023-04-07 cs.LG cs.AI 62%

Safe MDP Planning by Learning Temporal Patterns of Undesirable Trajectories and Averting Negative Side Effects

Siow Meng Low, Akshat Kumar, Scott Sanner

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.15452 2023-03-21 cs.LG cs.AI cs.SY eess.SY stat.ML 62%

Safe Exploration Method for Reinforcement Learning under Existence of Disturbance

Yoshihiro Okawa, Tomotake Sasaki, Hitoshi Yanami, Toru Namerikawa

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted by the European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECMLPKDD) 2022. The Version of Record is available at https://doi.org/10.1007/978-3-031-26412-2_9

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.08187 2023-03-16 cs.LG cs.AI 62%

Vehicle lateral control using Machine Learning for automated vehicle guidance

Akash Fogla, Kanish Kumar, Sunnay Saurav, Bishnu ramanujan

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.10416 2023-03-15 cs.LG cs.CY eess.SP 62%

CycleSense: Detecting Near Miss Incidents in Bicycle Traffic from Mobile Motion Sensors

Ahmet-Serdar Karakaya, Thomas Ritter, Felix Biessmann, David Bermbach

专题命中 安全训练 :safety(abstract);分类 cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.03226 2023-03-07 cs.AI cs.LG 62%

Safe Reinforcement Learning via Probabilistic Logic Shields

Wen-Chi Yang, Giuseppe Marra, Gavin Rens, Luc De Raedt

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.10030 2023-02-21 cs.AI cs.LG 62%

Safe Deep Reinforcement Learning by Verifying Task-Level Properties

Enrico Marchesini, Luca Marzari, Alessandro Farinelli, Christopher Amato

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted at the 22nd International Conference on Autonomous Agents and Multiagent Systems (AAMAS). Marchesini and Marzari contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.01751 2023-01-06 cs.CL cs.AI cs.HC 62%

Iterated Decomposition: Improving Science Q&A by Supervising Reasoning Processes

Justin Reppert, Ben Rachbach, Charlie George, Luke Stebbing, Jungwon Byun, Maggie Appleton, Andreas Stuhlmüller

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.08302 2022-12-19 cs.LG cs.AI 62%

Safe Evaluation For Offline Learning: Are We Ready To Deploy?

Hager Radi, Josiah P. Hanna, Peter Stone, Matthew E. Taylor

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2021 Workshop on Deployable Decision Making in Embodied Systems [Spotlight]

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.03412 2022-12-08 cs.CR cs.AI cs.CV cs.LG 62%

Artificial Intelligence Security Competition (AISC)

Yinpeng Dong, Peng Chen, Senyou Deng, Lianji L, Yi Sun, Hanyu Zhao, Jiaxing Li, Yunteng Tan, Xinyu Liu, Yangyi Dong, Enhui Xu, Jincai Xu, Shu Xu, Xuelin Fu, Changfeng Sun, Haoliang Han, Xuchong Zhang, Shen Chen, Zhimin Sun, Junyi Cao, Taiping Yao, Shouhong Ding, Yu Wu, Jian Lin, Tianpeng Wu, Ye Wang, Yu Fu, Lin Feng, Kangkang Gao, Zeyu Liu, Yuanzhe Pang, Chengqi Duan, Huipeng Zhou, Yajie Wang, Yuhang Zhao, Shangbo Wu, Haoran Lyu, Zhiyu Lin, Yifei Gao, Shuang Li, Haonan Wang, Jitao Sang, Chen Ma, Junhao Zheng, Yijia Li, Chao Shen, Chenhao Lin, Zhichao Cui, Guoshuai Liu, Huafeng Shi, Kun Hu, Mengxin Zhang

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments Technical report of AISC

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.02715 2022-12-07 eess.SY cs.AI cs.LG cs.SY math.OC 62%

Efficient Learning of Voltage Control Strategies via Model-based Deep Reinforcement Learning

Ramij R. Hossain, Tianzhixi Yin, Yan Du, Renke Huang, Jie Tan, Wenhao Yu, Yuan Liu, Qiuhua Huang

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.01375 2022-12-05 cs.RO cs.AI cs.LG 62%

Embedding Synthetic Off-Policy Experience for Autonomous Driving via Zero-Shot Curricula

Eli Bronstein, Sirish Srinivasan, Supratik Paul, Aman Sinha, Matthew O'Kelly, Payam Nikdel, Shimon Whiteson

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Published in CoRL 2022. Main text (8 pages, 3 figures) + acknowledgements and references (3 pages) + appendix (7 pages, 4 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.05308 2022-11-30 cs.LG cs.AI cs.SY eess.SY 62%

Learning Control Policies for Stochastic Systems with Reach-avoid Guarantees

Đorđe Žikelić, Mathias Lechner, Thomas A. Henzinger, Krishnendu Chatterjee

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted at AAAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.13474 2022-11-28 cs.LG cs.AI cs.RO 62%

Explainable and Safe Reinforcement Learning for Autonomous Air Mobility

Lei Wang, Hongyu Yang, Yi Lin, Suwan Yin, Yuankai Wu

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.11759 2022-11-23 cs.LG cs.AI cs.MA 62%

Learning Cooperative Oversubscription for Cloud by Chance-Constrained Multi-Agent Reinforcement Learning

Junjie Sheng, Lu Wang, Fangkai Yang, Bo Qiao, Hang Dong, Xiangfeng Wang, Bo Jin, Jun Wang, Si Qin, Saravan Rajmohan, Qingwei Lin, Dongmei Zhang

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.08730 2022-11-17 eess.SY cs.AI cs.LG cs.SY math.DS 62%

A framework for online, stabilizing reinforcement learning

Grigory Yaremenko, Georgiy Malaniya, Pavel Osinenko

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.07089 2022-11-10 cs.LG cs.AI 62%

Constrained Update Projection Approach to Safe Policy Optimization

Long Yang, Jiaming Ji, Juntao Dai, Linrui Zhang, Binbin Zhou, Pengfei Li, Yaodong Yang, Gang Pan

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted by NeurIPS2022. arXiv admin note: substantial text overlap with arXiv:2202.07565

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.06547 2022-11-07 cs.RO cs.AI cs.CV cs.LG 62%

LookOut: Diverse Multi-Future Prediction and Planning for Self-Driving

Alexander Cui, Sergio Casas, Abbas Sadat, Renjie Liao, Raquel Urtasun

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.01845 2022-11-04 cs.CR cs.AI cs.LG 62%

Reinforcement Learning based Cyberattack Model for Adaptive Traffic Signal Controller in Connected Transportation Systems

Muhammad Sami Irfan, Mizanur Rahman, Travis Atkison, Sagar Dasgupta, Alexander Hainen

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 18 pages, 12 figures, submitted to the Transportation Research Board 102nd Annual Meeting

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.14492 2022-10-27 cs.LG cs.AI stat.ML 62%

Provable Safe Reinforcement Learning with Binary Feedback

Andrew Bennett, Dipendra Misra, Nathan Kallus

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.11259 2022-10-21 cs.LG cs.AI cs.FL cs.RO 62%

Safe Policy Improvement in Constrained Markov Decision Processes

Luigi Berducci, Radu Grosu

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted for presentation at the International Symposium on Leveraging Applications of Formal Methods (ISoLA, 2022)

Journal ref LNCS 13701 (2022) 360-381;

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.00885 2022-10-19 cs.LG cs.AI 62%

DOPE: Doubly Optimistic and Pessimistic Exploration for Safe Reinforcement Learning

Archana Bura, Aria HasanzadeZonuzy, Dileep Kalathil, Srinivas Shakkottai, Jean-Francois Chamberland

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted to NeurIPS 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.05639 2022-10-14 cs.LG cs.AI 62%

Discovered Policy Optimisation

Chris Lu, Jakub Grudzien Kuba, Alistair Letcher, Luke Metz, Christian Schroeder de Witt, Jakob Foerster

专题命中 安全训练 :DPO(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.06380 2022-10-13 cs.LG cs.AI cs.MA cs.RO math.OC 62%

Near-Optimal Multi-Agent Learning for Safe Coverage Control

Manish Prajapat, Matteo Turchetta, Melanie N. Zeilinger, Andreas Krause

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted at NeurIPS 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.01801 2022-10-06 cs.LG cs.AI 62%

Safe Reinforcement Learning From Pixels Using a Stochastic Latent Representation

Yannick Hogewind, Thiago D. Simao, Tal Kachman, Nils Jansen

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.08351 2022-09-20 cs.LG cs.AI cs.MA cs.RO 62%

Sample-Efficient Multi-Agent Reinforcement Learning with Demonstrations for Flocking Control

Yunbo Qiu, Yuzhu Zhan, Yue Jin, Jian Wang, Xudong Zhang

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted by IEEE Vehicular Technology Conference (VTC) 2022-Fall

详情

展开后加载摘要…

URL PDF HTML 收藏