arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3278 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3278 篇

2003.04371 2022-09-07 cs.AI cs.LG cs.SY eess.SY 62%

A Multi-Agent Reinforcement Learning Approach For Safe and Efficient Behavior Planning Of Connected Autonomous Vehicles

Songyang Han, Shanglin Zhou, Jiangwei Wang, Lynn Pepin, Caiwen Ding, Jie Fu, Fei Miao

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments This paper is submitted to IEEE Transactions on Intelligent Transportation Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.08345 2022-08-25 cs.AI cs.LG 62%

Discovering Agents

Zachary Kenton, Ramana Kumar, Sebastian Farquhar, Jonathan Richens, Matt MacDermott, Tom Everitt

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Some typos corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.07307 2022-08-16 cs.RO cs.AI cs.LG 62%

Towards Robust On-Ramp Merging via Augmented Multimodal Reinforcement Learning

Gaurav Bagwe, Jian Li, Xiaoyong Yuan, Lan Zhang

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.03815 2022-08-12 cs.CL cs.AI 62%

Beyond Distributional Hypothesis: Let Language Models Learn Meaning-Text Correspondence

Myeongjun Jang, Frank Mtumbuka, Thomas Lukasiewicz

专题命中 安全训练 :trustworthy(abstract);分类 cs.CL、cs.AI

Comments Accepted in the Findings of NAACL 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.00762 2022-07-29 cs.LG cs.AI cs.CR 62%

Execute Order 66: Targeted Data Poisoning for Reinforcement Learning

Harrison Foley, Liam Fowl, Tom Goldstein, Gavin Taylor

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

Comments Workshop on Safe and Robust Control of Uncertain Systems at the 35th Conference on Neural Information Processing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.10283 2022-07-26 cs.RO cs.AI cs.LG cs.NE 62%

Adding Neural Network Controllers to Behavior Trees without Destroying Performance Guarantees

Christopher Iliffe Sprague, Petter Ögren

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted as Regular Paper to The 61th IEEE Conference on Decision and Control (CDC 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.08651 2022-07-19 cs.LG cs.AI 62%

Boolean Decision Rules for Reinforcement Learning Policy Summarisation

James McCarthy, Rahul Nair, Elizabeth Daly, Radu Marinescu, Ivana Dusparic

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.09424 2022-07-07 cs.LG cs.AI cs.GT 62%

SAAC: Safe Reinforcement Learning as an Adversarial Game of Actor-Critics

Yannis Flet-Berliac, Debabrota Basu

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted at the 5th Multi-disciplinary Conference on Reinforcement Learning and Decision Making (RLDM 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.01497 2022-07-05 cs.CY cs.LG 62%

Aligning Artificial Intelligence with Humans through Public Policy

John Nay, James Daily

专题命中 安全训练 :alignment(abstract);分类 cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.05030 2022-06-22 cs.RO cs.AI cs.LG cs.SY eess.SY 62%

DQ-GAT: Towards Safe and Efficient Autonomous Driving with Deep Q-Learning and Graph Attention Networks

Peide Cai, Hengli Wang, Yuxiang Sun, Ming Liu

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted to IEEE Transactions on Intelligent Transportation Systems (T-ITS), 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.11814 2022-06-20 cs.LG cs.AI math.OC 62%

Penalized Proximal Policy Optimization for Safe Reinforcement Learning

Linrui Zhang, Li Shen, Long Yang, Shixiang Chen, Bo Yuan, Xueqian Wang, Dacheng Tao

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments IJCAI2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.11672 2022-06-13 eess.SY cs.AI cs.LG cs.SY 62%

A Multi-Agent Deep Reinforcement Learning Coordination Framework for Connected and Automated Vehicles at Merging Roadways

Sai Krishna Sumanth Nakka, Behdad Chalaki, Andreas Malikopoulos

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 6 pages, 6 figures

Journal ref 2022 American Control Conference (ACC), (2022), 3297-3302

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.02953 2022-05-11 cs.RO cs.AI cs.CV cs.LG cs.SY eess.SY 62%

Learn-to-Race Challenge 2022: Benchmarking Safe Learning and Cross-domain Generalisation in Autonomous Racing

Jonathan Francis, Bingqing Chen, Siddha Ganju, Sidharth Kathpal, Jyotish Poonganam, Ayush Shivani, Vrushank Vyas, Sahika Genc, Ivan Zhukov, Max Kumskoy, Anirudh Koul, Jean Oh, Eric Nyberg

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 20 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.03537 2022-05-10 cs.CR cs.AI cs.LG 62%

Anomaly Detection in Intra-Vehicle Networks

Ajeet Kumar Dwivedi

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.11788 2022-04-26 cs.AI cs.HC cs.LG 62%

Human-AI Collaboration via Conditional Delegation: A Case Study of Content Moderation

Vivian Lai, Samuel Carton, Rajat Bhatnagar, Q. Vera Liao, Yunfeng Zhang, Chenhao Tan

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments 18 pages, 44 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.08957 2022-04-20 cs.LG cs.AI 62%

COptiDICE: Offline Constrained Reinforcement Learning via Stationary Distribution Correction Estimation

Jongmin Lee, Cosmin Paduraru, Daniel J. Mankowitz, Nicolas Heess, Doina Precup, Kee-Eung Kim, Arthur Guez

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 24 pages, 6 figures, Accepted at ICLR 2022 (spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.06509 2022-04-14 cs.LG cs.AI cs.RO 62%

Safer Autonomous Driving in a Stochastic, Partially-Observable Environment by Hierarchical Contingency Planning

Ugo Lecerf, Christelle Yemdji-Tchassi, Pietro Michiardi

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments To appear in Generalizable Policy Learning in the Physical World workshop (ICLR 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.13112 2022-02-25 cs.LG cs.AI 62%

A Survey on Interpretable Reinforcement Learning

Claire Glanois, Paul Weng, Matthieu Zimmer, Dong Li, Tianpei Yang, Jianye Hao, Wulong Liu

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.10341 2022-02-22 cs.LG cs.AI cs.RO 62%

Efficient Learning of Safe Driving Policy via Human-AI Copilot Optimization

Quanyi Li, Zhenghao Peng, Bolei Zhou

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Quanyi Li and Zhenghao Peng contribute equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.07565 2022-02-16 cs.LG cs.AI 62%

CUP: A Conservative Update Policy Algorithm for Safe Reinforcement Learning

Long Yang, Jiaming Ji, Juntao Dai, Yu Zhang, Pengfei Li, Gang Pan

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.05123 2022-02-11 cs.LG cs.AI 62%

Unaligned but Safe -- Formally Compensating Performance Limitations for Imprecise 2D Object Detection

Tobias Schuster, Emmanouil Seferis, Simon Burton, Chih-Hong Cheng

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.14705 2021-12-30 cs.RO cs.AI cs.LG 62%

Lane Change Decision-Making through Deep Reinforcement Learning

Mukesh Ghimire, Malobika Roy Choudhury, Guna Sekhar Sai Harsha Lagudu

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.12490 2021-12-30 cs.AI cs.LG cs.RO 62%

Curriculum Learning for Safe Mapless Navigation

Luca Marzari, Davide Corsi, Enrico Marchesini, Alessandro Farinelli

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 8 pages, 5 figures. The poster version of this paper has been accepted by The 37th ACM/SIGAPP Symposium on Applied Computing Proceedings (SAC IRMAS 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.10459 2021-12-21 eess.SY cs.AI cs.LG cs.SY 62%

Safe multi-agent deep reinforcement learning for joint bidding and maintenance scheduling of generation units

Pegah Rokhforoz, Olga Fink

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.07385 2021-12-07 cs.RO cs.AI cs.LG cs.SY eess.SY stat.ML 62%

Enhancing Lattice-based Motion Planning with Introspective Learning and Reasoning

Mattias Tiger, David Bergström, Andreas Norrstig, Fredrik Heintz

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.07699 2021-12-02 cs.RO cs.AI cs.LG cs.SY eess.SY 62%

Safe Autonomous Racing via Approximate Reachability on Ego-vision

Bingqing Chen, Jonathan Francis, Jean Oh, Eric Nyberg, Sylvia L. Herbert

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 17 pages, 15 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.12953 2021-11-29 cs.LG cs.AI cs.RO cs.SY eess.SY 62%

Learn Zero-Constraint-Violation Policy in Model-Free Constrained Reinforcement Learning

Haitong Ma, Changliu Liu, Shengbo Eben Li, Sifa Zheng, Wenchao Sun, Jianyu Chen

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.04894 2021-11-10 cs.LG cs.AI cs.RO 62%

Safe Policy Optimization with Local Generalized Linear Function Approximations

Akifumi Wachi, Yunyue Wei, Yanan Sui

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 18 pages, 6 figures, Accepted to NeurIPS-21

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.04775 2021-09-22 cs.LG cs.AI cs.RO 62%

LS3: Latent Space Safe Sets for Long-Horizon Visuomotor Control of Sparse Reward Iterative Tasks

Albert Wilcox, Ashwin Balakrishna, Brijen Thananjeyan, Joseph E. Gonzalez, Ken Goldberg

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Conference on Robot Learning (CoRL) 2021. First two authors contributed equally

Journal ref Conference on Robot Learning (CoRL) 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.06689 2021-09-15 cs.MA cs.AI cs.LG 62%

Reactive and Safe Road User Simulations using Neural Barrier Certificates

Yue Meng, Zengyi Qin, Chuchu Fan

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted at IROS 2021

详情

展开后加载摘要…

URL PDF HTML 收藏