arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3281 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3281 篇

2308.15985 2023-08-31 cs.AI 57%

Vision-Based Traffic Accident Detection and Anticipation: A Survey

Jianwu Fang, iahuan Qiao, Jianru Xue, Zhengguo Li

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments accepted in IEEE Transactions on Circuits and Systems for Video Technology; 16 pages, 155 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.17250 2023-08-30 cs.RO cs.LG cs.SY eess.SY 57%

Safe and Efficient Reinforcement Learning Using Disturbance-Observer-Based Control Barrier Functions

Yikun Cheng, Pan Zhao, Naira Hovakimyan

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.13491 2023-08-28 cs.RO cs.AI 57%

Towards Optimal Head-to-head Autonomous Racing with Curriculum Reinforcement Learning

Dvij Kalaria, Qin Lin, John M. Dolan

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments Submitted to MAD games IROS workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.05585 2023-08-11 cs.AI 57%

Proximal Policy Optimization Actual Combat: Manipulating Output Tokenizer Length

Miao Fan, Chen Hu, Shuchang Zhou

专题命中 安全训练 :RLHF(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04178 2023-08-09 cs.AI cs.RO 57%

Assistive Chatbots for healthcare: a succinct review

Basabdatta Sen Bhattacharya, Vibhav Sinai Pissurlenkar

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.04927 2023-07-13 cs.LG cs.LO 57%

Probabilistic Counterexample Guidance for Safer Reinforcement Learning (Extended Version)

Xiaotong Ji, Antonio Filieri

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments Accepted and Evaluated by the 20th International Conference on Quantitative Evaluation of Systems 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.14816 2023-06-27 cs.AI 57%

Experiments with Detecting and Mitigating AI Deception

Ismail Sahbane, Francis Rhys Ward, C Henrik Åslund

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI

Comments 4 pages, 2 figures, 3 algorithms, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.07749 2023-06-14 cs.LG cs.GT cs.MA 57%

Provably Learning Nash Policies in Constrained Markov Potential Games

Pragnya Alatur, Giorgia Ramponi, Niao He, Andreas Krause

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1902.00778 2023-06-07 cs.LG stat.ML 57%

Certified Reinforcement Learning with Logic Guidance

Hosein Hasanbeig, Daniel Kroening, Alessandro Abate

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17568 2023-05-30 cs.LG math.OC 57%

Scalable Primal-Dual Actor-Critic Method for Safe Multi-Agent RL with General Utilities

Donghao Ying, Yunkai Zhang, Yuhao Ding, Alec Koppel, Javad Lavaei

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments 50 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.06789 2023-05-26 eess.SY cs.LG cs.SY 57%

Grid-SiPhyR: An end-to-end learning to optimize framework for combinatorial problems in power systems

Rabab Haider, Anuradha M. Annaswamy

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments 36 pages, 5 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13467 2023-05-24 cs.RO cs.AI 57%

Risk-aware Safe Control for Decentralized Multi-agent Systems via Dynamic Responsibility Allocation

Yiwei Lyu, Wenhao Luo, John M. Dolan

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.13844 2023-05-18 cs.AI cs.MA 57%

Safe Multi-agent Learning via Trapping Regions

Aleksander Czechowski, Frans A. Oliehoek

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.06796 2023-05-16 cs.LG cs.SY eess.SY 57%

Towards Theoretical Understanding of Data-Driven Policy Refinement

Ali Baheri

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments Accepted at the "Bridging the Gap Between AI Planning and Reinforcement Learning (PRL)" workshop at ICAPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.00576 2023-05-02 eess.SY cs.LG cs.SY 57%

Joint Learning of Policy with Unknown Temporal Constraints for Safe Reinforcement Learning

Lunet Yifru, Ali Baheri

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments Accepted at the "Bridging the Gap Between AI Planning and Reinforcement Learning (PRL)" workshop at ICAPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.11104 2023-04-24 cs.AI 57%

Approximate Shielding of Atari Agents for Safe Exploration

Alexander W. Goodall, Francesco Belardinelli

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments Accepted for presentation at the ALA workshop as part of AAMAS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.06608 2023-04-24 cs.SE cs.LG 57%

Toward Unsupervised Test Scenario Extraction for Automated Driving Systems from Urban Naturalistic Road Traffic Data

Nico Weber, Christoph Thiem, Ulrich Konigorski

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments 16 pages, 9 figures

Journal ref SAE Intl. J CAV 6(3):2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.10000 2023-04-21 math.OC cs.LG q-bio.QM 57%

Model Based Reinforcement Learning for Personalized Heparin Dosing

Qinyang He, Yonatan Mintz

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments 48 pages 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.01435 2023-04-05 cs.LG cs.SY eess.SY 57%

Optimizing Irrigation Efficiency using Deep Reinforcement Learning in the Field

Xianzhong Ding, Wan Du

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments 15 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.14057 2023-03-23 cs.LG stat.ML 57%

Safe Exploration Incurs Nearly No Additional Sample Complexity for Reward-free RL

Ruiquan Huang, Jing Yang, Yingbin Liang

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments Accepted by ICLR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.00691 2023-03-21 cs.RO cs.FL cs.LG 57%

Falsification-Based Robust Adversarial Reinforcement Learning

Xiao Wang, Saasha Nair, Matthias Althoff

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments 8 pages, 4 figures

Journal ref IEEE International Conference on Machine Learning and Applications (ICMLA), 2020, pp. 205-212

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.09070 2023-03-17 cs.CY 57%

LCS-TF: Multi-Agent Deep Reinforcement Learning-Based Intelligent Lane-Change System for Improving Traffic Flow

Lokesh Chandra Das, Myounggyu Won

专题命中 安全训练 :safety(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.10691 2023-03-15 cs.RO cs.LG cs.SY eess.SY 57%

Provably Safe Reinforcement Learning via Action Projection using Reachability Analysis and Polynomial Zonotopes

Niklas Kochdumper, Hanna Krasowski, Xiao Wang, Stanley Bak, Matthias Althoff

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.02300 2023-03-15 cs.RO cs.AI cs.MA 57%

Spatial-Temporal-Aware Safe Multi-Agent Reinforcement Learning of Connected Autonomous Vehicles in Challenging Scenarios

Zhili Zhang, Songyang Han, Jiangwei Wang, Fei Miao

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments This paper has been accepted by the 2023 IEEE International Conference on Robotics and Automation (ICRA 2023). 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.04212 2023-03-09 cs.RO cs.LG 57%

ConBaT: Control Barrier Transformer for Safe Policy Learning

Yue Meng, Sai Vemprala, Rogerio Bonatti, Chuchu Fan, Ashish Kapoor

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.04118 2023-03-08 cs.RO cs.LG 57%

A Multiplicative Value Function for Safe and Efficient Reinforcement Learning

Nick Bührer, Zhejun Zhang, Alexander Liniger, Fisher Yu, Luc Van Gool

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments Repository available at https://github.com/nikeke19/Safe-Mult-RL

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.00152 2023-03-06 cs.RO cs.AI 57%

Human-AI Shared Control via Policy Dissection

Quanyi Li, Zhenghao Peng, Haibin Wu, Lan Feng, Bolei Zhou

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.14468 2023-03-02 cs.LG 57%

DESTA: A Framework for Safe Reinforcement Learning with Markov Games of Intervention

David Mguni, Usman Islam, Yaqi Sun, Xiuling Zhang, Joel Jennings, Aivar Sootla, Changmin Yu, Ziyan Wang, Jun Wang, Yaodong Yang

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments arXiv admin note: text overlap with arXiv:2103.09159

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.14148 2023-03-01 cs.LG 57%

Guiding Safe Exploration with Weakest Preconditions

Greg Anderson, Swarat Chaudhuri, Isil Dillig

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.12320 2023-02-27 math.OC cs.LG cs.SY eess.SY 57%

Dynamic Regret Analysis of Safe Distributed Online Optimization for Convex and Non-convex Problems

Ting-Jui Chang, Sapana Chaudhary, Dileep Kalathil, Shahin Shahrampour

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏