arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3281 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3281 篇

2402.17393 2024-02-28 cs.CY 57%

Designing Chatbots to Support Victims and Survivors of Domestic Abuse

Rahime Belen Saglam, Jason R. C. Nurse, Lisa Sugiura

专题命中 安全训练 :safety(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16569 2024-02-28 cs.CV cs.LG 57%

Pretrained Visual Uncertainties

Michael Kirchhof, Mark Collier, Seong Joon Oh, Enkelejda Kasneci

专题命中 安全训练 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16036 2024-02-27 cs.RO cs.CV cs.LG 57%

Machine Learning-Based Vehicle Intention Trajectory Recognition and Prediction for Autonomous Driving

Hanyi Yu, Shuning Huo, Mengran Zhu, Yulu Gong, Yafei Xiang

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13408 2024-02-22 cs.CL 57%

Healthcare Copilot: Eliciting the Power of General LLMs for Medical Consultation

Zhiyao Ren, Yibing Zhan, Baosheng Yu, Liang Ding, Dacheng Tao

专题命中 安全训练 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.01602 2024-02-20 cs.RO cs.AI 57%

DRNet: A Decision-Making Method for Autonomous Lane Changingwith Deep Reinforcement Learning

Kunpeng Xu, Lifei Chen, Shengrui Wang

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09387 2024-02-15 physics.plasm-ph cs.LG 57%

Active Disruption Avoidance and Trajectory Design for Tokamak Ramp-downs with Neural Differential Equations and Reinforcement Learning

Allen M. Wang, Oswin So, Charles Dawson, Darren T. Garnier, Cristina Rea, Chuchu Fan

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08968 2024-02-15 cs.AI 57%

GrounDial: Human-norm Grounded Safe Dialog Response Generation

Siwon Kim, Shuyang Dai, Mohammad Kachuee, Shayan Ray, Tara Taghavi, Sungroh Yoon

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments Accepted to findings of EACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10949 2024-01-26 cs.MA cs.LG cs.SY eess.SY 57%

The Synergy Between Optimal Transport Theory and Multi-Agent Reinforcement Learning

Ali Baheri, Mykel J. Kochenderfer

专题命中 安全训练 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.05876 2024-01-12 cs.LG cs.RO 57%

Safe reinforcement learning in uncertain contexts

Dominik Baumann, Thomas B. Schön

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments Accepted final version to appear in the IEEE Transactions on Robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.11314 2023-12-19 cs.LG cs.LO cs.SY eess.SY 57%

Safeguarded Progress in Reinforcement Learning: Safe Bayesian Exploration for Control Policy Synthesis

Rohan Mitta, Hosein Hasanbeig, Jun Wang, Daniel Kroening, Yiannis Kantaros, Alessandro Abate

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.05890 2023-12-12 cs.AI 57%

Scaling #DNN-Verification Tools with Efficient Bound Propagation and Parallel Computing

Luca Marzari, Gabriele Roncolato, Alessandro Farinelli

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments Accepted at AIRO 2023 the 10th Italian Workshop on Artificial Intelligence and Robotics co-located with the 22nd International Conference of the Italian Association for Artificial Intelligence (AI*IA 2023), Rome, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03296 2023-12-07 cs.RO cs.CV cs.LG 57%

Cooperative Probabilistic Trajectory Forecasting under Occlusion

Anshul Nayak, Azim Eskandarian

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments 10 pages, 13 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01350 2023-12-05 cs.AI 57%

Honesty Is the Best Policy: Defining and Mitigating AI Deception

Francis Rhys Ward, Francesco Belardinelli, Francesca Toni, Tom Everitt

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments Accepted as a spotlight at the 37th Conference on Neural Information Processing Systems (NeurIPS 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.10538 2023-12-05 cs.AI 57%

Testing Language Model Agents Safely in the Wild

Silen Naihin, David Atkinson, Marc Green, Merwane Hamadi, Craig Swift, Douglas Schonholtz, Adam Tauman Kalai, David Bau

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.06750 2023-11-21 cs.LG 57%

Provably Safe Reinforcement Learning: Conceptual Analysis, Survey, and Benchmarking

Hanna Krasowski, Jakob Thumm, Marlon Müller, Lukas Schäfer, Xiao Wang, Matthias Althoff

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments The published paper is available at https://openreview.net/forum?id=mcN0ezbnzO

Journal ref Transactions on Machine Learning Research, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07426 2023-11-14 cs.LG cs.CV cs.HC 57%

Optimising Human-AI Collaboration by Learning Convincing Explanations

Alex J. Chan, Alihan Huyuk, Mihaela van der Schaar

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.00171 2023-11-02 cs.RO cs.LG cs.SY eess.SY math.OC 57%

Active Uncertainty Reduction for Safe and Efficient Interaction Planning: A Shielding-Aware Dual Control Approach

Haimin Hu, David Isele, Sangjae Bae, Jaime F. Fisac

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments The International Journal of Robotics Research. arXiv admin note: text overlap with arXiv:2202.07720

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.06541 2023-10-24 cs.CL 57%

Towards Agile Text Classifiers for Everyone

Maximilian Mozes, Jessica Hoffmann, Katrin Tomanek, Muhamed Kouate, Nithum Thain, Ann Yuan, Tolga Bolukbasi, Lucas Dixon

专题命中 安全训练 :safety(abstract);分类 cs.CL

Comments Findings of EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.12432 2023-10-20 cs.LG 57%

CAT: Closed-loop Adversarial Training for Safe End-to-End Driving

Linrui Zhang, Zhenghao Peng, Quanyi Li, Bolei Zhou

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments 7th Conference on Robot Learning (CoRL 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.07850 2023-10-19 cs.CL 57%

Attention as a Guide for Simultaneous Speech Translation

Sara Papi, Matteo Negri, Marco Turchi

专题命中 安全训练 :alignment(abstract);分类 cs.CL

Comments Accepted to ACL 2023

Journal ref Proceedings of ACL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.13807 2023-10-17 cs.SE cs.LG cs.NE cs.RO 57%

Identifying the Hazard Boundary of ML-enabled Autonomous Systems Using Cooperative Co-Evolutionary Search

Sepehr Sharifi, Donghwan Shin, Lionel C. Briand, Nathan Aschbacher

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments Accepted for publication by IEEE Transactions on Software Engineering (TSE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.09426 2023-10-17 cs.LG stat.ML 57%

Offline Reinforcement Learning for Optimizing Production Bidding Policies

Dmytro Korenkevych, Frank Cheng, Artsiom Balakir, Alex Nikulkov, Lingnan Gao, Zhihao Cen, Zuobing Xu, Zheqing Zhu

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.09360 2023-10-17 cs.LG 57%

Exact Verification of ReLU Neural Control Barrier Functions

Hongchao Zhang, Junlin Wu, Yevgeniy Vorobeychik, Andrew Clark

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.15252 2023-09-28 cs.RO cs.LG 57%

V2X-Lead: LiDAR-based End-to-End Autonomous Driving with Vehicle-to-Everything Communication Integration

Zhiyun Deng, Yanjun Shi, Weiming Shen

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments To be published in IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.14003 2023-09-26 cs.LG cs.RO 57%

Hierarchical Imitation Learning for Stochastic Environments

Maximilian Igl, Punit Shah, Paul Mougin, Sirish Srinivasan, Tarun Gupta, Brandyn White, Kyriacos Shiarlis, Shimon Whiteson

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments Published at IROS'23

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.12560 2023-09-25 cs.RO cs.AI 57%

Machine Learning Meets Advanced Robotic Manipulation

Saeid Nahavandi, Roohallah Alizadehsani, Darius Nahavandi, Chee Peng Lim, Kevin Kelly, Fernando Bello

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.05812 2023-09-13 eess.SY cs.LG cs.SY 57%

Safe Reinforcement Learning for Strategic Bidding of Virtual Power Plants in Day-Ahead Markets

Ognjen Stanojev, Lesia Mitridati, Riccardo de Nardis di Prata, Gabriela Hug

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.02812 2023-09-07 cs.CL 57%

Agent-based simulation of pedestrians' earthquake evacuation; application to Beirut, Lebanon

Rouba Iskandar, Kamel Allaw, Julie Dugdale, Elise Beck, Jocelyne Adjizian-Gérard, Cécile Cornou, Jacques Harb, Pascal Lacroix, Nada Badaro-Saliba, Stéphane Cartier, Rita Zaarour

专题命中 安全训练 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.02328 2023-09-06 cs.RO cs.AI cs.SY eess.SY stat.ML 57%

Neurosymbolic Meta-Reinforcement Lookahead Learning Achieves Safe Self-Driving in Non-Stationary Environments

Haozhe Lei, Quanyan Zhu

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.01918 2023-09-06 cs.RO cs.LG 57%

RoboAgent: Generalization and Efficiency in Robot Manipulation via Semantic Augmentations and Action Chunking

Homanga Bharadhwaj, Jay Vakil, Mohit Sharma, Abhinav Gupta, Shubham Tulsiani, Vikash Kumar

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏