arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3281 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3281 篇

2503.02690 2025-03-05 cs.CE cs.LG physics.ao-ph 57%

Generative Modeling of Microweather Wind Velocities for Urban Air Mobility

Tristan A. Shah, Michael C. Stanley, James E. Warner

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments 17 pages, 13 figures, published in 2025 IEEE Aerospace Conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03415 2025-03-05 cs.CL 57%

Surgical, Cheap, and Flexible: Mitigating False Refusal in Language Models via Single Vector Ablation

Xinpeng Wang, Chengzhi Hu, Paul Röttger, Barbara Plank

专题命中 安全训练 :safety(abstract);分类 cs.CL

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16875 2025-03-03 cs.RO cs.LG 57%

Learning Multi-agent Multi-machine Tending by Mobile Robots

Abdalwhab Abdalwhab, Giovanni Beltrame, Samira Ebrahimi Kahou, David St-Onge

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments 8 pages, 4 figures, Accepted at an AAAI workshop (The Multi-Agent AI in the Real World Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04385 2025-02-26 cs.AI econ.TH math.OC 57%

Non-maximizing policies that fulfill multi-criterion aspirations in expectation

Simon Dima, Simon Fischer, Jobst Heitzig, Joss Oliver

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments 15 pages main text + 4 pages supplement. Slightly corrected version (corrections in blue in Eq. 11)

Journal ref In: Freeman, R., Mattei, N. (eds) Algorithmic Decision Theory. ADT 2024. Lecture Notes in Computer Science(), vol 15248. Springer, Cham (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16863 2025-02-25 cs.MA cs.LG cs.RO 57%

Leveraging Large Language Models for Effective and Explainable Multi-Agent Credit Assignment

Kartik Nagpal, Dayi Dong, Jean-Baptiste Bouvier, Negar Mehr

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments 8 pages+Appendix, 6 Figures, AAMAS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16449 2025-02-25 cs.AI cs.SY eess.SY 57%

Facilitating Emergency Vehicle Passage in Congested Urban Areas Using Multi-agent Deep Reinforcement Learning

Haoran Su

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments Ph.D. dissertation in Transportation Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15922 2025-02-25 cs.LG cs.RO 57%

On the Design of Safe Continual RL Methods for Control of Nonlinear Systems

Austin Coursey, Marcos Quinones-Grueiro, Gautam Biswas

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15766 2025-02-24 cs.CL 57%

CHBench: A Chinese Dataset for Evaluating Health in Large Language Models

Chenlu Guo, Nuo Xu, Yi Chang, Yuan Wu

专题命中 安全训练 :safety(abstract);分类 cs.CL

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18418 2025-02-13 cs.CL 57%

Know Your Limits: A Survey of Abstention in Large Language Models

Bingbing Wen, Jihan Yao, Shangbin Feng, Chenjun Xu, Yulia Tsvetkov, Bill Howe, Lucy Lu Wang

专题命中 安全训练 :safety(abstract);分类 cs.CL

Comments TACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14975 2025-02-11 cs.CV cs.AI 57%

Reflexive Guidance: Improving OoDD in Vision-Language Models via Self-Guided Image-Adaptive Concept Generation

Jihyo Kim, Seulbi Lee, Sangheum Hwang

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI

Comments Accepted at ICLR 2025. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02984 2025-02-06 cs.RO cs.LG cs.SY eess.SY 57%

Learning Efficient Flocking Control based on Gibbs Random Fields

Dengyu Zhang, Chenghao, Feng Xue, Qingrui Zhang

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13765 2025-02-04 cs.LG math.OC 57%

On the stability of gradient descent with second order dynamics for time-varying cost functions

Travis E. Gibson, Sawal Acharya, Anjali Parashar, Joseph E. Gaudio, Anurdha M. Annaswamy

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments Final accepted version of TMLR paper. https://openreview.net/forum?id=HlzjI2fn2T

Journal ref Transactions on Machine Learning Research (2025).

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11826 2025-02-04 cs.CL 57%

AdvisorQA: Towards Helpful and Harmless Advice-seeking Question Answering with Collective Intelligence

Minbeom Kim, Hwanhee Lee, Joonsuk Park, Hwaran Lee, Kyomin Jung

专题命中 安全训练 :harmlessness(abstract);分类 cs.CL

Comments 19 pages, 11 figures

Journal ref NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.05585 2025-01-28 math.OC cs.AI cs.RO 57%

Towards Robust Spacecraft Trajectory Optimization via Transformers

Yuji Takubo, Tommaso Guffanti, Daniele Gammelli, Marco Pavone, Simone D'Amico

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments Submitted to the IEEE Aerospace Conference 2025. 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11799 2025-01-22 cs.AI cs.LO math.LO 57%

Policy-Adaptable Methods For Resolving Normative Conflicts Through Argumentation and Graph Colouring

Johnny Joyce

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments Written and submitted as master's thesis for University of Southampton in 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09913 2025-01-20 cs.AI 57%

Towards A Litmus Test for Common Sense

Hugo Latapie

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08941 2025-01-16 cs.MA cs.LG cs.RO 57%

A Reinforcement Learning Approach to Quiet and Safe UAM Traffic Management

Surya Murthy, John-Paul Clarke, Ufuk Topcu, Zhenyu Gao

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments Paper presented at SciTech 2025

Journal ref AIAA SciTech 2025 Forum

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.06411 2025-01-07 cs.AI cs.RO 57%

Dialogue Possibilities between a Human Supervisor and UAM Air Traffic Management: Route Alteration

Jeongseok Kim, Kangjin Kim

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments 18 pages, 2 figures, accepted to the Advances in Artificial Intelligence and Machine Learning (AAIML) journal

Journal ref Advances in Artificial Intelligence and Machine Learning (AAIML), 2023, (3):1352-1368

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13365 2024-12-19 cs.AI cs.HC cs.SY eess.SY 57%

Quantitative Predictive Monitoring and Control for Safe Human-Machine Interaction

Shuyang Dong, Meiyi Ma, Josephine Lamp, Sebastian Elbaum, Matthew B. Dwyer, Lu Feng

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11656 2024-12-17 cs.HC cs.LG 57%

Private Yet Social: How LLM Chatbots Support and Challenge Eating Disorder Recovery

Ryuhaerang Choi, Taehan Kim, Subin Park, Jennifer G Kim, Sung-Ju Lee

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10882 2024-12-13 cs.CV cs.CL 57%

Universal Prompt Optimizer for Safe Text-to-Image Generation

Zongyu Wu, Hongcheng Gao, Yueze Wang, Xiang Zhang, Suhang Wang

专题命中 安全训练 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01303 2024-12-03 eess.SY cs.AI cs.SY 57%

RL2: Reinforce Large Language Model to Assist Safe Reinforcement Learning for Energy Management of Active Distribution Networks

Xu Yang, Chenhui Lin, Haotian Liu, Wenchuan Wu

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02038 2024-12-03 cs.LG 57%

Realizable Continuous-Space Shields for Safe Reinforcement Learning

Kyungmin Kim, Davide Corsi, Andoni Rodriguez, JB Lanier, Benjami Parellada, Pierre Baldi, Cesar Sanchez, Roy Fox

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments Kim, Corsi, and Rodriguez contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17713 2024-11-28 cs.DC cs.AI 57%

Llama Guard 3-1B-INT4: Compact and Efficient Safeguard for Human-AI Conversations

Igor Fedorov, Kate Plawiak, Lemeng Wu, Tarek Elgamal, Naveen Suda, Eric Smith, Hongyuan Zhan, Jianfeng Chi, Yuriy Hulovatyy, Kimish Patel, Zechun Liu, Changsheng Zhao, Yangyang Shi, Tijmen Blankevoort, Mahesh Pasupuleti, Bilge Soran, Zacharie Delpierre Coudert, Rachad Alao, Raghuraman Krishnamoorthi, Vikas Chandra

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16723 2024-11-27 cs.MA cs.AI cs.RO 57%

Two Heads Are Better Than One: Collaborative LLM Embodied Agents for Human-Robot Interaction

Mitchell Rosser, Marc. G Carmichael

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15036 2024-11-25 cs.LG cs.SY eess.SY 57%

Safe Multi-Agent Reinforcement Learning with Convergence to Generalized Nash Equilibrium

Zeyang Li, Navid Azizan

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14368 2024-11-22 cs.AI cs.HC cs.SE 57%

RV4Chatbot: Are Chatbots Allowed to Dream of Electric Sheep?

Andrea Gatti, Viviana Mascardi, Angelo Ferrando

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments In Proceedings FMAS2024, arXiv:2411.13215

Journal ref EPTCS 411, 2024, pp. 73-90

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09623 2024-11-20 cs.RO cs.AI cs.CV 57%

Vision-based Manipulation of Transparent Plastic Bags in Industrial Setups

F. Adetunji, A. Karukayil, P. Samant, S. Shabana, F. Varghese, U. Upadhyay, R. A. Yadav, A. Partridge, E. Pendleton, R. Plant, Y. Petillot, M. Koskinopoulou

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06071 2024-11-20 cs.CV cs.LG 57%

A-BDD: Leveraging Data Augmentations for Safe Autonomous Driving in Adverse Weather and Lighting

Felix Assion, Florens Gressner, Nitin Augustine, Jona Klemenc, Ahmed Hammam, Alexandre Krattinger, Holger Trittenbach, Anja Philippsen, Sascha Riemer

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10072 2024-11-18 cs.CV cs.AI 57%

Real-Time AI-Driven People Tracking and Counting Using Overhead Cameras

Ishrath Ahamed, Chamith Dilshan Ranathunga, Dinuka Sandun Udayantha, Benny Kai Kiat Ng, Chau Yuen

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments This paper is accepted to IEEE Region 10 conference (TENCON) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏