arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3281 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3281 篇

2411.07700 2024-11-13 cs.LG 57%

Test Where Decisions Matter: Importance-driven Testing for Deep Reinforcement Learning

Stefan Pranger, Hana Chockler, Martin Tappler, Bettina Könighofer

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05214 2024-11-11 cs.CL 57%

STAND-Guard: A Small Task-Adaptive Content Moderation Model

Minjia Wang, Pingping Lin, Siqi Cai, Shengnan An, Shengjie Ma, Zeqi Lin, Congrui Huang, Bixiong Xu

专题命中 安全训练 :safety(abstract);分类 cs.CL

Comments 20 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18822 2024-11-11 cs.CL 57%

Toxicity Detection for Free

Zhanhao Hu, Julien Piet, Geng Zhao, Jiantao Jiao, David Wagner

专题命中 安全训练 :safety(abstract);分类 cs.CL

Comments Accepted by Neurips 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03704 2024-11-06 cs.LG cs.SY eess.SY 57%

Excluding the Irrelevant: Focusing Reinforcement Learning through Continuous Action Masking

Roland Stolz, Hanna Krasowski, Jakob Thumm, Michael Eichelbeck, Philipp Gassert, Matthias Althoff

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02175 2024-11-05 cs.LG cs.CV 57%

SAFE: Slow and Fast Parameter-Efficient Tuning for Continual Learning with Pre-Trained Models

Linglan Zhao, Xuerui Zhang, Ke Yan, Shouhong Ding, Weiran Huang

专题命中 安全训练 :alignment(abstract);分类 cs.LG

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.24096 2024-11-01 cs.LG cs.LO 57%

Progressive Safeguards for Safe and Model-Agnostic Reinforcement Learning

Nabil Omi, Hosein Hasanbeig, Hiteshi Sharma, Sriram K. Rajamani, Siddhartha Sen

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2011.06022 2024-10-30 cs.RO cs.LG 57%

Machine Learning Based Path Planning for Improved Rover Navigation (Pre-Print Version)

Neil Abcouwer, Shreyansh Daftry, Siddarth Venkatraman, Tyler del Sesto, Olivier Toupet, Ravi Lanka, Jialin Song, Yisong Yue, Masahiro Ono

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments 9 pages, 5 figures, Pre-Print, This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20687 2024-10-29 eess.SP cs.LG 57%

Joint Channel Selection using FedDRL in V2X

Lorenzo Mancini, Safwan Labbi, Karim Abed Meraim, Fouzi Boukhalfa, Alain Durmus, Paul Mangold, Eric Moulines

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20522 2024-10-29 cs.CR cs.AI 57%

Props for Machine-Learning Security

Ari Juels, Farinaz Koushanfar

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.04572 2024-10-28 cs.NI cs.AI cs.CR 57%

Smart and Secure CAV Networks Empowered by AI-Enabled Blockchain: The Next Frontier for Intelligent Safe Driving Assessment

Le Xia, Yao Sun, Rafiq Swash, Lina Mohjazi, Lei Zhang, Muhammad Ali Imran

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments This article has been accepted for publication by IEEE Network

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18112 2024-10-25 cs.MA cs.LG cs.RO 57%

OPTIMA: Optimized Policy for Intelligent Multi-Agent Systems Enables Coordination-Aware Autonomous Vehicles

Rui Du, Kai Zhao, Jinlong Hou, Qiang Zhang, Peter Zhang

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20539 2024-10-22 cs.LG cs.CR 57%

SleeperNets: Universal Backdoor Poisoning Attacks Against Reinforcement Learning Agents

Ethan Rathbun, Christopher Amato, Alina Oprea

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments 23 pages, 14 figures, NeurIPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15821 2024-10-22 cs.AI 57%

The effect of fine-tuning on language model toxicity

Will Hawkins, Brent Mittelstadt, Chris Russell

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments To be presented at NeurIPS 2024 Safe Generative AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.00024 2024-10-17 cs.CR cs.LG 57%

Can LLMs Patch Security Issues?

Kamel Alrashedy, Abdullah Aljasser, Pradyumna Tambwekar, Matthew Gombolay

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.08295 2024-10-14 cs.CL 57%

CMD: a framework for Context-aware Model self-Detoxification

Zecheng Tang, Keyan Zhou, Juntao Li, Yuyang Ding, Pinzheng Wang, Bowen Yan, Rejie Hua, Min Zhang

专题命中 安全训练 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16382 2024-10-04 cs.CL 57%

Immunization against harmful fine-tuning attacks

Domenic Rosati, Jan Wehner, Kai Williams, Łukasz Bartoszcze, Jan Batzner, Hassan Sajjad, Frank Rudzicz

专题命中 安全训练 :safety(abstract);分类 cs.CL

Comments Published in EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01212 2024-10-03 cs.LG 57%

Absolute State-wise Constrained Policy Optimization: High-Probability State-wise Constraints Satisfaction

Weiye Zhao, Feihan Li, Yifan Sun, Yujie Wang, Rui Chen, Tianhao Wei, Changliu Liu

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments submission to Journal of Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14867 2024-09-24 cs.RO cs.AI math.DS math.OC 57%

A novel agent with formal goal-reaching guarantees: an experimental study with a mobile robot

Grigory Yaremenko, Dmitrii Dobriborsci, Roman Zashchitin, Ruben Contreras Maestre, Ngoc Quoc Huy Hoang, Pavel Osinenko

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15488 2024-09-06 cs.CL 57%

Legilimens: Practical and Unified Content Moderation for Large Language Model Services

Jialin Wu, Jiangyi Deng, Shengyuan Pang, Yanjiao Chen, Jiayang Xu, Xinfeng Li, Wenyuan Xu

专题命中 安全训练 :safety(abstract);分类 cs.CL

Comments Accepted by ACM Conference on Computer and Communications Security (CCS) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04160 2024-09-05 cs.CL 57%

A Causal Explainable Guardrails for Large Language Models

Zhixuan Chu, Yan Wang, Longfei Li, Zhibo Wang, Zhan Qin, Kui Ren

专题命中 安全训练 :alignment(abstract);分类 cs.CL

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11914 2024-09-04 cs.LG cs.RO 57%

Agent-Agnostic Centralized Training for Decentralized Multi-Agent Cooperative Driving

Shengchao Yan, Lukas König, Wolfram Burgard

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments accepted by IROS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16780 2024-09-02 cs.NE cs.AI 57%

$EvoAl^{2048}$

Bernhard J. Berger, Christina Plump, Rolf Drechsler

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments 2 pages, GECCO'24 competition entry

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13881 2024-08-27 cs.RO cs.LG 57%

Safe Policy Exploration Improvement via Subgoals

Brian Angulo, Gregory Gorbov, Aleksandr Panov, Konstantin Yakovlev

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11812 2024-08-22 cs.RO cs.LG 57%

Scaling Cross-Embodied Learning: One Policy for Manipulation, Navigation, Locomotion and Aviation

Ria Doshi, Homer Walke, Oier Mees, Sudeep Dasari, Sergey Levine

专题命中 安全训练 :alignment(abstract);分类 cs.LG

Comments Project website at https://crossformer-model.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12786 2024-08-22 cs.LG 57%

Mechanistically analyzing the effects of fine-tuning on procedurally defined tasks

Samyak Jain, Robert Kirk, Ekdeep Singh Lubana, Robert P. Dick, Hidenori Tanaka, Edward Grefenstette, Tim Rocktäschel, David Scott Krueger

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06009 2024-08-20 cs.LG 57%

Detectors for Safe and Reliable LLMs: Implementations, Uses, and Limitations

Swapnaja Achintalwar, Adriana Alvarado Garcia, Ateret Anaby-Tavor, Ioana Baldini, Sara E. Berger, Bishwaranjan Bhattacharjee, Djallel Bouneffouf, Subhajit Chaudhury, Pin-Yu Chen, Lamogha Chiazor, Elizabeth M. Daly, Kirushikesh DB, Rogério Abreu de Paula, Pierre Dognin, Eitan Farchi, Soumya Ghosh, Michael Hind, Raya Horesh, George Kour, Ja Young Lee, Nishtha Madaan, Sameep Mehta, Erik Miehling, Keerthiram Murugesan, Manish Nagireddy, Inkit Padhi, David Piorkowski, Ambrish Rawat, Orna Raz, Prasanna Sattigeri, Hendrik Strobelt, Sarathkrishna Swaminathan, Christoph Tillmann, Aashka Trivedi, Kush R. Varshney, Dennis Wei, Shalisha Witherspooon, Marcel Zalmanovici

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06210 2024-08-13 cs.CY 57%

Certified Safe: A Schematic for Approval Regulation of Frontier AI

Cole Salvador

专题命中 安全训练 :safety(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.17639 2024-08-08 eess.SY cs.AI cs.SY 57%

Point-Based Value Iteration for POMDPs with Neural Perception Mechanisms

Rui Yan, Gabriel Santos, Gethin Norman, David Parker, Marta Kwiatkowska

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments 65 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02577 2024-07-24 cs.LG 57%

Solving a Real-World Optimization Problem Using Proximal Policy Optimization with Curriculum Learning and Reward Engineering

Abhijeet Pendyala, Asma Atamna, Tobias Glasmachers

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14296 2024-07-23 cs.RO cs.CL 57%

Foundation Models for Autonomous Robots in Unstructured Environments

Hossein Naderi, Alireza Shojaei, Lifu Huang

专题命中 安全训练 :safety(abstract);分类 cs.CL

Comments arXiv admin note: text overlap with arXiv:2312.07843, arXiv:2402.05741 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏