arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3278 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3278 篇

2502.09175 2025-02-14 cs.CR cs.AI cs.CL 62%

FLAME: Flexible LLM-Assisted Moderation Engine

Ivan Bakulin, Ilia Kopanichuk, Iaroslav Bespalov, Nikita Radchenko, Vladimir Shaposhnikov, Dmitry Dylov, Ivan Oseledets

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04249 2025-02-07 cs.AI cs.LG cs.MA physics.data-an stat.ML 62%

Free Energy Risk Metrics for Systemically Safe AI: Gatekeeping Multi-Agent Study

Michael Walters, Rafael Kaufmann, Justice Sefas, Thomas Kopinski

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 9 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17460 2025-02-07 cs.RO cs.AI cs.CV cs.LG cs.SY eess.SY 62%

SoNIC: Safe Social Navigation with Adaptive Conformal Inference and Constrained Reinforcement Learning

Jianpeng Yao, Xiaopan Zhang, Yu Xia, Zejin Wang, Amit K. Roy-Chowdhury, Jiachen Li

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Project website: https://sonic-social-nav.github.io/; 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02520 2025-02-05 cs.MA cs.AI cs.LG cs.SY eess.SY 62%

Cooperative Cruising: Reinforcement Learning-Based Time-Headway Control for Increased Traffic Efficiency

Yaron Veksler, Sharon Hornstein, Han Wang, Maria Laura Delle Monache, Daniel Urieli

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01088 2025-02-05 cs.HC cs.CL cs.LG 62%

Exploring Empty Spaces: Human-in-the-Loop Data Augmentation

Catherine Yeh, Donghao Ren, Yannick Assogba, Dominik Moritz, Fred Hohman

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG

Comments Code: https://github.com/apple/ml-interactive-data-augmentation/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15844 2025-02-03 stat.ML cs.AI cs.IT cs.LG math.IT stat.ME 62%

Adaptive Learn-then-Test: Statistically Valid and Efficient Hyperparameter Selection

Matteo Zecchin, Sangwoo Park, Osvaldo Simeone

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.17217 2025-01-28 cs.LG cs.AI 62%

Temporal Logic Specification-Conditioned Decision Transformer for Offline Safe Reinforcement Learning

Zijian Guo, Weichao Zhou, Wenchao Li

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

Comments Published in ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08145 2025-01-15 cs.CL cs.AI 62%

Refusal Behavior in Large Language Models: A Nonlinear Perspective

Fabian Hildebrandt, Andreas Maier, Patrick Krauss, Achim Schilling

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05113 2025-01-10 physics.comp-ph cs.AI cs.LG 62%

Constrained Optimization of Charged Particle Tracking with Multi-Agent Reinforcement Learning

Tobias Kortus, Ralf Keidel, Nicolas R. Gauger, Jan Kieseler

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04982 2025-01-10 cs.RO cs.AI cs.LG 62%

CuRLA: Curriculum Learning Based Deep Reinforcement Learning for Autonomous Driving

Bhargava Uppuluri, Anjel Patel, Neil Mehta, Sridhar Kamath, Pratyush Chakraborty

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments To be published in the 17th International Conference on Agents and Artificial Intelligence (ICAART), Feb 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10356 2025-01-07 cs.LG cs.AI 62%

Generating Counterfactual Trajectories with Latent Diffusion Models for Concept Discovery

Payal Varshney, Adriano Lucieri, Christoph Balada, Andreas Dengel, Sheraz Ahmed

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments Published at International Conference on Pattern Recognition (ICPR) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00528 2025-01-03 cs.LG cs.AI 62%

PyMilo: A Python Library for ML I/O

AmirHosein Rostami, Sepand Haghighi, Sadra Sabouri, Alireza Zolanvari

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments 7 pages, 5 figures, 2 tables, 3 code blocks

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04108 2024-12-25 cs.CR cs.CL cs.LG 62%

Future Events as Backdoor Triggers: Investigating Temporal Vulnerabilities in LLMs

Sara Price, Arjun Panickssery, Sam Bowman, Asa Cooper Stickland

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14234 2024-12-24 cs.SE cs.AI cs.LG cs.PL 62%

Syzygy: Dual Code-Test C to (safe) Rust Translation using LLMs and Dynamic Analysis

Manish Shetty, Naman Jain, Adwait Godbole, Sanjit A. Seshia, Koushik Sen

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Project webpage at https://syzygy-project.github.io/. Preliminary version accepted at LLM4Code 2025, 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13702 2024-12-20 cs.CL cs.AI 62%

Typhoon 2: A Family of Open Text and Multimodal Thai Large Language Models

Kunat Pipatanakul, Potsawee Manakul, Natapong Nitarach, Warit Sirichotedumrong, Surapon Nonesung, Teetouch Jaknamon, Parinthapat Pengpun, Pittawat Taveekitworachai, Adisai Na-Thalang, Sittipong Sripaisarnmongkol, Krisanapong Jirayoot, Kasima Tharnpipitchai

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

Comments technical report, 55 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14881 2024-12-19 cs.AI cs.CL 62%

Class-RAG: Real-Time Content Moderation with Retrieval Augmented Generation

Jianfa Chen, Emily Shen, Trupti Bavalatti, Xiaowen Lin, Yongkai Wang, Shuming Hu, Harihar Subramanyam, Ksheeraj Sai Vepuri, Ming Jiang, Ji Qi, Li Chen, Nan Jiang, Ankit Jain

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

Comments 11 pages, submit to ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11138 2024-12-17 cs.LG cs.AI 62%

Safe Reinforcement Learning using Finite-Horizon Gradient-based Estimation

Juntao Dai, Yaodong Yang, Qian Zheng, Gang Pan

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Journal ref Proceedings of the 41st International Conference on Machine Learning, PMLR 235:9872-9903, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10713 2024-12-17 cs.LG cs.AI cs.CR cs.RO 62%

RAT: Adversarial Attacks on Deep Reinforcement Agents for Targeted Behaviors

Fengshuo Bai, Runze Liu, Yali Du, Ying Wen, Yaodong Yang

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08470 2024-12-17 cs.LG cs.AI 62%

Context-Aware Assistant Selection for Improved Inference Acceleration with Large Language Models

Jerry Huang, Prasanna Parthasarathi, Mehdi Rezagholizadeh, Sarath Chandar

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

Comments Published as a long paper at the 2024 Conference on Empirical Methods in Natural Language Processing (EMNLP). Official version of paper within conference proceedings is available at http://aclanthology.org/2024.emnlp-main.332

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10410 2024-12-17 cs.AI cs.LG cs.RO 62%

GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents

Shaofei Cai, Bowei Zhang, Zihao Wang, Haowei Lin, Xiaojian Ma, Anji Liu, Yitao Liang

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07241 2024-12-11 cs.HC cs.AI cs.LG 62%

Human-Computer Interaction and Human-AI Collaboration in Advanced Air Mobility: A Comprehensive Review

Fatma Yamac Sagirli, Xiaopeng Zhao, Zhenbo Wang

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06165 2024-12-10 cs.LG cs.AI stat.ML 62%

Conservative Contextual Bandits: Beyond Linear Representations

Rohan Deb, Mohammad Ghavamzadeh, Arindam Banerjee

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07435 2024-11-26 eess.SY cs.AI cs.LG cs.NE cs.SY 62%

Real-world validation of safe reinforcement learning, model predictive control and decision tree-based home energy management systems

Julian Ruddick, Glenn Ceusters, Gilles Van Kriekinge, Evgenii Genov, Cedric De Cauwer, Thierry Coosemans, Maarten Messagie

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted version Energy and AI: https://doi.org/10.1016/j.egyai.2024.100448

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14502 2024-11-25 cs.CR cs.AI cs.CY 62%

Global Challenge for Safe and Secure LLMs Track 1

Xiaojun Jia, Yihao Huang, Yang Liu, Peng Yan Tan, Weng Kuan Yau, Mun-Thye Mak, Xin Ming Sim, Wee Siong Ng, See Kiong Ng, Hanqing Liu, Lifeng Zhou, Huanqian Yan, Xiaobing Sun, Wei Liu, Long Wang, Yiming Qian, Yong Liu, Junxiao Yang, Zhexin Zhang, Leqi Lei, Renmiao Chen, Yida Lu, Shiyao Cui, Zizhou Wang, Shaohua Li, Yan Wang, Rick Siow Mong Goh, Liangli Zhen, Yingjie Zhang, Zhe Zhao

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15145 2024-11-22 cs.AI cs.CL cs.MA 62%

CulturePark: Boosting Cross-cultural Understanding in Large Language Models

Cheng Li, Damien Teney, Linyi Yang, Qingsong Wen, Xing Xie, Jindong Wang

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2024; Code is released at https://github.com/Scarelette/CulturePark. arXiv admin note: substantial text overlap with arXiv:2402.10946

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.12275 2024-11-13 cs.RO cs.AI cs.CV cs.LG cs.MA 62%

Multi-Agent Dynamic Relational Reasoning for Social Robot Navigation

Jiachen Li, Chuanbo Hua, Jianpeng Yao, Hengbo Ma, Jinkyoo Park, Victoria Dax, Mykel J. Kochenderfer

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Project website: https://relational-reasoning-nav.github.io/; 20 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05718 2024-11-11 cs.RO cs.AI cs.LG 62%

A Retrospective on the Robot Air Hockey Challenge: Benchmarking Robust, Reliable, and Safe Learning Techniques for Real-world Robotics

Puze Liu, Jonas Günster, Niklas Funk, Simon Gröger, Dong Chen, Haitham Bou-Ammar, Julius Jankowski, Ante Marić, Sylvain Calinon, Andrej Orsula, Miguel Olivares-Mendez, Hongyi Zhou, Rudolf Lioutikov, Gerhard Neumann, Amarildo Likmeta Amirhossein Zhalehmehrabi, Thomas Bonenfant, Marcello Restelli, Davide Tateo, Ziyuan Liu, Jan Peters

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

Comments Accept at NeurIPS 2024 Dataset and Benchmark Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16163 2024-11-08 cs.CL cs.AI 62%

FRACTURED-SORRY-Bench: Framework for Revealing Attacks in Conversational Turns Undermining Refusal Efficacy and Defenses over SORRY-Bench (Automated Multi-shot Jailbreaks)

Aman Priyanshu, Supriti Vijay

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

Comments 4 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04159 2024-11-08 cs.NI cs.AI cs.DC cs.LG 62%

Cooperation and Personalization on a Seesaw: Choice-based FL for Safe Cooperation in Wireless Networks

Han Zhang, Medhat Elsayed, Majid Bavand, Raimundas Gaigalas, Yigit Ozcan, Melike Erol-Kantarci

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15122 2024-11-06 cs.LG cs.AI cs.RO 62%

Scaling Is All You Need: Autonomous Driving with JAX-Accelerated Reinforcement Learning

Moritz Harmel, Anubhav Paras, Andreas Pasternak, Nicholas Roy, Gary Linscott

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏