arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3248 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3248 篇

2502.13640 2025-07-15 cs.CL 79%

Qorgau: Evaluating LLM Safety in Kazakh-Russian Bilingual Contexts

Maiya Goloburda, Nurkhan Laiyk, Diana Turmakhan, Yuxia Wang, Mukhammed Togmanov, Jonibek Mansurov, Askhat Sametov, Nurdaulet Mukhituly, Minghan Wang, Daniil Orel, Zain Muhammad Mujahid, Fajri Koto, Timothy Baldwin, Preslav Nakov

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎伊德大学人工智能学院) Monash University(莫纳什大学) University of Copenhagen(哥本哈根大学) The University of Melbourne(墨尔本大学) LibrAI(LibrAI公司) Institute of Foundation Models(基础模型研究所)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18032 2025-06-24 cs.LG 79%

Why Do Some Language Models Fake Alignment While Others Don't?

Abhay Sheshadri, John Hughes, Julian Michael, Alex Mallen, Arun Jose, Janus, Fabien Roger

机构 * Anthropic Scale AI Redwood Research

专题命中 安全训练 :alignment(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17842 2025-06-24 cs.RO cs.AI 79%

Generative Grasp Detection and Estimation with Concept Learning-based Safety Criteria

Al-Harith Farhad, Khalil Abuibaid, Christiane Plociennik, Achim Wagner, Martin Ruskowski

机构 * Innovative Factory Solutions(创新工厂解决方案) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) Chair of Machine Tools and Control Systems (WSKL)(机械工具与控制系统教授职位) Rheinland-Pfälzische Technische Universität (RPTU)(莱茵-瓦尔德技术大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

Comments RAAD 2025: 34th International Conference on Robotics in Alpe-Adria-Danube Region

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16328 2025-06-17 cs.LG 79%

Optimal Transport-Guided Safety in Temporal Difference Reinforcement Learning

Zahra Shahrooei, Ali Baheri

机构 * Department of Mechanical Engineering, Rochester Institute of Technology(机械工程系,罗切斯特理工学院)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06636 2025-06-10 cs.CL 79%

SafeLawBench: Towards Safe Alignment of Large Language Models

Chuxue Cao, Han Zhu, Jiaming Ji, Qichao Sun, Zhenghao Zhu, Yinyu Wu, Juntao Dai, Yaodong Yang, Sirui Han, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) Peking University(北京大学)

专题命中 安全训练 :alignment(title);safety(abstract);分类 cs.CL

Comments Accepted to ACL2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02590 2025-06-10 cs.CL 79%

Legal Mathematical Reasoning with LLMs: Procedural Alignment through Two-Stage Reinforcement Learning

Kepu Zhang, Guofu Xie, Weijie Yu, Mingyue Xu, Xu Tang, Yaxin Li, Jun Xu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学耿丽人工智能学院) University of International Business and Economics(国际经贸大学)

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04250 2025-06-06 cs.LG 79%

SafeSteer: Interpretable Safety Steering with Refusal-Evasion in LLMs

Shaona Ghosh, Amrita Bhattacharjee, Yftah Ziser, Christopher Parisien

机构 * NVIDIA(英伟达) School of Computing and AI(计算与人工智能学院) Arizona State University(亚利桑那州立大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments arXiv admin note: text overlap with arXiv:2410.01174

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02442 2025-06-05 cs.CL 79%

Should LLM Safety Be More Than Refusing Harmful Instructions?

Utsav Maskey, Mark Dras, Usman Naseem

机构 * Macquarie University(麦考瑞大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08179 2025-06-02 cs.LG 79%

Feasibility-Aware Pessimistic Estimation: Toward Long-Horizon Safety in Offline RL

Zhikun Tao

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments arXiv admin comment: This version removed due to inaccurate authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18858 2025-05-27 cs.RO cs.LG 79%

Guided by Guardrails: Control Barrier Functions as Safety Instructors for Robotic Learning

Maeva Guerrier, Karthik Soma, Hassan Fouad, Giovanni Beltrame

机构 * Department of Computer Engineering and Software Engineering, Polytechnique Montreal(计算机工程与软件工程系,蒙特利尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12545 2025-05-22 cs.CL 79%

Towards Reliable and Interpretable Traffic Crash Pattern Prediction and Safety Interventions Using Customized Large Language Models

Yang Zhao, Pu Wang, Yibo Zhao, Hongru Du, Hao Frank Yang

机构 * Center for Systems Science and Engineering(系统科学与工程中心) Johns Hopkins University(约翰霍普金斯大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

Comments Last revised 13 Feb 2025. Under review in Nature portfolio

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08026 2025-05-14 eess.SY cs.LG cs.SY 79%

Safety and optimality in learning-based control at low computational cost

Dominik Baumann, Krzysztof Kowalczyk, Cristian R. Rojas, Koen Tiels, Pawel Wachel

机构 * Aalto University(阿alto大学) Uppsala University(乌普萨拉大学) Wrocław University of Science and Technology(沃斯克拉大学科学与技术大学) KTH Royal Institute of Technology(皇家理工学院) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

Comments Accepted final version to appear in the IEEE Transactions on Automatic Control

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03694 2025-05-09 cs.RO cs.AI 79%

Demonstrating ViSafe: Vision-enabled Safety for High-speed Detect and Avoid

Parv Kapoor, Ian Higgins, Nikhil Keetha, Jay Patrikar, Brady Moon, Zelin Ye, Yao He, Ivan Cisneros, Yaoyu Hu, Changliu Liu, Eunsuk Kang, Sebastian Scherer

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

Comments 13 pages, RSS 2025 Demo track, https://theairlab.org/visafe/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01453 2025-05-06 cs.MA cs.AI cs.RO cs.SY eess.SY 79%

Safe and Efficient CAV Lane Changing using Decentralised Safety Shields

Bharathkumar Hegde, Melanie Bouroche

机构 * School of Computer Science and Statistics, Trinity College Dublin(计算机科学与统计学学院,都柏林三一学院)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

Comments Accepted in IEEE IV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04562 2025-04-08 cs.RO cs.AI 79%

Planning Safety Trajectories with Dual-Phase, Physics-Informed, and Transportation Knowledge-Driven Large Language Models

Rui Gan, Pei Li, Keke Long, Bocheng An, Junwei You, Keshu Wu, Bin Ran

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02058 2025-04-04 cs.AI 79%

Epistemic Closure and the Irreversibility of Misalignment: Modeling Systemic Barriers to Alignment Innovation

Andy Williams

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06866 2025-03-11 cs.RO cs.AI 79%

Graphormer-Guided Task Planning: Beyond Static Rules with LLM Safety Perception

Wanjing Huang, Tongjie Pan, Yalan Ye

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13982 2025-03-06 cs.CV cs.AI 79%

Safety Without Semantic Disruptions: Editing-free Safe Image Generation via Context-preserving Dual Latent Reconstruction

Jordan Vice, Naveed Akhtar, Mubarak Shah, Richard Hartley, Ajmal Mian

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

Comments This research is supported by the NISDRG project #20100007, funded by the Australian Government

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14598 2025-03-04 cs.AI 79%

SORRY-Bench: Systematically Evaluating Large Language Model Safety Refusal

Tinghao Xie, Xiangyu Qi, Yi Zeng, Yangsibo Huang, Udari Madhushani Sehwag, Kaixuan Huang, Luxi He, Boyi Wei, Dacheng Li, Ying Sheng, Ruoxi Jia, Bo Li, Kai Li, Danqi Chen, Peter Henderson, Prateek Mittal

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

Comments Paper accepted to ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03793 2025-03-04 cs.CR cs.AI 79%

Safeguarding AI Agents: Developing and Analyzing Safety Architectures

Ishaan Domkundwar, Mukunda N S, Ishaan Bhola, Riddhik Kochhar

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15119 2025-02-24 cs.RO cs.AI cs.CV 79%

CurricuVLM: Towards Safe Autonomous Driving via Personalized Safety-Critical Curriculum Learning with Vision-Language Models

Zihao Sheng, Zilin Huang, Yansong Qu, Yue Leng, Sruthi Bhavanam, Sikai Chen

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11448 2025-02-19 cs.AI 79%

AGrail: A Lifelong Agent Guardrail with Effective and Adaptive Safety Detection

Weidi Luo, Shenghong Dai, Xiaogeng Liu, Suman Banerjee, Huan Sun, Muhao Chen, Chaowei Xiao

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12259 2025-02-14 cs.AI 79%

How Safe is Your Safety Metric? Automatic Concatenation Tests for Metric Reliability

Ora Nova Fandina, Leshem Choshen, Eitan Farchi, George Kour, Yotam Perlitz, Orna Raz

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06606 2025-02-11 cs.AI cs.CR 79%

Gen-AI for User Safety: A Survey

Akshar Prabhu Desai, Tejasvi Ravi, Mohammad Luqman, Mohit Sharma, Nithya Kota, Pranjul Yadav

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

Journal ref 2024 IEEE International Conference on Big Data (BigData), Washington, DC, USA, 2024, pp. 5315-5324

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02528 2025-02-05 cs.HC cs.AI 79%

Why human-AI relationships need socioaffective alignment

Hannah Rose Kirk, Iason Gabriel, Chris Summerfield, Bertie Vidgen, Scott A. Hale

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17315 2025-01-30 cs.AI cs.CR cs.SE 79%

A sketch of an AI control safety case

Tomek Korbak, Joshua Clymer, Benjamin Hilton, Buck Shlegeris, Geoffrey Irving

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17132 2025-01-29 cs.SE cs.CL 79%

ASTRAL: Automated Safety Testing of Large Language Models

Miriam Ugarte, Pablo Valle, José Antonio Parejo, Sergio Segura, Aitor Arrieta

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

Journal ref The 6th ACM/IEEE International Conference on Automation of Software Test (AST 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10057 2025-01-20 cs.CL 79%

MSTS: A Multimodal Safety Test Suite for Vision-Language Models

Paul Röttger, Giuseppe Attanasio, Felix Friedrich, Janis Goldzycher, Alicia Parrish, Rishabh Bhardwaj, Chiara Di Bonaventura, Roman Eng, Gaia El Khoury Geagea, Sujata Goswami, Jieun Han, Dirk Hovy, Seogyeong Jeong, Paloma Jeretič, Flor Miriam Plaza-del-Arco, Donya Rooein, Patrick Schramowski, Anastassia Shaitarova, Xudong Shen, Richard Willats, Andrea Zugarini, Bertie Vidgen

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.19626 2025-01-14 cs.AI 79%

Safety through feedback in Constrained RL

Shashank Reddy Chirra, Pradeep Varakantham, Praveen Paruchuri

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

Comments Accepted at NeurIPS 2024 (Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00320 2025-01-08 cs.AI 79%

Autonomous Alignment with Human Value on Altruism through Considerate Self-imagination and Theory of Mind

Haibo Tong, Enmeng Lu, Yinqian Sun, Zhengqiang Han, Chao Liu, Feifei Zhao, Yi Zeng

专题命中 安全训练 :alignment(title);safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏