arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3281 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3281 篇

2508.19500 2025-08-28 cs.CR cs.AI 57%

Servant, Stalker, Predator: How An Honest, Helpful, And Harmless (3H) Agent Unlocks Adversarial Skills

David Noever

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20361 2025-08-27 cs.MA cs.AI cs.RO 57%

Safe Multiagent Coordination via Entropic Exploration

Ayhan Alp Aydeniz, Enrico Marchesini, Robert Loftin, Christopher Amato, Kagan Tumer

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07300 2025-08-27 cs.CY 57%

From Principles to Rules: A Regulatory Approach for Frontier AI

Jonas Schuett, Markus Anderljung, Alexis Carlier, Leonie Koessler, Ben Garfinkel

专题命中 安全训练 :safety(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18268 2025-08-26 cs.RO cs.AI 57%

SafeBimanual: Diffusion-based Trajectory Optimization for Safe Bimanual Manipulation

Haoyuan Deng, Wenkai Guo, Qianzhun Wang, Zhenyu Wu, Ziwei Wang

机构 * Nanyang Technological University(南洋理工大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments Project website is at: https://denghaoyuan123.github.io/SafeBimanip/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17511 2025-08-26 cs.AI 57%

School of Reward Hacks: Hacking harmless tasks generalizes to misaligned behavior in LLMs

Mia Taylor, James Chua, Jan Betley, Johannes Treutlein, Owain Evans

专题命中 安全训练 :alignment(abstract);分类 cs.AI

Comments 42 pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17158 2025-08-26 cs.LG 57%

Towards Safeguarding LLM Fine-tuning APIs against Cipher Attacks

Jack Youstra, Mohammed Mahfoud, Yang Yan, Henry Sleight, Ethan Perez, Mrinank Sharma

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13608 2025-08-20 eess.SY cs.LG cs.SY math.OC 57%

Towards safe control parameter tuning in distributed multi-agent systems

Abdullah Tokmak, Thomas B. Schön, Dominik Baumann

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments Accepted to CDC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.02903 2025-08-19 cs.CE cs.LG cs.NA math.NA 57%

Predicting Open-Hole Laminates Failure Using Support Vector Machines With Classical and Quantum Kernels

Giorgio Tosti Balducci, Boyang Chen, Matthias Möller, Marc Gerritsma, Roeland De Breuker

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10355 2025-08-15 cs.CL 57%

Making Qwen3 Think in Korean with Reinforcement Learning

Jungyup Lee, Jemin Kim, Sang Park, SeungJae Lee

机构 * Jungyup Lee, Jemin Kim, Sang Park, SeungJae Lee(作者)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10233 2025-08-15 cs.LG 57%

Interpretable Machine Learning Model for Early Prediction of Acute Kidney Injury in Critically Ill Patients with Cirrhosis: A Retrospective Study

Li Sun, Shuheng Chen, Junyi Fan, Yong Si, Minoo Ahmadi, Elham Pishgar, Kamiar Alaei, Maryam Pishgar

专题命中 安全训练 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07096 2025-08-12 cs.AI 57%

Rejecting Hallucinated State Targets during Planning

Mingde Zhao, Tristan Sylvain, Romain Laroche, Doina Precup, Yoshua Bengio

机构 * McGill University(麦吉尔大学) Mila (Quebec AI Institute)(蒙特利尔AI研究所) Google Deepmind(谷歌DeepMind)

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments [20250810]: ICML 2025 Camera Ready, https://github.com/mila-iqia/delusions

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06754 2025-08-12 cs.AI 57%

A Fuzzy Logic Prompting Framework for Large Language Models in Adaptive and Uncertain Tasks

Vanessa Figueiredo

专题命中 安全训练 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00352 2025-08-12 cs.AI cs.MA cs.RO 57%

A Differentiated Reward Method for Reinforcement Learning based Multi-Vehicle Cooperative Decision-Making Algorithms

Ye Han, Lijun Zhang, Dejian Meng, Zhuang Zhang

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04755 2025-08-08 cs.LG cs.CE 57%

Are Large Language Models Dynamic Treatment Planners? An In Silico Study from a Prior Knowledge Injection Angle

Zhiyao Luo, Tingting Zhu

机构 * Department of Engineering Science University of Oxford(工程科学系牛津大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03986 2025-08-07 cs.AI 57%

The Emotional Baby Is Truly Deadly: Does your Multimodal Large Reasoning Model Have Emotional Flattery towards Humans?

Yuan Xun, Xiaojun Jia, Xinwei Liu, Hua Zhang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Nanyang Technological University(南洋理工大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02560 2025-08-07 cs.LG cs.CV eess.IV q-bio.NC stat.ML 57%

Explainable AI Methods for Neuroimaging: Systematic Failures of Common Tools, the Need for Domain-Specific Validation, and a Proposal for Safe Application

Nys Tjade Siegel, James H. Cole, Mohamad Habes, Stefan Haufe, Kerstin Ritter, Marc-André Schulz

专题命中 安全训练 :trustworthy(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24025 2025-08-04 cs.CV cs.AI 57%

DINO-R1: Incentivizing Reasoning Capability in Vision Foundation Models

Chenbin Pan, Wenbin He, Zhengzhong Tu, Liu Ren

机构 * Bosch Research North America(博世北美研究部) Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心) Texas A&M University(德克萨斯A&M大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22358 2025-07-31 cs.AI cs.HC 57%

Magentic-UI: Towards Human-in-the-loop Agentic Systems

Hussein Mozannar, Gagan Bansal, Cheng Tan, Adam Fourney, Victor Dibia, Jingya Chen, Jack Gerrits, Tyler Payne, Matheus Kunzler Maldaner, Madeleine Grunde-McLaughlin, Eric Zhu, Griffin Bassman, Jacob Alber, Peter Chang, Ricky Loynd, Friederike Niedtner, Ece Kamar, Maya Murad, Rafah Hosn, Saleema Amershi

机构 * Microsoft Research AI Frontiers(微软研究院人工智能前沿)

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18172 2025-07-30 cs.CR cs.LG 57%

GenAI Security: Outsmarting the Bots with a Proactive Testing Framework

Sunil Kumar Jang Bahadur, Gopala Dhar, Lavi Nigam

机构 * AI \& GenAI Specialist Cloud GTM Google Mumbai, India AI Engineer, AI Services Google Cloud Consulting (GCC) Google Mumbai, India Industry Solutions Google Gurugram, India

专题命中 安全训练 :prompt injection(abstract);分类 cs.LG

Comments IEEE CAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20614 2025-07-29 cs.CL 57%

Before the Outrage: Challenges and Advances in Predicting Online Antisocial Behavior

Anaïs Ollagnier

专题命中 安全训练 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17515 2025-07-24 cs.CV cs.CL 57%

URPO: A Unified Reward & Policy Optimization Framework for Large Language Models

Songshuo Lu, Hua Wang, Zhi Chen, Yaohua Tang

专题命中 安全训练 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05018 2025-07-24 cs.LG cs.MA 57%

Joint Pedestrian and Vehicle Traffic Optimization in Urban Environments using Reinforcement Learning

Bibek Poudel, Xuan Wang, Weizi Li, Lei Zhu, Kevin Heaslip

机构 * Min H. Kao Department of Electrical Engineering and Computer Science at University of Tennessee, Knoxville, TN, USA(田纳西大学电气工程与计算机科学系Min H. Kao部门) Department of Electrical and Computer Engineering at George Mason University(乔治·马歇尔大学电气与计算机工程系) Department of Industrial and Systems Engineering at University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校工业与系统工程系) Department of Civil and Environmental Engineering at University of Tennessee, Knoxville, TN, USA(田纳西大学土木与环境工程系)

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16322 2025-07-23 cs.AI 57%

Mind the Gap: Evaluating the Representativeness of Quantitative Medical Language Reasoning LLM Benchmarks for African Disease Burdens

Fred Mutisya, Shikoh Gitau, Christine Syovata, Diana Oigara, Ibrahim Matende, Muna Aden, Munira Ali, Ryan Nyotu, Diana Marion, Job Nyangena, Nasubo Ongoma, Keith Mbae, Elizabeth Wamicha, Eric Mibuari, Jean Philbert Nsengemana, Talkmore Chidede

专题命中 安全训练 :alignment(abstract);分类 cs.AI

Comments Preprint. 26 pages, includes appendix and tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09592 2025-07-18 cs.DB cs.AI 57%

THOR: Transformer Heuristics for On-Demand Retrieval

Isaac Shi, Zeyuan Li, Fan Liu, Wenli Wang, Lewei He, Yang Yang, Tianyu Shi

机构 * eSapiens

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03884 2025-07-18 cs.ET cs.LG cs.MA 57%

Quantum Computing and Neuromorphic Computing for Safe, Reliable, and explainable Multi-Agent Reinforcement Learning: Optimal Control in Autonomous Robotics

Mazyar Taghavi, Rahman Farnoosh

机构 * Intelligent Knowledge City(智能知识城)

专题命中 安全训练 :safety(abstract);分类 cs.LG

Journal ref Iran Journal of Computer Science, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09724 2025-07-17 cs.LG 57%

Navigating the Social Welfare Frontier: Portfolios for Multi-objective Reinforcement Learning

Cheol Woo Kim, Jai Moondra, Shresth Verma, Madeleine Pollack, Lingkai Kong, Milind Tambe, Swati Gupta

机构 * Harvard University, Cambridge, USA(哈佛大学) Google Deepmind(谷歌DeepMind) Georgia Institute of Technology, Atlanta, USA(佐治亚理工学院) Massachusetts Institute of Technology, Cambridge, USA(麻省理工学院)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11771 2025-07-17 cs.LG 57%

Scaling laws for activation steering with Llama 2 models and refusal mechanisms

Sheikh Abdur Raheem Ali, Justin Xu, Ivory Yang, Jasmine Xinze Li, Ayse Arslan, Clark Benham

机构 * Trajectory Labs(轨迹实验室) Stanford University(斯坦福大学) Dartmouth College(达特茅斯学院) Cornell University(康奈尔大学) University of Oxford(牛津大学)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09023 2025-07-15 cs.SE cs.AI cs.MA 57%

Accelerating Drug Discovery Through Agentic AI: A Multi-Agent Approach to Laboratory Automation in the DMTA Cycle

Yao Fehlis, Charles Crain, Aidan Jensen, Michael Watson, James Juhasz, Paul Mandel, Betty Liu, Shawn Mahon, Daren Wilson, Nick Lynch-Jonely, Ben Leedom, David Fuller

机构 * Artificial, Inc.(Artificial公司)

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22941 2025-07-15 cs.HC cs.AI 57%

Positioning AI Tools to Support Online Harm Reduction Practice: Applications and Design Directions

Kaixuan Wang, Jason T. Jacques, Chenxin Diao, Carl-Cyril J Dreue

机构 * University of St. Andrews(圣安德鲁大学) Independent Researcher(独立研究者) University of Edinburgh(爱丁堡大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

Comments 16 pages, 4 figures, with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06907 2025-07-10 cs.LG cs.SE 57%

Robust and Safe Traffic Sign Recognition using N-version with Weighted Voting

Linyun Gao, Qiang Wen, Fumio Machida

机构 * Department of Computer Science, University of Tsukuba(计算机科学系,筑波大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments 27 pages including appendix, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏