arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3281 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3281 篇

2511.09073 2025-11-18 cs.FL cs.AI cs.GT 57%

Good-for-MDP State Reduction for Stochastic LTL Planning

Christoph Weinhuber, Giuseppe De Giacomo, Yong Li, Sven Schewe, Qiyi Tang

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments 16 pages including appendices, accepted to AAAI 2026; fixed some typoes

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11402 2025-11-17 cs.LG 57%

Multi-Phase Spacecraft Trajectory Optimization via Transformer-Based Reinforcement Learning

Amit Jain, Victor Rodriguez-Fernandez, Richard Linares

机构 * Aeronautics & Astronautics, Massachusetts Institute of Technology(航空与宇航科学系,麻省理工学院) Department of Computer Systems Engineering, Universidad Politécnica de Madrid(计算机系统工程系,马德里理工大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11014 2025-11-17 cs.CV cs.CY 57%

SP-Guard: Selective Prompt-adaptive Guidance for Safe Text-to-Image Generation

Sumin Yu, Taesup Moon

机构 * Department of Electrical and Computer Engineering, Seoul National University, Seoul, South Korea(电气与计算机工程系,首尔国立大学,首尔,韩国) IPAI / ASRI / INMC, Seoul National University, Seoul, South Korea(IPAI/ASRI/INMC,首尔国立大学,首尔,韩国)

专题命中 安全训练 :safety(abstract);分类 cs.CY

Comments Accepted for presentation at TRUST-AI Workshop, ECAI 2025. Proceedings to appear in CEUR-WS

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07486 2025-11-12 cs.LG cs.SY eess.SY stat.ML 57%

Provably Efficient Sample Complexity for Robust CMDP

Sourav Ganguly, Arnob Ghosh

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06111 2025-11-11 cs.LG 57%

Guardian-regularized Safe Offline Reinforcement Learning for Smart Weaning of Mechanical Circulatory Devices

Aysin Tumay, Sophia Sun, Sonia Fereidooni, Aaron Dumas, Elise Jortberg, Rose Yu

机构 * University of California(加州大学) California Institute of Technology(加州理工学院) Abiomed(阿比omed)

专题命中 安全训练 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06094 2025-11-11 cs.LG 57%

Approximating Shapley Explanations in Reinforcement Learning

Daniel Beechey, Özgür Şimşek

机构 * University of Bath(巴斯大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments Camera-ready version. Published at the Conference on Neural Information Processing Systems (NeurIPS 2025)

Journal ref Proceedings of the Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05532 2025-11-11 cs.CL 57%

Beyond One-Size-Fits-All: Personalized Harmful Content Detection with In-Context Learning

Rufan Zhang, Lin Zhang, Xianghang Mi

机构 * University of Science and Technology of China(科学技术大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05286 2025-11-10 cs.CL 57%

Reflective Personalization Optimization: A Post-hoc Rewriting Framework for Black-Box Large Language Models

Teqi Hao, Xioayu Tan, Shaojie Shi, Yinghui Xu, Xihe Qiu

机构 * School of Electronic and Electrical Engineering, Shanghai University of Engineering Science(上海工程技术大学电子与电气工程学院) Tencent Youtu Lab(腾讯优图实验室) Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04215 2025-11-07 cs.CR cs.CL 57%

Black-Box Guardrail Reverse-engineering Attack

Hongwei Yao, Yun Xia, Shuo Shao, Haoran Shi, Tong Qiao, Cong Wang

机构 * City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04147 2025-11-07 cs.LG 57%

Exchange Policy Optimization Algorithm for Semi-Infinite Safe Reinforcement Learning

Jiaming Zhang, Yujie Yang, Haoning Wang, Liping Zhang, Shengbo Eben Li

机构 * Department of Mathematical Sciences Tsinghua University(清华大学数学科学系) School of Vehicle and Mobility Tsinghua University(清华大学车辆与移动系统学院) Department of Mathematical Sciences, Tsinghua University(清华大学数学科学系) School of Vehicle and Mobility & College of AI Tsinghua University(清华大学车辆与移动系统学院与人工智能学院)

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments Submitted to the Journal of Machine Learning Research (JMLR), under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03106 2025-11-06 cs.AI 57%

Large language models require a new form of oversight: capability-based monitoring

Katherine C. Kellogg, Bingyang Ye, Yifan Hu, Guergana K. Savova, Byron Wallace, Danielle S. Bitterman

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02997 2025-11-06 cs.AI 57%

Evaluating Control Protocols for Untrusted AI Agents

Jon Kutasov, Chloe Loughridge, Yuqi Sun, Henry Sleight, Buck Shlegeris, Tyler Tracy, Joe Benton

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09024 2025-11-05 cs.CV cs.LG 57%

DIsoN: Decentralized Isolation Networks for Out-of-Distribution Detection in Medical Imaging

Felix Wagner, Pramit Saha, Harry Anthony, J. Alison Noble, Konstantinos Kamnitsas

机构 * Department of Engineering Science, University of Oxford(工程科学系,牛津大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00112 2025-11-04 cs.RO cs.AI 57%

Real-DRL: Teach and Learn in Reality

Yanbing Mao, Yihao Cai, Lui Sha

机构 * Engineering Technology Division(工程科技部门) Wayne State University(韦恩州立大学) Department of Electrical and Computer Engineering(电气与计算机工程系) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18779 2025-11-03 cs.CL 57%

KAT-Coder Technical Report

Zizheng Zhan, Ken Deng, Jinghui Wang, Xiaojiang Zhang, Huaixi Tang, Minglei Zhang, Zhiyi Lai, Haoyang Huang, Wen Xiang, Kun Wu, Wenhao Zhuang, Shaojie Wang, Shangpeng Yan, Kepeng Lei, Zongxian Feng, Huiming Wang, Zheng Lin, Mengtong Li, Mengfei Xie, Yinghan Cui, Xuxing Chen, Chao Wang, Weihao Li, Wenqiang Zhu, Jiarong Zhang, Jingxuan Xu, Songwei Yu, Yifan Yao, Xinping Lei, C. Zhang, Han Li, Junqi Xiong, Zuchen Gao, Dailin Li, Haimo Li, Jiaheng Liu, Yuqun Zhang, Junyi Peng, Haotian Zhang, Bin Chen

机构 * Kwaipilot Team(Kwaipilot 团队)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23960 2025-10-29 cs.CV cs.AI cs.CR 57%

SafeVision: Efficient Image Guardrail with Robust Policy Adherence and Explainability

Peiyang Xu, Minzhou Pan, Zhaorun Chen, Shuang Yang, Chaowei Xiao, Bo Li

机构 * University of Chicago(芝加哥大学) Virtue AI Meta University of Wisconsin, Madison(威斯康星大学麦迪逊分校)

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments 42 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18253 2025-10-28 cs.RO cs.AI 57%

Depth-Constrained ASV Navigation with Deep RL and Limited Sensing

Amirhossein Zhalehmehrabi, Daniele Meli, Francesco Dal Santo, Francesco Trotti, Alessandro Farinelli

机构 * Department of Computer Science, University of Verona(计算机科学系,威尼斯大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments 8 pages, 8 figures, Accepted to IEEE Robotics and Automation Letters (this is not the final version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21853 2025-10-28 cs.CL 57%

Policy Optimization Prefers The Path of Least Resistance

Debdeep Sanyal, Aakash Sen Sharma, Dhruv Kumar, Saurabh Deshpande, Murari Mandal

机构 * Birla AI Labs(Birla人工智能实验室) InvideoAI BITS Pilani(比斯·皮尔尼学院) Kalinga Institute of Industrial Technology(卡林加工业技术学院)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

Comments 21 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04654 2025-10-28 cs.AI 57%

E-bike agents: Large Language Model-Driven E-Bike Accident Analysis and Severity Prediction

Zhichao Yang, Jiashu He, Mohammad B. Al-Khasawneh, Darshan Pandit, Cirillo Cinzia

机构 * Civil and Environmental Engineering, University of Maryland(大学工程学院) Computer and Information Science, University of Pennsylvania(大学计算机与信息科学学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14483 2025-10-24 cs.CL 57%

MoMoE: Mixture of Moderation Experts Framework for AI-Assisted Online Governance

Agam Goyal, Xianyang Zhan, Yilun Chen, Koustuv Saha, Eshwar Chandrasekharan

机构 * Siebel School of Computing and Data Science(计算机与数据科学学院)

专题命中 安全训练 :trustworthy(abstract);分类 cs.CL

Comments EMNLP 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16814 2025-10-23 cs.LG cs.CV 57%

Semi-off-Policy Reinforcement Learning for Vision-Language Slow-Thinking Reasoning

Junhao Shen, Haiteng Zhao, Yuzhe Gu, Songyang Gao, Kuikun Liu, Haian Huang, Jianfei Gao, Dahua Lin, Wenwei Zhang, Kai Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17995 2025-10-22 cs.AI 57%

FABRIC: Framework for Agent-Based Realistic Intelligence Creation

Abhigya Verma, Seganrasan Subramanian, Nandhakumar Kandasamy, Naman Gupta

机构 * ServiceNow

专题命中 安全训练 :alignment(abstract);分类 cs.AI

Comments 51 Pages, 38 Listings, 5 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16255 2025-10-21 cs.CR cs.AI 57%

Detecting Adversarial Fine-tuning with Auditing Agents

Sarah Egler, John Schulman, Nicholas Carlini

机构 * MATS & Anthropic Fellows Program(MATS与Anthropic Fellow项目) Thinking Machines Lab(Thinking Machines实验室) Anthropic

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14276 2025-10-17 cs.CL 57%

Qwen3Guard Technical Report

Haiquan Zhao, Chenhan Yuan, Fei Huang, Xiaomeng Hu, Yichang Zhang, An Yang, Bowen Yu, Dayiheng Liu, Jingren Zhou, Junyang Lin, Baosong Yang, Chen Cheng, Jialong Tang, Jiandong Jiang, Jianwei Zhang, Jijie Xu, Ming Yan, Minmin Sun, Pei Zhang, Pengjun Xie, Qiaoyu Tang, Qin Zhu, Rong Zhang, Shibin Wu, Shuo Zhang, Tao He, Tianyi Tang, Tingyu Xia, Wei Liao, Weizhou Shen, Wenbiao Yin, Wenmeng Zhou, Wenyuan Yu, Xiaobin Wang, Xiaodong Deng, Xiaodong Xu, Xinyu Zhang, Yang Liu, Yeqiu Li, Yi Zhang, Yong Jiang, Yu Wan, Yuxin Zhou

机构 * Qwen Team(通义实验室)

专题命中 安全训练 :safety(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12428 2025-10-15 cs.AI 57%

Biased-Attention Guided Risk Prediction for Safe Decision-Making at Unsignalized Intersections

Chengyang Dong, Nan Guo

专题命中 安全训练 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10633 2025-10-14 cs.AI 57%

Collaborative Text-to-Image Generation via Multi-Agent Reinforcement Learning and Semantic Fusion

Jiabao Shi, Minfeng Qi, Lefeng Zhang, Di Wang, Yingjie Zhao, Ziying Li, Yalong Xing, Ningran Li

机构 * Minzu University of China(民族大学) City University of Macau(澳门城市大学) Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(计算能力网络与信息安全重点实验室,教育部,山东计算机科学中心(济南国家超级计算机中心),齐鲁工业大学(山东省科学院)) The University of Adelaide(阿德莱德大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

Comments 16 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11411 2025-10-13 cs.LG 57%

Detecting and Filtering Unsafe Training Data via Data Attribution with Denoised Representation

Yijun Pan, Taiwei Shi, Jieyu Zhao, Jiaqi W. Ma

机构 * University of Michigan(密歇根大学) University of Southern California(南加州大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全训练 :trustworthy(abstract);分类 cs.LG

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08428 2025-10-13 cs.RO cs.AI cs.SY eess.SY 57%

SwarmGPT: Combining Large Language Models with Safe Motion Planning for Drone Swarm Choreography

Martin Schuck, Dinushka Orrin Dahanaggamaarachchi, Ben Sprenger, Vedant Vyas, Siqi Zhou, Angela P. Schoellig

机构 * Learning Systems and Robotics Lab(学习系统与机器人实验室) Munich Institute of Robotics and Machine Intelligence(慕尼黑机器人与机器智能研究所) Technical University of Munich(慕尼黑技术大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments Accepted at RA-L 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09200 2025-10-13 cs.CV cs.AI cs.HC 57%

Towards Safer and Understandable Driver Intention Prediction

Mukilan Karuppasamy, Shankar Gangisetty, Shyam Nandan Rai, Carlo Masone, C V Jawahar

机构 * IIIT Hyderabad(海得拉巴印度理工学院) Politecnico di Torino(托里诺理工学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13336 2025-10-13 cs.RO cs.LG 57%

Maximizing UAV Cellular Connectivity with Reinforcement Learning for BVLoS Path Planning

Mehran Behjati, Rosdiadee Nordin, Nor Fadzilah Abdullah

专题命中 安全训练 :safety(abstract);分类 cs.LG

Comments Submitted to an IEEE Conference

详情

展开后加载摘要…

URL PDF HTML 收藏