arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-28 至 2026-05-28 共收录 14 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 14 篇

2605.28583 2026-05-28 cs.RO cs.AI cs.LG cs.SY eess.SY 81%

SARAD: LLM-Based Safety-Aware Hybrid Reinforcement Learning with Collision Prediction for Autonomous Driving

SARAD:基于LLM的安全感知混合强化学习与碰撞预测在自动驾驶中的应用

Kangyu Wu, Peng Cui, Guoxi Chen, Ya Zhang

机构 * National Natural Science Foundation (NNSF) of China(中国国家自然科学基金委员会) National Science and Major Project(国家科学技术重大专项)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 提出SARAD框架,结合大语言模型和深度强化学习,通过检索增强生成和碰撞预测模块提升自动驾驶的安全性和效率。

Comments 7 pages, 4 figures, accepted by IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27851 2026-05-28 cs.AI 79%

When Context Flips, Safety Breaks: Diagnosing Brittle Safety in Aligned Language Models

当上下文翻转,安全失效:诊断对齐语言模型中的脆弱安全性

Dasol Choi, Alex Kwon

机构 * AIM Intelligence(AIM智能)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出上下文翻转评估方法,通过安全基准和常识控制测试12个模型,发现对齐语言模型存在安全特异性脆弱性,源于策略覆盖而非理解错误,并证明动作级护栏无法检测后果翻转。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28097 2026-05-28 cs.RO 78%

ICAN-Deploy: Identity-Stable Canary Deployment for Safety-Critical Embodied Agents

ICAN-Deploy:面向安全关键具身智能体的身份稳定金丝雀部署

Xue Qin, Simin Luan, John See, Zeyd Boukhers, Cong Yang, Zhijun Li

机构 * Harbin Institute of Technology(哈尔滨工业大学) Heriot-Watt University, Malaysia Campus(赫瑞-沃德大学马来西亚分校) Fraunhofer Institute for Applied Information Technology(弗劳恩霍夫应用信息技术研究所) Soochow University(苏州大学)

专题命中 安全训练 :safety(title,abstract)

AI总结 提出ICAN-Deploy中间件,通过分离能力名称与版本,在安全关键具身智能体的金丝雀部署中保持身份哈希不变,避免重新认证。

Comments 14 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27948 2026-05-28 cs.RO 78%

VLM-Based Advanced Rider Assistance System for Motorcycle Safety

基于VLM的摩托车安全高级骑手辅助系统

Mohamed Elnoor, Francesca Baldini, Ananya Trivedi, Faizan M. Tariq, Jovin D'sa, David Isele, Sangjae Bae, Dinesh Manocha, Yosuke Sakamoto

机构 * HRI Honda Research Institute(本田研究院) University of Maryland(马里兰大学) Northeastern University(东北大学)

专题命中 安全训练 :safety(title,abstract)

AI总结 提出一种利用视觉语言模型进行语义感知和风险感知规划的摩托车高级骑手辅助系统,通过构建密集风险地图并采用基于采样的规划器,在CARLA模拟器中实现更高的成功率和更低的风险暴露。

Comments Accepted to IEEE IV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28372 2026-05-28 cs.LG cs.RO 74%

Teacher-Student Representational Alignment for Reinforcement Learning-Driven Imitation Learning

教师-学生表征对齐用于强化学习驱动的模仿学习

Meraj Mammadov, Pedro Zuidberg Dos Martires, Johannes Andreas Stork

机构 * Department of Computer Science(计算机科学系) Örebro University(奥雷布罗大学)

专题命中 安全训练 :alignment(title);分类 cs.LG

AI总结 提出一种通过自监督对比学习构建共享嵌入空间的方法,以减小教师和学生策略之间的不可模仿差距,从而提升学生策略性能。

Comments 6 pages, 5 figures. Accepted as an oral presentation at the RL4IL Workshop at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28617 2026-05-28 cs.AI cs.PL 70%

LACUNA: Safe Agents as Recursive Program Holes

LACUNA: 作为递归程序空洞的安全智能体

Yaoyu Zhao, Yichen Xu, Oliver Bračevac, Cao Nguyen Pham, Frank Zhengqing Wu, Martin Odersky

机构 * EPFL(苏黎世联邦理工学院)

专题命中 安全训练 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 提出LACUNA编程模型,通过类型化调用和编译时检查,让LLM智能体以递归程序空洞的方式安全地编写代码,实现表达性与安全性的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27763 2026-05-28 cs.LG 70%

A Paired Testing Protocol for Batch-Conditioned Refusal Robustness in LLM Serving

LLM服务中基于批处理条件的拒绝鲁棒性配对测试协议

Sahil Kadadekar

机构 * Independent Researcher(独立研究者)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 提出配对测试协议,通过四项研究验证批处理条件对LLM安全标签的影响,发现批处理导致的安全标签翻转率低但存在,建议精确堆栈验证。

Comments 12 pages. Accepted to the ICML 2026 Workshop on Hypothesis Testing

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27494 2026-05-28 cs.CR cs.AI cs.CL cs.IR cs.LG 67%

Grounded Cache Routing for Retrieval-Augmented Generation: When Is It Safe to Reuse an Answer?

基于证据的缓存路由用于检索增强生成:何时可以安全地重用答案?

Syed Huma Shah

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出GroundedCache,一种通过四个廉价门控(查询相似性、检索证据重叠、源版本有效性和词汇支持)验证缓存答案安全性的路由方法,显著降低不安全服务率。

Comments 19 pages, 9 figures, 10 tables. Code: https://github.com/syedhumarahim/grounded-cache-router

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28023 2026-05-28 cs.CV cs.AI cs.CL cs.MM 62%

VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning

VCap: 用于弱到强视觉字幕的超几何奖励

Xingyu Lu, Jinpeng Wang, Yi-Fan Zhang, Yankai Yang, Yancheng Long, Yiyang Fan, Xuanyu Zheng, Haonan Fan, Kaiyu Jiang, Tianke Zhang, Changyi Liu, Bin Wen, Fan Yang, Tingting Gao, Han Li, Chun Yuan

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校) Chinese Academy of Sciences(中国科学院) Kuaishou Technology(快手科技)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出VCap,一种证人-裁判奖励机制,通过超几何分布级别的精度验证视觉信号中参考字幕与策略生成字幕之间的事实一致性,实现弱到强泛化,在多个图像和视频字幕基准上超越SOTA模型。

Comments 28 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15894 2026-05-28 cs.CL cs.LG 62%

Quality-constrained Entropy Maximization Policy Optimization for LLM Diversity

质量约束的熵最大化策略优化用于LLM多样性

Haihui Pan, Yuzhong Hong, Kaichen Zhang, Shaoke Lv, Junwei Bao, Hongfei Jiang, Yang Song

机构 * Zuoyebang Education Technology(左叶bang教育科技)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 提出QEMPO框架,通过理论推导的闭式解在保证输出质量的同时最大化熵以提升LLM多样性,实验证明其在不牺牲质量的情况下提升多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28553 2026-05-28 cs.AI cs.CR 57%

Refusal Before Decoding: Detecting and Exploiting Refusal Signals in Intermediate LLM Activations

解码前拒绝:检测和利用中间LLM激活中的拒绝信号

Matteo Gioele Collu, Riccardo Conte, Alberto Giaretta, Denis Kleyko, Mauro Conti, Matteo Zavatteri, Roberto Confalonieri

机构 * University of Padua(帕多瓦大学) Örebro University(欧雷布罗大学) Fondazione Bruno Kessler(布鲁诺·凯索基金会)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文通过线性探针在变压器块的残差流激活中检测拒绝行为,并提出Mechanistic AutoDAN方法,利用探针引导的遗传搜索实现高效攻击,显著降低搜索时间并保持攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01735 2026-05-28 cs.CL 57%

Less is More: Geometric Unlearning for LLMs with Minimal Data Disclosure

少即是多:面向LLM的几何遗忘方法,实现最小数据披露

Chenchen Tan, Xinghao Li, Shujie Cui, Youyang Qu, Cunjian Chen, Longxiang Gao

机构 * Faculty of Information Technology, Monash University, Clayton, Victoria, Australia.(墨尔本大学信息技术学院,澳大利亚维多利亚州克莱顿分校)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 提出几何遗忘(GU)方法,通过操作模型隐藏状态并利用少量安全参考提示和锚点上下文合成提示,在无需原始训练数据的情况下实现高效选择性遗忘,在ToFU和UnlearnPII基准上达到强目标抑制且对非目标性能影响最小。

Comments 21 pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27375 2026-05-28 cs.CL 57%

LCO: LLM-based Constraint Optimization for Safer Agentic LLMs in Real-world Tasks

LCO:基于LLM的约束优化,用于现实任务中更安全的智能体LLM

Jiayong Wan, Jiawei Chen, Zhaoxia Yin, Liu Shuyuan, Hang Su

机构 * East China Normal University(东华大学) Beijing Zhongguancun Academy(北京中关村学院) Tsinghua University(清华大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 提出LCO框架,通过自思考模块和进化采样模块约束LLM行为,在不微调模型的情况下减少上下文奖励黑客行为,实验表明在输出优化和策略优化场景中显著提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04975 2026-05-28 cs.CY 57%

Evaluating Chinese Large Language Models: The Influence of Persona Assignment on Stereotypes and Safeguards

评估中文大语言模型:角色分配对刻板印象和安全机制的影响

Geng Liu, Li Feng, Carlo Alberto Bono, Songbo Yang, Mengxiao Zhu, Francesco Pierri

专题命中 安全训练 :safety(abstract);分类 cs.CY

AI总结 本研究通过大规模跨模型分析,量化了角色分配对四个中文大语言模型在拒绝行为和毒性输出放大方面的影响,并探索了基于外部评估器的迭代缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏