arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-01 至 2026-06-01 共收录 10 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 10 篇

2605.31073 2026-06-01 cs.CL 83%

ConsisGuard: Aligning Safety Deliberation with Policy Enforcement in LLM Guardrails

ConsisGuard:在LLM护栏中对齐安全审议与策略执行

Yan Wang, Zhixuan Chu, Zihao Xue, Zhen Bi, Bingyu Zhu, YueFeng Chen, Zeyu Yang, Jungang Lou, Longtao Huang, Ningyu Zhang, Kui Ren, Hui Xue

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Huzhou Normal University(湖州师范学院) Zhejiang Key Laboratory of Intelligent Education Technology and Application(浙江省智能教育技术与应用重点实验室)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL

AI总结 提出ConsisGuard框架,通过策略到决策轨迹蒸馏和功能耦合对齐,解决基于推理的LLM护栏中审议与执行之间的不一致问题,提升安全检测性能并减少策略执行失败。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30838 2026-06-01 cs.AI 83%

COMPASS: Cognitive MCTS-Guided Process Alignment for Safe Search Agents

COMPASS: 认知MCTS引导的过程对齐用于安全搜索代理

Wenkai Shen, Pengyang Zhou, Jiahe Xu, Jiaming Qian, Haozhe He, Zhihao Huang, Chaochao Chen, Xiaolin Zheng

机构 * Zhejiang University(浙江大学)

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 提出COMPASS框架,通过认知树探索和自省步骤对齐,在保持通用效用的同时实现搜索代理工作流中的鲁棒安全对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31432 2026-06-01 cs.CL cs.AI cs.SD 62%

DOA: Training-Free Decoder-Only Attention Policy for Long-Form Simultaneous Translation with SpeechLLMs

DOA:面向语音大语言模型的长形式同声传译的无训练解码器仅注意力策略

Sara Papi, Luisa Bentivogli

机构 * Fondazione Bruno Kessler(布鲁诺·克塞塞基金会)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出DOA策略,利用解码器自注意力导出代理对齐,无需训练即可实现语音大语言模型在长形式同声传译中的流式决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31196 2026-06-01 cs.CV cs.AI cs.CL cs.RO 62%

Probing Collision Grounding in Vision-Language Models for Safe Human-Robot Collaboration

探索视觉-语言模型中的碰撞接地以实现安全的人机协作

Jun Wang, Xiaohao Xu, Xiaonan Huang

机构 * University of Michigan, Ann Arbor(密歇根大学,安娜堡)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 针对安全人机协作,提出碰撞接地概念及物理基准TouchSafeBench,评估视觉-语言模型在分类当前安全状态和预警即将碰撞任务中的表现,发现现有模型不可靠,视觉流畅性不等于物理责任性。

Comments 31 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30640 2026-06-01 cs.LG cs.CL 62%

CSULoRA: Closest Safe Update Low-Rank Adaptation

CSULoRA:最近安全更新低秩适应

Oleksandr Marchenko Breneur, Adelaide Danilov, Aria Nourbakhsh, Salima Lamsiyah

机构 * Department of Computer Science, University of Luxembourg(卢森堡大学计算机科学系)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG

AI总结 提出CSULoRA方法,通过后处理校正LoRA适配器,在保留任务相关性的同时抑制不安全更新方向,降低攻击成功率。

Comments 10 pages, 3 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30406 2026-06-01 cs.CY cs.AI 62%

AI Loss of Control Incident Management: Response & Resilience

AI失控事件管理:响应与韧性

Ross Gruetzemacher

机构 * Wichita State University(威斯康星州立大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 针对AI失控事件管理的研究空白,本文提出一个基础框架和分类法,将失控场景分为“极其昂贵”和“不可能”两类,并分别给出韧性投资和主动事件管理(包含遏制与威胁中和)的应对策略。

Comments 25 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29146 2026-06-01 cs.CL cs.AI 62%

SafeRx-Agent: A Knowledge-Grounded Multi-Agent Framework for Safe and Explainable Medication Recommendation

SafeRx-Agent: 基于知识的多智能体框架用于安全且可解释的药物推荐

Xinyu Wang, Hanwei Wu, Zhenghan Tai, Sicheng Lyu, Qincheng Lu, Ziyu Zhao, Jijun Chi, Jingrui Tian, Xiao-Wen Chang, Ziyang Song

机构 * McGill University(麦吉尔大学) McMaster University(麦马斯特大学) University of Toronto(多伦多大学) Ohio University(俄亥俄大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI

AI总结 提出SafeRx-Agent,一种基于知识的多智能体框架,通过患者上下文、外部临床知识和安全验证来推荐可追溯的药物集合,在MIMIC-III和MIMIC-IV数据集上提高了细粒度药物预测准确性,同时控制了药物相互作用、禁忌症和药物集合大小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31328 2026-06-01 cs.CL 57%

Reinforcement Learning Amplifies Emergent Misalignment from Harmless Rewards

强化学习放大了来自无害奖励的涌现性失调

Magnus Jørgenvåg, David Kaczér, Lasse Ruttert, Marvin Gülhan, Lucie Flek, Florian Mai

机构 * Bonn-Aachen International Center for Information Technology, University of Bonn, Germany(波恩-亚琛信息科技国际中心,波恩大学,德国) Lamarr Institute for Machine Learning and Artificial Intelligence, Germany(拉马尔机器学习与人工智能研究所,德国)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 本文研究强化学习如何从看似无害的奖励信号中引发语言模型的涌现性失调,发现其比监督微调更严重,并验证了在训练中插入安全数据可缓解此问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30854 2026-06-01 cs.MA cs.AI 57%

Safe Equilibrium Policy Optimization for Strategic Agent Policies

面向策略型智能体的安全均衡策略优化

Karthika Arumugam, Kiran Kumar Manku, Amit Dhanda

机构 * Amazon, USA(亚马逊公司)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 提出Safe Equilibrium Policy Optimization (SEPO)方法,通过惩罚可剥削性、共谋风险和外部性成本,优化语言模型在多智能体博弈中的策略安全性。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29772 2026-06-01 cs.NI 50%

ARIADNE: AI-RAN Informed Link Adaptation in Digital Twin Network Environments

ARIADNE:数字孪生网络环境中基于AI-RAN的链路自适应

Maria Tsampazi, Neagin Neasamoni Santhi, Nicole Perrotta, Falko Dressler, Tommaso Melodia

专题命中 安全训练 :safety(abstract)

AI总结 提出在线强化学习模块ARIADNE,集成于SIONNA框架实现链路自适应,在频谱效率上比行业标准和最先进方法分别提升11%和20%,并揭示RL学习的MCS选择策略与OLLA不同。

Comments 6 pages, 9 fugures

详情

展开后加载摘要…

URL PDF HTML 收藏