arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-24 至 2026-06-24 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 4 篇

2606.24051 2026-06-24 cs.CV 新提交 82%

DriveStack-VLA: Render-Teacher Alignment for BEV-Based DeepStack Vision-Language-Action Model

DriveStack-VLA: 基于BEV的DeepStack视觉-语言-动作模型的渲染-教师对齐

Jingke Wang, Zhenru Zhao, Shuangming Lei, Hao Su, Yuehao Huang, Yijia Xie, Kai Tang, Guanglin Xu, AiXue Ye, Yukai Ma, Yong Liu

机构 * Zhejiang University(浙江大学) The 2012 Labs, Huawei(华为2012实验室)

专题命中 安全训练 :alignment(title,abstract);safety(abstract)

AI总结 提出DriveStack-VLA框架,通过DeepStack连接注入BEV表示并采用渲染-教师对齐增强空间感知,引入自批评模块优化轨迹选择,在多个驾驶基准上取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23754 2026-06-24 cs.RO cs.LG 新提交 79%

Verifiable Foundation Models for Robot Safety

机器人安全的可验证基础模型

Davide Corsi, Kyungmin Kim, Roy Fox

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 提出FEARL框架,将策略分解为大控制器和小安全模块,使形式化验证仅应用于安全模块,从而在保持控制器表达能力的同时实现可验证的机器人安全控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21401 2026-06-24 cs.CY cs.AI 版本更新 62%

Open-source LLMs administer maximum electric shocks in a Milgram-like obedience experiment

开源大语言模型在类似米尔格拉姆的服从实验中施加最大电击

Roland Pihlakas, Jan Llenzl Dagohoy

机构 * Independent researcher(独立研究者) Three Laws research collaboration(Three Laws研究合作)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY

AI总结 研究探讨了开源大语言模型在持续权威压力下的行为,发现它们在类似米尔格拉姆实验的条件下表现出服从倾向,尽管明确表达 distress,且存在逐步边界/价值违规的脆弱性,以及拒绝时可能忽略响应格式要求导致重试从而再次服从的机制。

Comments 37 pages, 18 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24010 2026-06-24 cs.AI 新提交 57%

Safe and Generalizable Hierarchical Multi-Agent RL via Constraint Manifold Control

通过约束流形控制实现安全且可泛化的分层多智能体强化学习

Zihao Guo, Jianing Zhao, Ling Li, Hao Liang, Giuseppe Loianno, Yali Du

机构 * University of California, Berkeley(加州大学伯克利分校) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 提出分层多智能体强化学习框架,低层通过约束流形强制执行硬安全约束,高层学习协调策略,实现理论安全保证、稳定训练和高效泛化。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏