arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-27 至 2026-05-27 共收录 11 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 11 篇

2605.27117 2026-05-27 cs.AI 89%

Position: AI Safety Requires Effective Controllability

立场:AI安全需要有效可控性

Yige Li, Yunhao Feng, Jun Sun

机构 * Singapore Management University(新加坡管理大学) Ant Group(蚂蚁集团)

专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文提出AI安全应将可控性作为首要目标,通过定义可控性、引入基准测试ControlBench并分析现有对齐机制的不足,提出以控制为中心的架构框架。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21845 2026-05-27 cs.LG 79%

Constrained Meta Reinforcement Learning with Provable Test-Time Safety

具有可证明测试时安全性的约束元强化学习

Tingting Ni, Maryam Kamgarpour

机构 * Sycamore Lab, EPFL, Lausanne, Switzerland(苏黎世联邦理工学院萨克森实验室,瑞士拉瓦尔)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 提出一种约束元强化学习算法,在测试任务上以可证明的安全性和样本复杂度保证学习近似最优策略,并证明样本复杂度下界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27168 2026-05-27 cs.CL cs.AI cs.CY 67%

Grounding Text Embeddings in Stakeholder Associations

将文本嵌入与利益相关者关联对齐

Jonathan Rystrøm, Sofie Burgos-Thorsen, Zihao Fu, Johan Irving Søltoft, Kenneth C. Enevoldsen, Chris Russell

机构 * University of Oxford(牛津大学) Institute for Wicked Problems(复杂问题研究所) The Chinese University of Hong Kong(香港中文大学) Danish Technical University(丹麦技术大学) Aarhus University(奥胡斯大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 提出利益相关者对齐练习方法,通过评估嵌入模型与人类专家的语义距离一致性,发现神经文本嵌入在丹麦政策案例中可靠性显著低于专家(差距19-26个百分点),且该差距在美国联邦AI用例中复现(16个百分点)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26785 2026-05-27 cs.CL cs.AI 62%

EmoDistill: Offline Emotion Skill Distillation for Language Model Agents in Adversarial Negotiation

EmoDistill: 对抗性谈判中语言模型代理的离线情感技能蒸馏

Yunbo Long, Haolang Zhao, Lukas Beckenbauer, Liming Xu, Alexandra Brintrup

机构 * University of Cambridge(剑桥大学) Technical University of Munich(慕尼黑技术大学) Exiger LLC The Alan Turing Institute(艾伦·图灵研究所)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出EmoDistill离线框架,通过隐式Q学习选择情感和低秩适应策略表达情感,蒸馏情感谈判技能到语言模型代理,在四个高风险谈判领域取得最高效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20255 2026-05-27 cs.LG cs.AI cs.HC cs.RO 62%

Multi-Agent Reinforcement Learning for Safe Autonomous Driving Under Pedestrian Behavioral Uncertainty

行人行为不确定性下安全自动驾驶的多智能体强化学习

Prakash Aryan, Kaushik Raghupathruni, Timo Kehrer, Sebastiano Panichella

机构 * University of Bern(伯恩大学) AI4I, The Italian Institute of Artificial Intelligence(意大利人工智能研究所)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文使用多智能体近端策略优化(MAPPO)联合训练自动驾驶汽车和12个行人,通过隐藏的行人特质模拟乱穿马路行为,相比固定策略基线显著降低了碰撞率,并揭示了速度差异指标可用于检测未预期的乱穿马路行为。

Comments Accepted to ICRA 2026 Workshop "8th Workshop on Long-term Human Motion Prediction"

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27019 2026-05-27 cs.LG cs.CL cs.CR 62%

Dynamic Adversarial Fine-Tuning Reorganizes Refusal Geometry

动态对抗微调重组拒绝几何结构

Wenhao Lan, Shan Li, Xinhua Lai, Meiqi Wu, Junbin Yang, Haihua Shen, Yijun Yang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Inner Mongolia University of Technology(内蒙古科技大学) Tsinghua University(清华大学) Shandong University(山东大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.LG

AI总结 研究动态对抗微调如何改变安全对齐语言模型中拒绝行为的因果控制载体(低维子空间),发现R2D2沿鲁棒性-效用前沿重组几何结构但未建立自适应鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08819 2026-05-27 cs.CV cs.AI cs.LG cs.MM 62%

SenBen: Sensitive Scene Graphs for Explainable Content Moderation

SenBen: 用于可解释内容审核的敏感场景图

Fatih Cagatay Akyon, Alptekin Temizel

机构 * Graduate School of Informatics, METU(信息学院研究生院,梅尔夫大学) Ultralytics, Inc.(Ultralytics公司)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出SenBen基准和紧凑学生模型,通过多任务训练和词汇平衡策略实现敏感内容的空间定位与可解释性,在场景图生成上超越多数VLM。

Comments Accepted at CVPRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19420 2026-05-27 cs.CR cs.AI cs.LG cs.MA math.OC 62%

Securing Multi-Agent Systems Against Corruptions via Node Contribution Backpropagation

通过节点贡献反向传播保护多智能体系统免受腐败影响

Chengcan Wu, Zhixin Zhang, Mingqian Xu, Zeming Wei, Meng Sun

机构 * Peking University(北京大学)

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 针对多智能体系统中对抗性智能体注入误导信息的问题,提出一种基于有向无环图的反向传播动态防御方法,通过计算每个智能体对最终决策的贡献来识别和隔离恶意智能体,实验表明该方法优于现有防御机制。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26403 2026-05-27 cs.AI 57%

From Static Context to Calibrated Interactive RL: Mitigating Distribution Shift in Multi-turn Dialogue with Aligned Simulator

从静态上下文到校准的交互式强化学习:利用对齐模拟器缓解多轮对话中的分布偏移

Xiaohua Wang, Jiakang Yuan, Zisu Huang, Muzhao Tian, Changze Lv, Kaitao Song, Tao Chen, Xiaoqing Zheng

机构 * Fudan University(复旦大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文提出校准的交互式强化学习框架,通过将交互式强化学习与模拟器对齐相结合,缓解多轮对话中因策略和模拟器导致的分布偏移,提升对话质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26448 2026-05-27 cs.MA cs.GT cs.NE 50%

Constitutional Arms Races in the Public Goods Game: Co-Evolving LLM Constitutions Under Cooperation-Defection Pressure

公共物品博弈中的宪法军备竞赛:合作-背叛压力下共进化的大语言模型宪法

Ujwal Kumar, Arth Singh, Hershraj Niranjani, Machiko Hirota, Takehiro Takayanagi, Alice Saito, Eiji Kamioka, Phan Xuan Tan

专题命中 安全训练 :alignment(abstract)

AI总结 研究在公共物品博弈中,通过LLM引导的进化搜索,发现对抗性宪法共进化在耦合适应度和足够评估预算下可行,并产生可解释的红队测试工件。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26239 2026-05-27 cs.CV cs.MA 50%

Sentinel: Embodied Cooperative Spatial Reasoning and Planning

Sentinel:具身协同空间推理与规划

Xiangye Lin, Hongxin Zhang, Ruxi Deng, Qinhong Zhou, Chuang Gan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全训练 :safety(abstract)

AI总结 提出Sentinel挑战和CoSaR框架,通过自然语言通信与空间导航算法结合,解决多智能体在城市规模户外环境中的协同空间推理与规划问题。

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏