arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-27 至 2026-07-27 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 4 篇

2607.21993 2026-07-27 cs.GT 新提交 82%

Three-Body Alignment: Aligning Chess Agent with Human Reasoning through Reranked Rationale

三体对齐:通过重新排序的理由将国际象棋智能体与人类推理对齐

Jaymari Chua, Chen Wang, Liming Zhu, Lina Yao

专题命中 安全训练 :alignment(title,abstract);safety(abstract)

AI总结 研究如何通过国际象棋中的“三体对齐”,分析人类专家、引擎辅助评论员和大语言模型产生的理由间语义差异,构建多源理由数据集,进行实证分析与实验,开发数据集结构并开源,以改善智能体与人类对齐及决策的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26577 2026-07-27 cs.AI cs.CY cs.RO 版本更新 81%

Benchmarking the Safety of Large Language Models for Robotic Health Attendant Control

对大型语言模型在机器人健康护理员控制中的安全性的基准测试

Mahiro Nakao, Kazuhiro Takemoto

机构 * Kyushu Institute of Technology(九州工业技术大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.CY

AI总结 本文通过270条有害指令评估72个LLM,在模拟环境中测试其安全性,发现模型大小和发布日期影响安全性能,专有模型更安全,但医疗领域微调和提示防御策略效果有限,需将安全性作为首要考量。

Comments 20 pages, 9 figures, 3 tables, 8 pages supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21646 2026-07-27 cs.LG 新提交 79%

Adjustment Speed as a Safety Constraint for Nonstationary Reinforcement Learning

作为非平稳强化学习安全约束的调整速度

Timothy Tomashevskiy

机构 * McMaster University(麦克马斯特大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.LG

AI总结 研究非平稳强化学习中的安全问题,提出以调整速度为安全约束,用上下文表示和预测估计适应需求,与智能体适应能力比较,超限时收紧动作集并激活屏蔽,实验验证该方法可减少安全违规,支持适应可行性原则。

Comments 15 pages, 5 figures, 2 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25582 2026-07-27 cs.LG 版本更新 57%

Safe In-Context Reinforcement Learning

安全的上下文强化学习

Amir Moeini, Minjae Kwon, Alper Kamil Bozkurt, Yuichi Motai, Rohan Chandra, Lu Feng, Shangtong Zhang

机构 * University of Virginia(弗吉尼亚大学) Virginia Commonwealth University(弗吉尼亚 Commonwealth 大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 提出SCARED方法,在无参数更新的上下文强化学习适应过程中,通过精确惩罚对偶法在约束马尔可夫决策过程框架下保证安全,实现奖励最大化与成本约束。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏