arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-09 至 2026-07-09 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3 篇

2607.00572 2026-07-09 cs.AI cs.CR 新提交 88%

HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment

HARC:耦合有害性与拒绝方向以实现鲁棒的安全对齐

Shei Pern Chua, Hao Wu, Qianli Ma, Fangzhao Wu

机构 * Tsinghua University(清华大学) Southeast University(东南大学) Microsoft(微软公司)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 提出HARC微调方法,通过耦合提示和响应位置的有害性与拒绝方向,在不损害通用能力的情况下提升LLM安全对齐的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07397 2026-07-09 cs.AI cs.DB 新提交 57%

Agentic Data Environments

智能体数据环境

Elaine Ang, Chenxi Huang, Georgios Liargkovas, Jerry Liu, Jinhui Liu, Nikos Pagonas, Charlie Summers, Haonan Wang, Jiakai Xu, Tianle Zhou, Yusen Zhang, Zhou Yu, Zhuo Zhang, Tianyi Peng, Kostis Kaffes, Eugene Wu

机构 * Columbia University(哥伦比亚大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 探讨智能体数据环境,其作为智能体运行的执行基础,既能增强智能体能力又保障安全。该环境拓宽了智能体运行的数据范围,改变了对数据系统的传统认知,有望在提升智能体效能同时控制故障成本。

Journal ref IEEE Data Bulletin Vol. 50 No. 1 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07252 2026-07-09 cs.LG cs.RO 新提交 57%

Safe Reinforcement Learning using Ideas from Model Predictive Control

利用模型预测控制思想的安全强化学习

Georg Schäfer, Jakob Rehrl, Stefan Huber, Simon Hirlaender

机构 * Salzburg University of Applied Sciences(萨尔茨堡应用科学大学) Paris Lodron University of Salzburg(萨尔茨堡巴黎洛德伦大学)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 针对强化学习在安全约束方面的挑战,提出结合深度强化学习与模型预测控制的通用框架,利用系统动力学模型定义可行状态 - 动作空间,经安全过滤器投影动作,在实验室试验台验证该方法可成功探索并稳定收敛。

Comments Accepted at Eurocast 2026

详情

展开后加载摘要…

URL PDF HTML 收藏