Inverse Safety Filtering: Inferring Constraints from Safety Filters for Decentralized Coordination
逆安全过滤:从安全过滤器推断约束以实现去中心化协调
专题命中 安全训练 :safety(title,abstract)
AI总结 本文提出一种在线方法,通过观察其他智能体的安全过滤动作推断约束,结合去中心化规划方法确保安全,通过仿真和硬件实验验证有效性。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
逆安全过滤:从安全过滤器推断约束以实现去中心化协调
专题命中 安全训练 :safety(title,abstract)
AI总结 本文提出一种在线方法,通过观察其他智能体的安全过滤动作推断约束,结合去中心化规划方法确保安全,通过仿真和硬件实验验证有效性。
大语言模型预训练和后训练数据中的政治内容是什么?
机构 * Bocconi University(博科尼大学) ; University of Manchester(曼彻斯特大学) ; Princeton University(普林斯顿大学)
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 研究探讨了大语言模型训练数据中的政治倾向,发现预训练数据偏向左翼内容,且政治立场与模型行为相关,强调数据组成对模型行为的关键作用。
Comments 10 pages, under review
Prism:通过可解释的策略映射实现策略重用
专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 Prism框架通过可解释的策略映射将强化学习智能体的决策基于离散因果验证的概念,并利用这些概念作为零样本迁移接口。该方法通过K-means聚类将每个智能体的编码特征划分为K个概念,通过因果干预验证这些概念直接驱动智能体行为,从而实现策略知识的零样本迁移。
Comments 13 pages, 3 figures, 5 tables