arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-06 至 2026-04-06 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3 篇

2604.02687 2026-04-06 eess.SY cs.SY 78%

Inverse Safety Filtering: Inferring Constraints from Safety Filters for Decentralized Coordination

逆安全过滤:从安全过滤器推断约束以实现去中心化协调

Minh Nguyen, Jingqi Li, Gechen Qu, Claire J. Tomlin

专题命中 安全训练 :safety(title,abstract)

AI总结 本文提出一种在线方法,通过观察其他智能体的安全过滤动作推断约束,结合去中心化规划方法确保安全,通过仿真和硬件实验验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22367 2026-04-06 cs.CL cs.AI cs.CY 67%

What Is The Political Content in LLMs' Pre- and Post-Training Data?

大语言模型预训练和后训练数据中的政治内容是什么?

Tanise Ceron, Dmitry Nikolaev, Dominik Stammbach, Debora Nozza

机构 * Bocconi University(博科尼大学) University of Manchester(曼彻斯特大学) Princeton University(普林斯顿大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究探讨了大语言模型训练数据中的政治倾向,发现预训练数据偏向左翼内容,且政治立场与模型行为相关,强调数据组成对模型行为的关键作用。

Comments 10 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02353 2026-04-06 cs.LG cs.AI 62%

Prism: Policy Reuse via Interpretable Strategy Mapping in Reinforcement Learning

Prism:通过可解释的策略映射实现策略重用

Thomas Pravetz

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 Prism框架通过可解释的策略映射将强化学习智能体的决策基于离散因果验证的概念,并利用这些概念作为零样本迁移接口。该方法通过K-means聚类将每个智能体的编码特征划分为K个概念,通过因果干预验证这些概念直接驱动智能体行为,从而实现策略知识的零样本迁移。

Comments 13 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏