arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-02 至 2026-07-02 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 4 篇

2607.00001 2026-07-02 cs.AI cs.CY 新提交 81%

Constructive Alignment: Governing Preference Dynamics in Human-AI Interaction

建构性对齐:人机交互中的偏好动态治理

Max Kanwal, Caryn Tran

机构 * Stanford University(斯坦福大学) Northwestern University(西北大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.CY

AI总结 提出建构性对齐范式,将对齐问题重构为控制人类偏好轨迹演化的控制问题,而非静态偏好满足,通过控制论框架确保价值轨迹的连贯性与反思性。

Comments 23 pages, 1 figure; Proceedings of the AAAI-26 Workshop on Machine Ethics

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01033 2026-07-02 cs.LG 新提交 70%

The Model Organism Lottery: Model Organism Interpretability Strongly Depends on Training Methodology

模式生物彩票:模式生物可解释性强烈依赖于训练方法

Andrzej Szablewski, Gabriel Konar-Steenberg, Raffaello Fornasiere, Nikita Menon, Stefan Heimersheim

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.LG

AI总结 研究通过七种训练方法构建54个模式生物,发现模式生物可解释性强烈依赖于训练目标、目标行为、模型架构和数据生成流程,集成训练通常比事后方法更不可解释,质疑当前模式生物作为可解释性代理的有效性。

Comments 9 pages, 9 figures, references and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24636 2026-07-02 cs.CL 版本更新 57%

OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning

OpenReward: 通过强化学习学习奖励长形式智能体任务

Ziyou Hu, Zhengliang Shi, Minghang Zhu, Haitao Li, Teng Sun, Pengjie Ren, Suzan Verberne, Zhaochun Ren

机构 * Leiden University(莱顿大学) Shandong University(山东大学) Tsinghua University(清华大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 提出OpenRM,一种工具增强的长形式奖励模型,通过GRPO训练联合监督工具使用和结果准确性,在长形式任务中显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19100 2026-07-02 cs.CV 新提交 50%

AMALIA-VL: A Native European Portuguese Open-Source Vision and Language Model

AMALIA-VL: 一个原生欧洲葡萄牙语开源视觉与语言模型

Diogo Glória-Silva, João Cardeira, Manuel Letras da Luz, Afonso Simplício, Gonçalo Vinagre, Diogo Tavares, Rafael Ferreira, Inês Calvo, Inês Vieira, David Semedo, João Magalhães

机构 * NOVA School of Science and Technology(NOVA科学与技术学校) NOVA LINCS

专题命中 偏好对齐 :alignment(abstract)

AI总结 针对欧洲葡萄牙语缺乏开源多模态模型的问题,提出AMALIA-VL,通过三阶段训练和葡萄牙语中心数据混合,建立强基线并开源所有资源。

详情

展开后加载摘要…

URL PDF HTML 收藏