arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-05 至 2026-03-05 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 6 篇

2505.20065 2026-03-05 cs.LG cs.AI 86%

SafeDPO: A Simple Approach to Direct Preference Optimization with Enhanced Safety

SafeDPO: 一种简单的方法用于直接偏好优化并增强安全性

Geon-Hyeong Kim, Yu Jin Kim, Byoungjip Kim, Honglak Lee, Kyunghoon Bae, Youngsoo Jang, Moontae Lee

机构 * LG AI Research(LG人工智能研究)

专题命中 偏好对齐 :safety(title,abstract);alignment(abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 SafeDPO通过简单理论驱动的目标,实现轻量级且有效的安全对齐,提升安全性的同时保持有用性。

Comments 40 pages

Journal ref In Proceedings of the International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03326 2026-03-05 cs.CL cs.AI 62%

Controllable and explainable personality sliders for LLMs at inference time

用于推理时的可控且可解释的人格滑块

Florian Hoppe, David Khachaturov, Robert Mullins, Mark Huasong Meng

机构 * Technical University of Munich, Germany(慕尼黑技术大学) University of Cambridge, United Kingdom(剑桥大学) University College Dublin, Ireland(都柏林大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种模块化框架,通过顺序自适应引导方法实现LLM推理时的可控且可解释的人格控制,通过正交化引导向量提升多维人格调节的精度和效率。

Comments 20 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04217 2026-03-05 cs.CL 57%

When Do Language Models Endorse Limitations on Human Rights Principles?

语言模型何时会支持人权原则的限制?

Keenan Samway, Nicole Miu Takagi, Rada Mihalcea, Bernhard Schölkopf, Ilias Chalkidis, Daniel Hershcovich, Zhijing Jin

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Jinesis AI Lab, University of Toronto & Vector Institute(Jinesis AI实验室,多伦多大学及向量研究所) University of Michigan(密歇根大学) University of Copenhagen(哥本哈根大学) EuroSafeAI

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 本文研究了语言模型在人权原则限制上的偏见,发现模型在不同语言和提示下表现出系统性差异,揭示了AI在高风险互动中的伦理挑战。

Comments EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00450 2026-03-05 cs.IR cs.AI 57%

When Relevance Meets Novelty: Dual-Stable Periodic Optimization for Serendipitous Recommendation

当相关性与新颖性交汇:为偶然推荐的双稳定周期优化

Hongxiang Lin, Hao Guo, Zeshun Li, Erpeng Xue, Yongqian He, Zhaoyu Hu, Lei Wang, Sheng Chen, Long Zeng

机构 * Tsinghua University(清华大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本文提出CoEA方法,通过双稳定周期优化解决推荐系统中相关性与新颖性的平衡问题,提升偶然推荐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19436 2026-03-05 stat.ML cs.LG 57%

Low-Rank Contextual Reinforcement Learning from Heterogeneous Human Feedback

低秩上下文强化学习从异质人类反馈

Seong Jin Lee, Will Wei Sun, Yufeng Liu

机构 * Department of Statistics and Operations Research, University of North Carolina, Chapel Hill(统计与运筹学系,北卡罗来纳大学 Chapel Hill 分校) Daniels School of Business, Purdue University(商务学院,普渡大学) Department of Statistics and Operations Research, Department of Genetics, Department of Biostatistics, The University of North Carolina at Chapel Hill(统计与运筹学系,遗传学系,生物统计学系,北卡罗来纳大学 Chapel Hill 分校)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

AI总结 本文提出LoCo-RLHF框架,通过整合上下文信息和低秩结构,有效应对异质人类反馈的挑战,提升个性化强化学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05339 2026-03-05 cs.CL 57%

Flattery, Fluff, and Fog: Diagnosing and Mitigating Idiosyncratic Biases in Preference Models

奉承、浮夸与雾:诊断和缓解偏好模型中的固有偏见

Anirudh Bharadwaj, Chaitanya Malaviya, Nitish Joshi, Mark Yatskar

机构 * University of Pennsylvania(宾夕法尼亚大学) New York University(纽约大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 本研究通过反事实数据增强方法缓解偏好模型中的固有偏见,减少校准错误和偏斜差异,提升模型可靠性。

Comments Published at ICLR 2026; Code and data available at https://github.com/anirudhb123/preference-model-biases

详情

展开后加载摘要…

URL PDF HTML 收藏