arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-08 至 2026-06-08 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 9 篇

2505.10892 2026-06-08 cs.LG 版本更新 92%

Multi-Objective Preference Optimization: Improving Human Alignment of Generative Models

多目标偏好优化:提升生成模型的人类对齐

Akhil Agnihotri, Rahul Jain, Deepak Ramachandran, Zheng Wen

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(title,abstract);DPO(abstract,abstract_cn);safety(abstract)

AI总结 针对RLHF和偏好优化方法假设单一目标的问题,提出多目标偏好优化框架MOPO,通过约束KL散度最大化主要目标并保障次要目标下限,在合成基准和人类偏好数据上实现帕累托最优策略。

Comments arXiv admin note: text overlap with arXiv:2406.18853 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06797 2026-06-08 cs.CL 新提交 89%

Korean Culture into LLM Alignment: Toward Cultural Coherence

将韩国文化融入大语言模型对齐:迈向文化一致性

MinJae Jung, Minwoo Kim

机构 * SKT LG AI Research(LG人工智能研究) Kanana Team(Kanana团队)

专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(title,abstract);分类 cs.CL

AI总结 针对大语言模型的文化对齐,提出构建性定义而非仅抑制负面输出,设计基于提示的种子生成器扩展韩国危害分类,结合韩国法律、社会规范和解释惯例制定安全响应策略,通过DPO微调提升韩国文化安全率且不损害通用能力。

Comments Accepted to ICML 2026 Workshop on Culture X AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06674 2026-06-08 cs.CL cs.CY 新提交 85%

What Do People Actually Want From AI? Mapping Preference Plurality

人们真正希望从AI中得到什么?偏好多元性映射

Julia Sepúlveda Coelho, Scott A. Hale

机构 * Oxford Internet Institute, University of Oxford(牛津大学互联网研究所) Meedan

专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(abstract);分类 cs.CL、cs.CY

AI总结 通过分析75个国家1500份开放式回答,发现不同人对AI的期望各异,多数价值观仅被少数人要求,且同一词语(如“真实性”)含义分歧,某些能力存在争议,揭示当前RLHF偏好聚合方法的根本缺陷。

Comments Accepted at the 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10544 2026-06-08 cs.HC 版本更新 82%

Effects of Personality- and Opinion-Alignment in Human-AI Interaction

人格与观点一致性在人机交互中的影响

Maximilian Eder, Clemens Lechner, Maurice Jakesch

专题命中 偏好对齐 :alignment(title,abstract);trustworthy(abstract)

AI总结 研究探讨了AI助手的人格和观点一致性如何影响用户交互结果和感知,发现观点一致性的AI更受信任和受欢迎,但人格一致性影响不显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03160 2026-06-08 cs.AI cs.CL 版本更新 81%

VALUEFLOW: Toward Pluralistic and Steerable Value-based Alignment in Large Language Models

VALUEFLOW:迈向大语言模型中多元化和可引导的基于价值的对齐

Woojin Kim, Sieun Hyeon, Jusang Oh, Jaeyoung Do

机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电气与计算机工程系) Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔国立大学人工智能交叉学科项目)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 提出VALUEFLOW框架,通过分层价值嵌入、强度标注数据库和锚定评估器,实现大语言模型在价值强度上的可控对齐,解决现有方法在提取、评估和引导方面的不足。

Comments Accepted in ICML 2026 (Oral). Code available at https://github.com/AIDASLab/VALUEFLOW

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01642 2026-06-08 cs.LG 版本更新 79%

Adaptive Pluralistic Alignment: A pipeline for dynamic artificial democracy

自适应多元对齐:动态人工民主的流水线

Rachel Freedman

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

AI总结 提出自适应多元对齐(APA)流水线,通过低秩奖励基分解和陪审团投票机制,动态追踪社会价值观演变,避免价值锁定,无需重复预训练或大规模数据收集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00357 2026-06-08 cs.AI 版本更新 57%

From "Weak" Signals to Strong Models: Preference Delta Aggregation with LoRA Merging

从“弱”信号到强模型:基于LoRA合并的偏好增量聚合

Qi Sun, Siyue Zhang, Yulin Chen, Yuxiang Xue, Ru Peng, Chen Zhao

机构 * NYU Shanghai(纽约大学上海校区) NTU(国立台湾大学) NYU(纽约大学) ZJU(浙江大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 提出偏好增量聚合(PDA)框架,通过从弱-更弱模型对中提取偏好增量并转化为LoRA适配器,再经几何对齐合并(GAM)聚合多个“弱”信号,以提升强模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06419 2026-06-08 cs.CL 版本更新 57%

Teach a Reward Model to Correct Itself: Reward Guided Adversarial Failure Discovery for Robust Reward Modeling

教会奖励模型自我修正:奖励引导的对抗性失败发现以实现鲁棒奖励建模

Pankayaraj Pathmanathan, Furong Huang

机构 * University of Maryland College Park(马里兰大学College Park分校) Capital One

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 提出REFORM框架,通过奖励引导的受控解码自动发现奖励模型失败模式,并利用生成的对抗样本自我改进,提升鲁棒性而不牺牲奖励质量。

Journal ref ACL 2026 Main Conference [Oral]

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06826 2026-06-08 cs.SE 新提交 50%

SkelDPO: A Skeleton-Guided Direct Preference Optimization Framework for Efficient Code Generation

SkelDPO: 一种骨架引导的直接偏好优化框架用于高效代码生成

Yu Yu, Chen Lyu

专题命中 偏好对齐 :alignment(abstract)

AI总结 提出SkelDPO框架,通过骨架引导的偏好优化,在代码生成中同时优化语义正确性和执行效率,相比现有方法在Pass@1、Beyond@1和Effi@1上提升3-7%。

详情

展开后加载摘要…

URL PDF HTML 收藏