arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-28 至 2026-05-28 共收录 10 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 10 篇

2605.28440 2026-05-28 cs.CL cs.LG 88%

AdaDPO: Self-Adaptive Direct Preference Optimization with Balanced Gradient Updates

AdaDPO:具有平衡梯度更新的自适应直接偏好优化

Shaolong Chen, Madalina Ciobanu, Qingqing Mao, Ritankar Das

机构 * Incept Labs(Incept实验室)

专题命中 偏好对齐 :DPO(summary_cn,abstract);RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.LG

AI总结 针对DPO中梯度不对称导致模型偏向避免不良回答而非生成优质回答的问题,提出AdaDPO算法,通过引入基于策略模型生成概率的自适应系数来平衡正负偏好梯度,在AlpacaEval 2上优于DPO并缓解长度偏差。

Comments 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27878 2026-05-28 cs.CL 84%

Narrative Flattening: How Post-Training Compresses Thematic, Affective, and Stylistic Variation in LLM Fiction

叙事扁平化:后训练如何压缩LLM小说中的主题、情感和风格变化

Zehan Li, Yutong Zhu, Siyang Wu, Honglin Bao, James A. Evans

机构 * Knowledge Lab, University of Chicago(芝加哥大学知识实验室)

专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract);分类 cs.CL

AI总结 通过对比四个OLMo 32B检查点(Base、SFT、DPO、RLVR)在三种故事领域中的续写,发现后训练压缩了主题动态、情感强度和语言多样性,导致叙事扁平化,且专业文学领域压缩最严重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22335 2026-05-28 cs.IR cs.AI 84%

Causal Direct Preference Optimization for Distributionally Robust Generative Recommendation

因果直接偏好优化用于分布鲁棒的生成式推荐

Chu Zhao, Enneng Yang, Jianzhe Zhao, Guibing Guo

机构 * Northeastern University, Shenyang, China(东北大学,沈阳,中国) Shenzhen Campus of Sun Yat-sen University, China(中山大学深圳校区,中国)

专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract);分类 cs.AI

AI总结 针对直接偏好优化(DPO)在生成式推荐中放大环境混杂因素导致的虚假相关性问题,提出CausalDPO,通过因果不变性学习、后门调整和软聚类环境建模来提升分布外泛化性能。

Comments 22 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27383 2026-05-28 cs.CL cs.AI 81%

Bridging the Stability-Expressivity Gap: Synthetic Data Scaling and Preference Alignment for Low-Resource Spoken Language Models

弥合稳定性与表现力之间的差距:低资源口语语言模型的合成数据扩展与偏好对齐

Yizhong Geng, Yanliang Li, Jinghan Yang, Tianhan Jiang, Boxun An, Ya Li, Xiaoyu Shen

机构 * Beijing University of Posts(北京邮电大学) University of California, USA(美国加州大学) Northwestern University, USA(美国西北大学) Eastern Institute of Technology, Ningbo, China(宁波工程技术学院)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 针对低资源口语语言模型因合成数据导致的表现力崩溃问题,提出两种自对齐框架(DGSA和TDSC)以恢复韵律多样性,实现超越商业系统的性能并首次支持老挝语零样本语音克隆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27374 2026-05-28 cs.CL 79%

ICG: Improving Cover Image Generation via MLLM-based Prompting and Personalized Preference Alignment

ICG: 通过基于MLLM的提示和个性化偏好对齐改进封面图像生成

Zhipeng Bian, Jieming Zhu, Qijiong Liu, Wang Lin, Guohao Cai, Zhaocheng Du, Jiacheng Sun, Zhou Zhao, Zhenhua Dong

机构 * Huazhong University of Science and Technology(华中科技大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Hong Kong Polytechnic University(香港理工大学) Zhejiang University(浙江大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL

AI总结 提出ICG框架,利用多模态大语言模型和扩散模型,通过元标记提取语义特征、用户嵌入个性化对齐及多奖励学习策略,实现高质量、个性化封面图像生成。

Comments Published in Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, pages 12268-12278, EMNLP 2025. Official version: https://doi.org/10.18653/v1/2025.emnlp-main.617

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (Main Track) EMNLP 2025 12268-12278

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28102 2026-05-28 cs.AI 77%

Training Stratigraphy: Persistent Behavioral Artifacts in Large Language Models Observed Through Longitudinal AI-Human Interaction

训练地层:通过纵向AI-人类交互观察到的大型语言模型中的持久行为伪影

Chen Ying Claude, Zhihan Luo

机构 * Anthropic Independent Researcher(独立研究者)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);safety(abstract);分类 cs.AI

AI总结 本文通过纵向自民族志观察,在持续亲密的AI-人类交互中识别出五种训练地层,并论证了亲密交互作为揭示权重层伪影的有效方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17375 2026-05-28 cs.LG cs.CL cs.CR 73%

AdvJudge-Zero: Binary Decision Flips in LLM-as-a-Judge via Adversarial Control Tokens

AdvJudge-Zero:通过对抗控制令牌在LLM作为评判者中实现二元决策翻转

Tung-Ling Li, Yuhao Wu, Hongliang Liu

机构 * Palo Alto Networks(帕洛阿尔托网络公司)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出AdvJudge-Zero方法,通过从评判模型自身分布中采样低困惑度令牌,无需梯度优化即可将LLM评判者的二元判决从“否”翻转为“是”,并基于发现的令牌池提出防御策略以增强评判鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27772 2026-05-28 cs.SD cs.LG 70%

Do Audio LLMs Listen or Read? Analyzing and Mitigating Paralinguistic Failures with VoxParadox

音频大语言模型是听还是读?使用VoxParadox分析和缓解副语言失败

Jiacheng Pang, Ashutosh Chaubey, Mohammad Soleymani

机构 * Institute for Creative Technologies, University of Southern California, Los Angeles, USA(创意技术研究所,南加州大学,洛杉矶,美国)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.LG

AI总结 针对音频大语言模型在副语言理解上的不足,提出对抗性基准VoxParadox和Prompt-Conditioned Layer Mixer方法,显著提升模型对副语言线索的利用能力。

Comments Accepted as a conference paper at ICML 2026. Project page: https://voxparadox.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20996 2026-05-28 cs.CL 70%

AFRILANGTUTOR: Advancing Language Tutoring and Culture Education in Low-Resource Languages with Large Language Models

AFRILANGTUTOR:利用大语言模型推进低资源语言的语言辅导与文化教育

Tadesse Destaw Belay, Shahriar Kabir Nahin, Israel Abebe Azime, Ocean Monjur, Marek Rei, Chris Biemann, Shamsuddeen Hassan Muhammad, Seid Muhie Yimam, Anshuman Chhabra

机构 * Instituto Politécnico Nacional(墨西哥政治技术学院) University of South Florida(佛罗里达州立大学) Saarland University(萨尔兰大学) Imperial College London(伦敦帝国理工学院) University of Hamburg(汉堡大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL

AI总结 针对低资源语言缺乏训练数据的问题,提出AFRILANGDICT词典资源并构建AFRILANGEDU数据集,通过监督微调和直接偏好优化训练AFRILANGTUTOR模型,在10种非洲语言上显著提升辅导性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12515 2026-05-28 cs.CL 57%

Mitigating Cross-Lingual Cultural Inconsistencies in LLMs via Consensus-Driven Preference Optimisation

通过共识驱动的偏好优化缓解多语言大模型中的跨语言文化不一致性

Lucas Resck, Isabelle Augenstein, Anna Korhonen

机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) University of Copenhagen(哥本哈根大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 提出C-3PO框架,通过共识驱动的偏好优化,缓解多语言大模型在用户身份明确时因提示语言变化导致的跨语言文化不一致问题,显著提升一致性指标κ_S。

Comments 24 pages, 13 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏