arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-23 至 2026-04-23 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 7 篇

2604.20685 2026-04-23 cs.LG 93%

MGDA-Decoupled: Geometry-Aware Multi-Objective Optimisation for DPO-based LLM Alignment

MGDA-Decoupled:基于几何的多目标优化用于基于DPO的LLM对齐

Andor Vári-Kakas, Ji Won Park, Natasa Tagasovska

机构 * Prescient Design, CS CoE, Genentech | Roche(预见设计,计算机科学学院,基因泰克 | 罗氏)

专题命中 偏好对齐 :DPO(title,title_cn);alignment(title,abstract);harmlessness(abstract);分类 cs.LG

AI总结 本文提出MGDA-Decoupled算法,通过几何方法在DPO框架内实现更公平的多目标优化,实验显示其在UltraFeedback数据集上表现最优。

Comments Accepted to the Algorithmic Fairness Across Alignment Procedures and Agentic Systems Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12817 2026-04-23 cs.CL cs.AI cs.CY 75%

From Noise to Signal to Selbstzweck: Reframing Human Label Variation in the Era of Post-training in NLP

从噪声到信号到自我目的:在NLP后训练时代的重新框架化人类标签变异

Shanshan Xu, Santosh T. Y. S. S, Barbara Plank

机构 * Department of Computer Science, University of Copenhagen, Denmark(丹麦哥本哈根大学计算机科学系) Faculty of Law, University of Copenhagen, Denmark(丹麦哥本哈根大学法学院) Amazon(亚马逊) LMU Munich & Munich Center for Machine Learning (MCML)(慕尼黑大学及慕尼黑机器学习中心(MCML))

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文探讨人类标签变异在NLP后训练时代的重要性,提出将其作为内在价值自我目的进行保护,以提升模型鲁棒性和社会技术安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16399 2026-04-23 cs.LG math.OC 70%

A Hessian-Free Actor-Critic Algorithm for Bi-Level Reinforcement Learning with Applications to LLM Fine-Tuning

一种用于双层强化学习的无Hessian演员-评论员算法及其在大语言模型微调中的应用

Sihan Zeng, Sujay Bhatt, Sumitra Ganesh, Alec Koppel

机构 * JPMorgan AI Research(摩根大通AI研究) Johns Hopkins University Applied Physics Laboratory(约翰霍普金斯大学应用物理实验室)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出一种单循环一阶演员-评论员算法,用于解决双层优化问题,通过惩罚重述法优化双层目标,引入衰减熵正则化以实现无偏上层超梯度估计,且在特殊Polyak-Lojasiewicz条件下证明了有限时间与样本收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15174 2026-04-23 cs.CL cs.AI 62%

SMARTER: A Data-efficient Framework to Improve Toxicity Detection with Explanation via Self-augmenting Large Language Models

SMARTER: 一种数据高效框架,通过自增强大语言模型提升毒性检测与解释

Huy Nghiem, Advik Sachdeva, Hal Daumé

机构 * University of Maryland(马里兰大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 SMARTER通过两阶段框架利用大语言模型自身输出生成解释,提升内容审核的可解释性,实验表明在三个基准任务中实现13%的宏F1提升,且数据使用量仅为全训练数据的分数。

Comments ACL 2026. NLP, Hate speech detection, explanation, LLM. Version 3

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19749 2026-04-23 cs.AI cs.SE 57%

The Tool-Overuse Illusion: Why Does LLM Prefer External Tools over Internal Knowledge?

工具过度使用错觉:为什么大语言模型更倾向于使用外部工具而非内部知识?

Yirong Zeng, Shen You, Yufei Liu, Qunyao Du, Xiao Ding, Yutai Hou, Yuxian Wang, Wu Ning, Haonan Song, Dandan Tu, Bibo Cai, Ting Liu

机构 * Harbin Institute of Technology, SCIR(哈尔滨理工大学SCIR研究所) Peking University(北京大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本文揭示大语言模型在推理中普遍存在工具过度使用现象,通过分析内部知识可用性区域,提出知识感知边界对齐策略,减少工具使用82.8%,并发现仅以结果奖励会鼓励工具过度使用,通过平衡奖励信号可减少66.7%的无用工具调用。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12652 2026-04-23 cs.CV cs.AI 57%

PromptEcho: Annotation-Free Reward from Vision-Language Models for Text-to-Image Reinforcement Learning

PromptEcho:基于视觉语言模型的无标注奖励用于文本到图像强化学习

Jinlong Liu, Wanggui He, Peng Zhang, Mushui Liu, Hao Jiang, Pipei Huang

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 PromptEcho通过冻结的视觉语言模型计算token级交叉熵损失,无需标注或训练奖励模型,提升文本到图像模型的提示跟随能力,实验显示在多个基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20749 2026-04-23 cs.AI 57%

Where and What: Reasoning Dynamic and Implicit Preferences in Situated Conversational Recommendation

何处与何物:在情境对话推荐中推理动态和隐性偏好

Dongding Lin, Jian Wang, Yongqi Li, Wenjie Li

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) College of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本文提出SiPeR框架,通过场景转换估计和贝叶斯逆推推理,提升情境对话推荐的准确性和响应质量。

Comments Accpeted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏