Combining Theory of Mind and Kindness for Self-Supervised Human-AI Alignment
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);safety(abstract);分类 cs.AI
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);safety(abstract);分类 cs.AI
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);safety(abstract);分类 cs.LG
Comments NeurIPS accepted version
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL
Comments 20 pages, 9 figures
专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);RLHF(abstract);分类 cs.AI
Comments 8 pages, 19 figures
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL
Comments 24 pages, 5 pages
专题命中 偏好对齐 :safety(title,abstract);RLHF(abstract);AI safety(abstract);分类 cs.AI
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL
Comments Accepted to ACL (Main) 2024
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.CY
Comments Accepted at NeurIPS 2023 (Spotlight). Project page: https://github.com/IBM/Dromedary
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL
Comments 21 pages, 11 figures, 5 tables
机构 * Mila Quebec AI Institute(魁北克AI研究所) ; Université de Montréal(蒙特利尔大学) ; Allen Institute for AI(人工智能研究院) ; Google Deepmind(谷歌DeepMind) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
专题命中 偏好对齐 :RLHF(title,abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
Comments accepted at ICLR 2025, code at https://github.com/mnoukhov/async_rlhf, integrated into the open-instruct library https://github.com/allenai/open-instruct
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Large Language Models; Reasoning; Alignment
小语言模型领域适应的可信性代价:一项跨架构实证研究
专题命中 偏好对齐 :DPO(abstract,abstract_cn);safety(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文通过对三类SLM架构、三个领域、两类训练数据及四种微调策略的216组实验,量化了领域适应的可信性代价,发现对抗扰动训练数据可提升适应质量且不降低可信性,部分安全策略反而增加对抗伤害易感性。
Comments 13 pages, 7 tables, 2 appendices (Reproducibility Checklist; Software and Data Availability). Code, model checkpoints, and datasets publicly available at https://github.com/rbpdlf/slm-trw
稳定价值冲突解决的几何视角
机构 * University of Illinois - Urbana-Champaign(伊利诺伊大学厄巴纳 - 香槟分校) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(abstract);分类 cs.AI、cs.LG
AI总结 研究大语言模型在RLHF训练中应对价值冲突的问题,核心方法是利用思维链推理,通过几何视角分析其作用,创建新的以价值冲突为重点的CoT设计,提升了道德推理性能,为改进模型处理复杂价值冲突请求的性能提供新途径。
Comments Accepted to ICML Workshop on High-Dimensional Learning Dynamics
RLearner-LLM: 通过混合直接偏好优化平衡大语言模型中的逻辑性与流畅性
机构 * University of Auckland(奥克兰大学) ; Aalto University(阿alto大学)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出RLearner-LLM,通过融合DeBERTa-v3 NLI信号与验证器LLM评分,解决直接偏好优化在知识密集型生成中的逻辑对齐问题,实现NLI指标显著提升。
隐藏共识:人类反馈中的偏好有效性压缩
机构 * YTL AI Labs ; Universiti Malaya(马来亚大学) ; Monash University Malaysia(莫纳什大学马来西亚校区) ; Universiti Malaysia Sarawak(马来西亚沙捞越大学)
专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出偏好有效性压缩问题,即RLHF将多元有效反馈压缩为单一奖励目标,导致对齐测量偏差。通过马来西亚语料分析,79%的提示存在多个多数支持响应,表明多数聚合测量的是argmax可接受性而非多元对齐。
Comments 28 pages. When AI learns from human feedback, it forces a single "correct" answer, but sometimes multiple answers are all genuinely valid, and that nuance gets thrown away
人们真正希望从AI中得到什么?偏好多元性映射
机构 * Oxford Internet Institute, University of Oxford(牛津大学互联网研究所) ; Meedan
专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(abstract);分类 cs.CL、cs.CY
AI总结 通过分析75个国家1500份开放式回答,发现不同人对AI的期望各异,多数价值观仅被少数人要求,且同一词语(如“真实性”)含义分歧,某些能力存在争议,揭示当前RLHF偏好聚合方法的根本缺陷。
Comments Accepted at the 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26)
PageLLM:面向整页优化的大语言模型多粒度奖励框架
机构 * Arizona State University(亚利桑那州立大学) ; Nokia(诺基亚) ; University of Kansas(堪萨斯大学)
专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(abstract);分类 cs.AI、cs.LG
AI总结 针对整页优化中人工标注成本高和页面级连贯性与项目级放置粒度不匹配的问题,提出PageLLM框架,通过将隐式反馈解耦为粗粒度页面级奖励和细粒度项目级奖励,结合PPO的RLHF进行微调,显著提升排序性能并在线上部署中取得收益。
InfiFPO:通过偏好优化实现大型语言模型的隐式模型融合
机构 * The Hong Kong Polytechnic University (PolyU)(香港理工大学) ; Zhejiang University(浙江大学) ; PolyU-Daya Bay Technology and Innovation Research Institute(香港理工大学-大亚湾技术与创新研究院)
专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract);分类 cs.CL、cs.LG
AI总结 提出InfiFPO方法,通过将DPO中的参考模型替换为融合源模型,在序列级别合成多源概率,实现隐式模型融合,从而在偏好对齐阶段有效融合多个LLM并提升性能。
Journal ref NeurIPS 2025
Optimus: 一种用于在微调对话AI时缓解毒性行为的稳健防御框架
机构 * University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)
专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);safety(abstract);jailbreak(abstract)
AI总结 本研究提出Optimus框架,通过整合训练无关的毒性分类方案和双重策略对齐过程,有效缓解微调过程中的毒性问题,并在有毒性分类器偏差时仍能保持高召回率,优于现有最佳防御方法StarDSS。
Comments Accepted at ACM CODASPY 2026
扰动探测:对齐语言模型中FFN行为电路的双次提示诊断
机构 * Palo Alto Networks(帕洛阿尔托网络公司)
专题命中 偏好对齐 :RLHF(summary_cn,abstract);safety(abstract);分类 cs.CL、cs.LG
AI总结 通过双次提示传递和无反向传播的扰动探测,识别LLM中两种行为电路结构,揭示RLHF组织的行为机制及模板层编辑工具。
基于探针的数据归因:发现并缓解LLM微调后的不良行为
机构 * California Institute of Technology(加利福尼亚理工学院)
专题命中 偏好对齐 :DPO(summary_cn,abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出基于探针的数据归因方法,通过分析测试提示和偏好对的激活差异向量,识别导致特定行为的数据点,并通过重新训练验证归因。该方法在OLMo 2的生产DPO训练中发现有害行为,过滤数据点可显著减少此类行为。
裁剪不安全的票据:一种资源高效的更安全且更稳健的大语言模型框架
机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心)
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);safety(abstract);jailbreak(abstract)
AI总结 本文提出一种资源高效的剪枝框架,通过识别并移除与不安全行为相关的参数,减少不安全生成并提高对抗鲁棒性,同时保持模型性能。
倾听、纠正与反馈:口语教学反馈生成
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学)
专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出SPFG数据集,基于Speak & Improve 2025语料,结合流畅性转录与GEC目标及人工验证的教师风格反馈,评估三种LLM在生成纠错与反馈中的表现,发现SFT效果最佳,DPO/KTO效果不一致,纠错与反馈质量弱相关。
Comments NLP8506 course project
偏好而非安全:成对偏好并非临床安全的可靠替代指标
机构 * EPFL(洛桑联邦理工学院) ; LiGHT Laboratory(LiGHT实验室)
专题命中 偏好对齐 :safety(title,abstract);harmlessness(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究表明临床医生成对偏好并非LLM临床安全的可靠替代指标,其排名靠前的模型仍存在大量临床安全失败,提出结合偏好与安全反馈的临床调整排名方法,支持分离偏好与安全的评估实践。
Comments 27 pages,10 figures
AIGP:基于LLM的电商定价长期价值对齐框架
机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝天猫集团)
专题命中 偏好对齐 :alignment(title);DPO(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 提出AIGP框架,利用大语言模型结合领域知识与结构化数据,通过离线强化学习训练的长期价值评估器进行偏好优化,实现可解释的定价决策,在淘宝工厂的在线实验中GMV提升13.21%。
Comments Accepted by KDD 2026 Applied Data Science Track (Oral presentation)
MENTIS: 对齐改变了什么信念?语言模型中多尺度潜在扭转的测量
机构 * Pragya Lab, BITS Pilani Goa, India(BITS Pilani 去掉 Goa 的机构名,因为该机构名中包含 'Goa',但根据规则,如果机构已有常见中文名,使用常见中文名。'Pragya Lab, BITS Pilani' 是 BITS Pilani 的一个实验室,因此翻译为 'BITS Pilani 实验室') ; IIIT Delhi, India(德里印度理工学院) ; Amazon, USA(美国亚马逊) ; Meta, USA(美国Meta) ; Apple, USA(美国苹果)
专题命中 偏好对齐 :alignment(title,abstract);prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出MENTIS框架,通过层间协方差扭转范数、谱扭转诊断和能量-辐射-激活度量,测量偏好对齐在语言模型内部计算中引起的选择性、深度局部的几何结构变化。
Comments Submitted to EMNLP 2026
无奖励的冲突目标对齐
机构 * Columbia University(哥伦比亚大学)
专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出RACO框架,通过冲突规避梯度下降的裁剪变体直接利用成对偏好数据解决多目标冲突,实现帕累托最优对齐。
Comments Accepted to ICML 2026 (Oral)
相对密度比优化用于稳定且统计一致的模型对齐
机构 * NTT, Inc.(日本电信电话株式会社) ; NTT DOCOMO, INC.(NTT DOCOMO公司)
专题命中 偏好对齐 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出一种稳定且统计一致的模型对齐方法,通过相对密度比优化,改进了直接密度比优化的稳定性与收敛性。
Comments Code is available at https://github.com/takahashihiroshi/rdro
AdaBoN: 适应性最佳N对齐
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出一种适应性最佳N对齐策略,通过两阶段算法高效分配推理计算资源,实验证明其在不同提示批次中优于均匀分配方法。
Comments 25 pages