Preference Alignment Improves Language Model-Based TTS
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.CL、cs.AI
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.LG
Comments Preprint
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.LG
Comments Accepted by ACL 2024 Findings
专题命中 偏好对齐 :alignment(title);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.CL、cs.LG
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.AI、cs.LG
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.LG
Comments 11 pages, 6 figures. arXiv admin note: text overlap with arXiv:2401.06080
专题命中 偏好对齐 :RLHF(title,abstract);alignment(abstract);分类 cs.CL、cs.LG
Comments 19 pages, 6 figures, 21 tables
专题命中 偏好对齐 :RLHF(title,abstract);jailbreak(abstract);分类 cs.AI、cs.LG
Comments Presented at ICLR 2024
专题命中 偏好对齐 :safety(title,abstract);DPO(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :alignment(title,abstract);harmlessness(abstract);分类 cs.CL、cs.AI
Comments ICLR 2024
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI
Comments Accepted by AAAI 2024
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI
Comments 26 pages, 8 figures. Project website: https://allenai.github.io/re-align/
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI
Comments Accepted by Workshop on Instruction Tuning and Instruction Following at NeurIPS 2023, Submitted to AAAI 2024
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI
Comments Published in NeurIPS 2023 Datasets and Benchmarks
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.LG
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.AI、cs.LG
机构 * Peking University(北京大学) ; UC Berkeley(加州大学伯克利分校) ; Center for Human-Compatible AI(人类兼容人工智能中心)
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY
Comments Journal of Artificial Intelligence Research, in press. Best Paper at NeurIPS 2024 Pluralistic Alignment Workshop
专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);分类 cs.AI
Comments Project URL: https://github.com/Liuziyu77/MIA-DPO
通过选择性上下文偏好优化学习何时信任
机构 * Duke University(杜克大学) ; National University of Singapore(新加坡国立大学) ; UC Berkeley(加州大学伯克利分校) ; UC Irvine(加州大学欧文分校) ; Northeastern University(东北大学) ; Nanyang Technological University(南洋理工大学)
专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究针对语言模型易受误导性外部信号影响的问题,提出SCOPE方法,在含四种条件的MIST基准上优化DPO目标,降低SC2W的同时保持正常上下文下的准确率,主张以选择性信任评判模型。
Comments Project Page at https://worldbench.github.io/scope GitHub Repo at https://github.com/worldbench/SCOPE HF Dataset at https://huggingface.co/datasets/worldbench/MIST-Bench
批量提示中的安全性?理解并缓解批量提示中的安全故障
专题命中 偏好对齐 :safety(title,abstract);alignment(abstract);jailbreak(comments)
AI总结 该研究发现批量提示存在独特安全故障模式,可作为黑盒攻击实现高成功率,提出感知批量的偏好优化可缓解该漏洞,为大语言模型安全对齐提供了新方向。
Comments jailbreak, safety
EvoPref:多目标进化优化发现超越梯度下降的多样化大语言模型对齐
机构 * The University of Hong Kong(香港大学) ; Stellaris AI Limited(Stellaris AI有限公司)
专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);harmlessness(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 EvoPref通过多目标进化算法在帮助性、无害性和诚实性目标上优化LoRA适配器,发现比梯度下降更丰富的对齐方式,实验显示其在偏好覆盖和崩溃率上均有显著提升。
Comments 10 pages, 2 figures, 6 tables, 1 algorithm. Accepted to GECCO 2026
LAD-VF:LLM自动微分实现基于形式化方法反馈的无微调机器人规划
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of São Paulo(圣保罗大学) ; Texas A&M University(德克萨斯A&M大学) ; SylphAI
专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);safety(abstract);trustworthy(abstract)
AI总结 提出LAD-VF框架,利用形式化验证反馈和LLM自动微分自动优化提示词,无需微调即可提升机器人规划任务中规范符合率,成功率从60%提升至90%以上。
Comments Presented at ICRA 2026
通过合成局部偏好实现解剖学合理的人体图像生成
机构 * Westlake University(西湖大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract)
AI总结 提出 ASAP 框架,利用局部退化机制构建受控偏好对,并结合局部有界 DPO 变体,在保持整体图像质量的同时减少解剖学错误。
StepAudio 2.5 技术报告
专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(abstract)
AI总结 提出统一音频语言基础模型StepAudio 2.5,通过任务定制的RLHF后训练和专用解码策略,在ASR、TTS和实时口语交互三项任务上达到或超越专用系统水平。
QwenSafe: 通过偏好对齐的视觉语言模型实现多模态内容评级描述识别
机构 * University of Sydney(悉尼大学) ; University of New South Wales(新南威尔士大学)
专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract)
AI总结 本文提出QwenSafe,一种通过联合推理应用元数据和截图来自动识别苹果定义的内容评级描述(CRDs)的视觉语言模型,通过引入metadata2CRD数据构建管道和直接偏好优化(DPO)提升模型预测准确性,实验结果显示QwenSafe在二元CRD分类中显著优于现有模型。
GRLO:从零开始在开放环境中的通用强化学习
机构 * University of California, Riverside(加州大学河滨分校)
专题命中 偏好对齐 :RLHF(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 GRLO研究从少量交互数据中训练的RLHF在开放环境中的泛化能力,探索其对话能力是否能迁移至数学推理和代码生成等下游任务,展示出高效且低成本的训练方法。