Personalized Group Relative Policy Optimization for Heterogenous Preference Alignment
面向异质偏好对齐的个性化群体相对策略优化
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出个性化GRPO框架,通过解耦优势估计与批次统计,提升模型对异质偏好信号的对齐能力。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
面向异质偏好对齐的个性化群体相对策略优化
专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出个性化GRPO框架,通过解耦优势估计与批次统计,提升模型对异质偏好信号的对齐能力。
UrbanAlign: 域内任务中VLM与人类偏好对齐的后处理语义校准
机构 * Tsinghua University(清华大学) ; University College London(伦敦大学学院) ; Hong Kong University of Science and Technology(香港科学与技术大学) ; Peking University(北京大学) ; Southwest Jiaotong University(西南交通大学) ; Zhejiang University(浙江大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Renmin University of China(中国人民大学) ; Southeast University(东南大学)
专题命中 偏好对齐 :alignment(title);RLHF(abstract);safety(abstract)
AI总结 UrbanAlign通过后处理方法实现VLM与人类偏好的对齐,无需修改模型权重,提升领域任务的准确性和可解释性。
Comments 26 pages
将大型语言模型对齐于搜索者偏好
机构 * School of Artificial Intelligence and Data Science, University of Science and Technology of China(中国科学技术大学人工智能与数据科学学院) ; Xiaohongshu Inc.(小红书公司) ; Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能研究所) ; Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系)
专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 SearchLLM通过分层多维奖励系统提升开放式生成搜索的鲁棒性和用户需求对齐能力,实测有效消费率提升1.03%。
应对长度膨胀而不产生权衡:用于强化学习的群体相对奖励重缩放
专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.LG
AI总结 GR$^3$通过乘法重缩放范式解决强化学习中的长度膨胀问题,实现通用、连续且奖励依赖的门控机制,有效减少冗余推理并提升训练性能。
Sabiá-4 技术报告
机构 * Maritaca AI ; Jusbrasil
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
AI总结 Sabiá-4和Sabiazinho-4是新一代巴西葡萄牙语模型,通过四阶段训练流程提升法律文档、多轮对话和智能体任务能力,实现成本与性能的平衡。
Gemma需要帮助:调查并缓解大语言模型中的情绪不稳定
机构 * Imperial College London(伦敦帝国理工学院) ; Anthropic
专题命中 偏好对齐 :safety(abstract);分类 cs.CL
AI总结 研究发现Gemma模型在训练后表现出显著情绪不稳定,通过偏好优化可有效缓解,但需进一步改进训练以提升情绪鲁棒性。
在线KL正则化强化学习的对数遗憾
专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG
AI总结 本文提出了一种基于乐观的KL正则化在线上下文老虎机算法,实现了对数遗憾界,并扩展到强化学习领域。