PS-PPO: Prefix-Sampling PPO for Critic-Free RLHF
PS-PPO: 用于无评论者RLHF的前缀采样PPO
专题命中 偏好对齐 :RLHF(title,title_cn);分类 cs.AI、cs.LG
AI总结 提出PS-PPO方法,通过前缀采样和重要性加权修正,在无评论者RLHF中减少训练计算和内存,保持准确率。
Journal ref ICML 2026 published
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
PS-PPO: 用于无评论者RLHF的前缀采样PPO
专题命中 偏好对齐 :RLHF(title,title_cn);分类 cs.AI、cs.LG
AI总结 提出PS-PPO方法,通过前缀采样和重要性加权修正,在无评论者RLHF中减少训练计算和内存,保持准确率。
Journal ref ICML 2026 published
《智能体AI的搭车指南:从基础到系统》
机构 * Haggai Roitman
专题命中 偏好对齐 :RLHF(abstract,abstract_cn);DPO(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文为构建自主AI系统提供全面实践参考,覆盖从Transformer架构、训练优化到对齐、推理、检索增强生成、记忆系统、智能体设计模式及多智能体协调的完整技术栈。
Comments version 1.3
STAIF:一种用于复杂指令跟随的逐阶段优化方法
机构 * University of Science and Technology of China(中国科学技术大学) ; iFLYTEK Research Group(科大讯飞研究院)
专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型遵循复杂指令的挑战,提出STAIF逐阶段优化框架,先通过偏好优化提高软约束敏感度,再用可验证奖励强化学习确保硬约束遵守,构建相关数据集,验证了该方法的设计并展现出领先性能和泛化能力。
Comments 16 pages, 6 figures
南贝格4.2 - 3B:以紧凑模式解锁智能体能力
机构 * Nanbeige LLM Lab(南北贝大语言模型实验室)
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI
AI总结 介绍南贝格4.2 - 3B紧凑通用智能体模型,通过特定预训练方式构建,利用多种强化学习方法提升质量与效率,在多任务和基准测试中表现出色,优于更大模型,有潜力成为紧凑本地个人助手。
让我看着你:用于对话语音合成的高级面部表情建模
专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL
AI总结 研究针对对话语音合成中面部表情线索常被忽视及缺乏多模态数据集的问题,提出基于大语言模型的FacialTalker框架,含AUTokenizer和DualDPO策略,构建VSDD-1K数据集,实验表明该框架在表情感知和语音合成质量上表现出色。
Comments 10 pages, 5 figures, 5 tables. Accepted by ACM MM 2026
Qwen-音乐技术报告
机构 * Qwen Team(通义团队)
专题命中 偏好对齐 :DPO(abstract,abstract_cn)
AI总结 介绍Qwen-音乐,它支持文本到音乐生成和翻唱歌曲生成两个核心任务。集成三个核心组件,通过特定机制建模并渲染。经多语言数据训练及多种训练方式,在多个音乐性和音频质量指标上达领先成果,获专业评估人员青睐。
SyRuP:通过大语言模型解码中的奖励引导预测增强系统提示遵循
机构 * Yonsei University(延世大学)
专题命中 偏好对齐 :safety(abstract);分类 cs.CL、cs.AI
AI总结 研究如何增强大语言模型对系统提示的遵循,提出SyRuP框架,通过训练交叉注意力奖励头产生令牌级遵循分数,推理时结合多种信号对候选重新排序,实验表明该方法能有效提升系统提示遵循度且开销适度。
Comments under review, 23 pages
RM-Distiller: 利用生成式大语言模型进行奖励模型蒸馏
机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) ; School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
AI总结 RM-Distiller通过系统利用教师LLM的精炼、评分和生成能力,提升奖励模型蒸馏效果,首次系统性地探索了生成式LLM在奖励建模中的应用。
Comments Accepted to IJCAI-ECAI 2026
PRISM:通过基于图像的自我奖励机制进行文本到图像生成的提示优化
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Sun Yat-sen University(中山大学) ; South China University of Technology(华南理工大学) ; Guangdong University of Technology(广东工业大学)
专题命中 偏好对齐 :alignment(abstract)
AI总结 针对文本到图像生成模型对提示制定敏感的问题,提出PRISM框架,通过基于图像的自我奖励机制,利用结构化视觉诊断和多任务监督微调等方法,提高图像质量和语义对齐,并提供可解释反馈。
Comments 18 pages, 5 figures
迈向以人为中心的多智能体系统:在AI智能体中整合认知、文化、价值观与合作
专题命中 偏好对齐 :alignment(abstract)
AI总结 本文综述了从认知科学、文化对齐、价值学习到多智能体协调的研究,指出现有系统缺乏整合认知、文化、价值观和社会行为的统一框架,并提出了构建文化感知、价值对齐、认知基础与合作的多智能体系统的方向。
Comments 14 pages