Human-AI Complementarity: A Goal for Amplified Oversight
人机互补:增强监督的目标
机构 * Google DeepMind(谷歌DeepMind)
专题命中 偏好对齐 :safety(abstract);分类 cs.AI
AI总结 针对AI输出的事实核查问题,结合AI评分与人类评分优于单独使用任一方法,但AI辅助类型影响信任度,为超越人类专家性能的AI系统监督提供启示。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
人机互补:增强监督的目标
机构 * Google DeepMind(谷歌DeepMind)
专题命中 偏好对齐 :safety(abstract);分类 cs.AI
AI总结 针对AI输出的事实核查问题,结合AI评分与人类评分优于单独使用任一方法,但AI辅助类型影响信任度,为超越人类专家性能的AI系统监督提供启示。
DynamicPO:基于推荐的动态偏好优化
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai Innovation Institute(上海创新研究院) ; Meituan(美团)
专题命中 偏好对齐 :DPO(abstract);分类 cs.AI
AI总结 本文提出DynamicPO框架,通过动态边界负样本选择和双边距动态beta调整,解决偏好优化崩溃问题,提升推荐准确性。
Comments DASFAA 2026 Best Paper
Oracle-RLAIF:一种利用排名反馈强化学习改进多模态视频模型微调框架的方法
机构 * Stanford University(斯坦福大学) ; Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) ; Microsoft(微软公司)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
AI总结 提出Oracle-RLAIF框架,用通用排序器替代奖励模型,结合基于GRPO的排名损失函数GRPO_rank,实现更高效的多模态视频模型微调,在多个基准上优于现有方法。
Comments Proceedings of the 39th Annual Conference on Neural Information Processing Systems, ARLET Workshop (Aligning Reinforcement Learning Experimentalists and Theorists)
Journal ref Transactions on Machine Learning Research, Vol. 2026, June 2026
基于低负担LLM的偏好学习:通过自然语言反馈为瘫痪用户个性化辅助机器人
机构 * Electrical and Computer Engineering(电气与计算机工程) ; Rehabilitation Science and Technology(康复科学与技术)
专题命中 偏好对齐 :safety(abstract);分类 cs.AI
AI总结 针对严重运动障碍用户,提出一种低负担离线框架,利用大语言模型将非结构化自然语言反馈转化为确定性机器人控制策略,并通过职业治疗框架解码用户需求,显著降低用户负担。
Comments Accepted to IEEE RO-MAN 2026
Baichuan-M4:面向持续照护的临床级医疗智能体系统
机构 * Baichuan AI(百川智能) ; THUBPM Group, Tsinghua University(清华大学THUBPM课题组)
专题命中 偏好对齐 :safety(abstract);分类 cs.AI
AI总结 提出Baichuan-M4临床级医疗大模型,通过统一运行时、持续照护强化学习框架和临床工具层三大支柱构建智能体系统,在多项医疗评估中取得领先结果,幻觉率降至3.3%。
走向健康进化:探索人机交互在自我进化系统中的作用与机制
机构 * The University of Osaka(大阪大学)
专题命中 偏好对齐 :safety(abstract);分类 cs.AI
AI总结 提出ANCHOR框架,通过模拟人类监督的反馈机制,在自我进化系统中缓解能力退化与安全漂移,实验表明有限监督可显著提升安全性与稳定性。
你的自对弈算法其实是一个对抗性模仿者:通过模仿学习的视角理解LLM自对弈
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Microsoft Research(微软研究院)
专题命中 偏好对齐 :alignment(abstract);分类 cs.LG
AI总结 本文通过将自对弈微调建模为模型与自身参数化的正则化隐式奖励玩家之间的极小极大博弈,统一了自对弈模仿与偏好对齐,并提出了基于χ²散度的新算法,在多种语言模型微调任务上优于现有方法。
Comments 26 pages, 6 tables, 5 figures
从“弱”信号到强模型:基于LoRA合并的偏好增量聚合
机构 * NYU Shanghai(纽约大学上海校区) ; NTU(国立台湾大学) ; NYU(纽约大学) ; ZJU(浙江大学)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
AI总结 提出偏好增量聚合(PDA)框架,通过从弱-更弱模型对中提取偏好增量并转化为LoRA适配器,再经几何对齐合并(GAM)聚合多个“弱”信号,以提升强模型性能。
教会奖励模型自我修正:奖励引导的对抗性失败发现以实现鲁棒奖励建模
机构 * University of Maryland College Park(马里兰大学College Park分校) ; Capital One
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
AI总结 提出REFORM框架,通过奖励引导的受控解码自动发现奖励模型失败模式,并利用生成的对抗样本自我改进,提升鲁棒性而不牺牲奖励质量。
Journal ref ACL 2026 Main Conference [Oral]
Sci-Surf:通过人类反馈与智能摘要实现科学文献发现
专题命中 偏好对齐 :alignment(abstract)
AI总结 针对现有学术发现平台支持不足的问题,提出以意图为中心的Sci-Surf系统,结合反馈驱动推荐与多模态论文消化,经评估推荐质量和消化质量有可测量提升。
迈向以人为中心的多智能体系统:在AI智能体中整合认知、文化、价值观与合作
专题命中 偏好对齐 :alignment(abstract)
AI总结 本文综述了从认知科学、文化对齐、价值学习到多智能体协调的研究,指出现有系统缺乏整合认知、文化、价值观和社会行为的统一框架,并提出了构建文化感知、价值对齐、认知基础与合作的多智能体系统的方向。
Comments 14 pages
更清晰的视野,更少的谎言:面向多模态幻觉缓解的定向拾取偏好优化
机构 * HKUST (GZ)(香港科技大学(广州)) ; HKUST(香港科技大学) ; OPPO AI Center(OPPO AI中心)
专题命中 偏好对齐 :alignment(abstract)
AI总结 提出一种证据感知的对齐目标OPPO,通过对比不同视觉证据强度下的相同忠实响应,将视觉偏好转化为有序视觉证据对齐,以缓解多模态大模型的幻觉问题。
DRM: 基于扩散的奖励模型与逐步引导
机构 * Peking University(北京大学) ; WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)
专题命中 偏好对齐 :alignment(abstract)
AI总结 提出基于扩散的奖励模型(DRM),利用预训练扩散模型作为评估骨干,通过逐步评估能力改进强化学习对齐和推理采样,提升图像生成质量。
HAFM:用于音乐伴奏生成的分层自回归基础模型
机构 * Zhejiang Lab(浙江实验室) ; University of Science and Technology of China(中国科学技术大学) ; Zhejiang International Studies University(浙江国际 Studies 大学)
专题命中 偏好对齐 :alignment(abstract)
AI总结 提出HAFM分层自回归基础模型,通过双速率分词和三阶段级联生成框架,在MUSDB18上FAD达1.71,主观偏好率51.5%,优于基线。
Comments This paper is submitted to the to National Conference on Man-Machine Speech Communication (NCMMSC, 2026)
PISCES: 基于最优传输对齐奖励的无标注文本到视频后训练
机构 * Microsoft(微软) ; Stony Brook University(石溪大学)
专题命中 偏好对齐 :alignment(abstract)
AI总结 提出PISCES算法,通过双重最优传输对齐奖励模块,无需人工标注即可提升文本生成视频的质量和语义对齐,在VBench上超越现有方法。
Comments Accepted to ICML 2026. Project page and code: https://roar-ai.github.io/pisces/
基于分解潜在推理的LLM推荐方法
专题命中 偏好对齐 :alignment(abstract)
AI总结 针对现有潜在推理方法用单向量表示用户意图难以捕捉多面偏好的问题,提出分解潜在推理框架,通过多因子注意力模块解耦偏好因子,结合正则化与强化学习提升推荐性能与可解释性。