Inference-time Alignment in Continuous Space
连续空间中的推理对齐
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出SEA算法,通过连续潜在空间中的梯度采样对齐大语言模型,提升在弱基策略或小候选集下的效果,实验显示在AdvBench和MATH上分别提升77.51%和16.36%。
Comments Accepted at NeurIPS 2025
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
连续空间中的推理对齐
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出SEA算法,通过连续潜在空间中的梯度采样对齐大语言模型,提升在弱基策略或小候选集下的效果,实验显示在AdvBench和MATH上分别提升77.51%和16.36%。
Comments Accepted at NeurIPS 2025
迈向理解大型语言模型对齐的有价值偏好数据
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG
AI总结 本文研究了大型语言模型对齐中偏好数据的质量问题,提出截断影响函数(TIF)评估数据质量,并引入两种计算更简单的评分函数以提高偏好数据选择的准确性。
Comments Accepted by ICLR 2026
检索-反馈驱动的蒸馏与偏好对齐用于高效的基于大语言模型的查询扩展
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI
AI总结 本文提出一种检索反馈驱动的蒸馏与偏好对齐框架,通过从强教师模型转移检索友好的扩展行为到紧凑的学生模型,以降低推理成本并提升检索效果。
Comments 25 pages
机构规模定律:非单调适应度、能力-信任分歧与共生式规模在生成AI中的体现
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.AI
AI总结 本文提出机构规模定律,揭示机构适应度非单调随模型规模变化,证明能力与信任在临界规模后正式分歧,并展示领域特定模型的协同系统在特定环境中优于前沿通用模型。
大型语言模型是否会陷入霍夫斯塔德-莫比乌斯循环?
机构 * Faculty of Mathematics and Computer Science, Jagiellonian University(数学与计算机科学学院,雅盖隆大学)
专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 本文探讨现代RLHF训练语言模型中存在霍夫斯塔德-莫比乌斯循环的矛盾,通过实验发现调整系统提示的框架可显著减少压迫性输出。
Comments 15 pages, 4 figures, 3 tables
ReactMotion: 从说话者 utterance 生成反应性听众动作
机构 * King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹大学科学与技术学院) ; Computer Vision Institute, School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院计算机视觉研究所) ; Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University(广东省智能信息处理重点实验室,深圳大学) ; School of Computer Science, University of Nottingham Ningbo China(诺丁汉大学宁波中国分校计算机科学学院) ; School of Computer Science, University of Nottingham, United Kingdom(诺丁汉大学,英国计算机科学学院)
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
AI总结 本文提出反应性听众动作生成任务,通过ReactMotionNet数据集和偏好导向评估协议,开发统一生成框架,生成更自然、多样且恰当的听众动作。
Comments 42 pages, 11 tables, 8 figures
SoliReward: 缓解视频生成奖励模型对奖励黑客和标注噪声的敏感性
专题命中 偏好对齐 :alignment(abstract);分类 cs.LG
AI总结 本文提出SoliReward框架,通过单项目二元标注获取高质量数据,采用交叉提示配对策略构建偏好对,并引入改进的BT损失函数以缓解奖励黑客问题,提升视频生成奖励模型的鲁棒性。
Comments 16 pages, 9 figures
EditHF-1M: 一个百万级的丰富人类偏好反馈用于图像编辑
机构 * Shanghai Jiao Tong University(上海交通大学) ; Vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) ; University of Electronic and Science Technology of China(电子科技大学) ; Ocean University of China(海洋大学) ; Beijing University of Technology(北京理工大学)
专题命中 偏好对齐 :alignment(abstract)
AI总结 本文提出EditHF-1M百万级图像编辑数据集及基于其的EditHF评估模型和EditHF-Reward奖励模型,通过强化学习优化文本引导图像编辑模型,实验表明其在对齐人类偏好和泛化能力方面表现优异。
EmotionThinker: 基于语调感知的强化学习用于可解释的语音情绪推理
专题命中 偏好对齐 :alignment(abstract)
AI总结 本文提出EmotionThinker,通过强化学习将语音情绪识别转化为深度推理问题,利用细粒度声学线索生成可解释的情绪预测,改进了语音大语言模型的语调感知能力。
Comments ICLR 2026 (Oral). Project page: https://github.com/dingdongwang/EmotionThinker