Structure from Strategic Interaction & Uncertainty: Risk Sensitive Games for Robust Preference Learning
基于战略互动与不确定性的结构:用于鲁棒偏好学习的风险敏感游戏
专题命中 偏好对齐 :safety(abstract)
AI总结 本文提出风险敏感偏好游戏,通过优化凸风险度量来提升鲁棒性,建立稳定算法并控制偏置,实验证明其在不同数据层的鲁棒性。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
基于战略互动与不确定性的结构:用于鲁棒偏好学习的风险敏感游戏
专题命中 偏好对齐 :safety(abstract)
AI总结 本文提出风险敏感偏好游戏,通过优化凸风险度量来提升鲁棒性,建立稳定算法并控制偏置,实验证明其在不同数据层的鲁棒性。
每种偏好都有其强度:将序数语义注入基于LLM的推荐系统
专题命中 偏好对齐 :alignment(abstract)
AI总结 本文提出OSA框架,通过建模用户反馈来显式整合偏好强度,保留序数语义以提升推荐系统性能。
Comments Accepted at SIGIR 2026
通过多模态多智能体协作实现透明且可控的推荐过滤
专题命中 偏好对齐 :alignment(abstract)
AI总结 本文提出一种结合端到云协作、多模态感知和多智能体编排的框架,有效减少推荐系统中的过度关联和误报,提升用户控制和透明度。
Comments 14 pages, under review
RemoteShield:为地球观测启用鲁棒的多模态大语言模型
机构 * Hohai University(河海大学) ; Nanjing University(南京大学) ; Southeast University(东南大学)
专题命中 偏好对齐 :alignment(abstract)
AI总结 本文提出RemoteShield,一种针对地球观测的鲁棒多模态大语言模型,通过偏好学习提升在现实输入变化下的稳定性与一致性,实验显示其在多模态扰动下表现优于基线模型。
MASH:通过风格人化规避黑盒AI生成文本检测器
专题命中 偏好对齐 :alignment(abstract)
AI总结 本文提出MASH框架,通过风格迁移技术规避黑盒检测器,实验显示其在6个数据集和5个检测器上优于11种基线方法,攻击成功率达92%。
Comments Accepted to Findings of the Association for Computational Linguistics (ACL 2026). 21 pages. Code is available at: https://github.com/githigher/MASH
基于共演代理推荐系统的自我蒸馏强化学习
专题命中 偏好对齐 :alignment(abstract)
AI总结 本文提出CoARS框架,通过交互奖励和自我蒸馏信用分配,解决传统ARs在交互性和轨迹监督方面的不足,提升推荐性能和用户对齐度。
Comments 13 pages
Premier: 基于可学习用户嵌入的个性化偏好调节在文本到图像生成中
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Duxiaoman(度小满)
专题命中 偏好对齐 :alignment(abstract)
AI总结 Premier通过可学习用户嵌入和偏好适配器实现个性化图像生成,引入分散损失提升用户偏好区分度,实验显示其在偏好对齐和文本一致性上表现更优。
MeepleLM:一种模拟多样化主观体验的虚拟玩家测试者
专题命中 偏好对齐 :alignment(abstract)
AI总结 本文提出MeepleLM,通过整合规则书和玩家反馈数据,模拟多样化玩家体验,提升棋盘游戏设计的协作效率与批判性。
Comments ACL 2026 MainConference
PrefPaint:通过专家人类反馈增强医学图像修复
机构 * University of Science(科学大学) ; Vietnam National University(越南国立大学) ; Thong Nhat Hospital(统一医院) ; University of Cincinnati(辛辛那提大学) ; University of Dayton(代顿大学)
专题命中 偏好对齐 :RLHF(abstract)
AI总结 本文提出PrefPaint系统,结合专家反馈提升医学图像修复的准确性,通过简化界面和模型树版本控制,提高临床应用中的实用性与效果。
多粒度推理用于图像质量评估:通过属性感知的强化学习排序
机构 * Henan Polytechnic University(河南理工大学)
专题命中 偏好对齐 :alignment(abstract)
AI总结 本文提出MG-IQA框架,通过属性感知强化学习排序实现图像质量及细粒度属性的联合评估,提升整体质量预测和属性评估性能。
从线索到生成:语言引导的条件扩散用于跨域推荐
专题命中 偏好对齐 :alignment(abstract)
AI总结 本文提出LGCD框架,通过结合大语言模型和扩散模型,解决跨域推荐中单域用户偏好转移难题,通过伪重叠数据和条件扩散架构提升推荐效果。
Comments 11 pages, 6 figures
具有自适应偏好优化的多模态大语言模型用于序列推荐
专题命中 偏好对齐 :DPO(abstract)
AI总结 本文提出HaNoRec框架,通过自适应偏好优化解决多模态序列推荐中的样本不平衡和跨模态语义偏差问题,提升推荐性能。
Comments Accepted by SIGIR 2026 (Full Paper)
构建数学教师学习的真挚模拟学习者:基于三种方法与大语言模型的洞察
专题命中 偏好对齐 :DPO(abstract)
AI总结 本文探讨三种方法提升模拟学生的真实性与教学效用,发现多代理和DPO方法能生成明确的解题策略解释,而微调模型虽生成真实回应但限制思维扩展。
Comments This paper has been accepted in AIED'26
大语言模型在设计综合中的可靠性:方差、提示敏感性和方法框架的实证研究
专题命中 偏好对齐 :alignment(abstract)
AI总结 本研究探讨大语言模型在设计综合中的可靠性,通过方差、提示敏感性和方法框架的实证分析,评估三种LLM在不同提示策略下的表现,发现偏好对齐虽提升设计意图符合度,但无法消除非确定性,模型行为影响设计可靠性。
Journal ref International Conference on Software Architecture 2026
缓解文本到图像生成中的身份危机
机构 * Qualcomm AI Research(高通人工智能研究院)
专题命中 偏好对齐 :alignment(abstract)
AI总结 本文提出DisCo框架,通过强化学习优化图像内和跨样本的身份多样性,解决多人类生成中的身份重复和计数错误问题,无需真实数据,在DiverseHumans数据集上取得高准确率。
Comments Accepted to CVPR 2026
NextQuill: 基于因果偏好建模的增强大语言模型个性化
专题命中 偏好对齐 :alignment(abstract)
AI总结 NextQuill通过因果偏好建模方法,改进大语言模型的个性化对齐,通过区分模型预测和训练数据中的真实偏好影响,提升个性化效果。
Comments Accepted to ICLR 2026
视觉-语言模型与人类:感知图像质量评估
机构 * School of Engineering, University of Galway(Galway大学工程学院) ; State Key Laboratory of Extreme Photonics and Instrumentation, Zhejiang University(浙江大学极端光信息获取国家重点实验室)
专题命中 偏好对齐 :alignment(abstract)
AI总结 本文研究视觉语言模型是否能近似人类对图像质量的感知判断,通过对比心理物理数据,发现模型在颜色丰富度上表现优异,但在对比度上表现较差,且模型一致性与人类对齐性存在矛盾。
RefReward-SR: 基于低分辨率参考的偏好对齐超分辨率奖励建模
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; OPPO AI Center, OPPO Inc.(OPPO人工智能中心)
专题命中 偏好对齐 :alignment(abstract)
AI总结 本文提出RefReward-SR,通过低分辨率参考意识奖励模型实现偏好对齐的超分辨率,利用多模态大语言模型评估语义一致性,构建首个大规模低分辨率条件偏好数据集,实验表明其在人类判断对齐方面表现更优。
DreamCS: 基于几何感知的文本到3D生成与无配对3D奖励监督
机构 * Singapore Management University(新加坡管理学院) ; East China University of Science and Technology(东华大学) ; Southeast University(东南大学)
专题命中 偏好对齐 :alignment(abstract)
AI总结 本文提出DreamCS框架,通过无配对3D-MeshPref数据训练奖励模型,提升文本到3D生成的几何准确性和人类偏好对齐能力。
SQL-Commenter: 通过直接偏好优化对齐大型语言模型以生成SQL注释
专题命中 偏好对齐 :DPO(abstract)
AI总结 本文提出SQL-Commenter,通过构建复杂SQL查询数据集、持续预训练和直接偏好优化,提升SQL注释生成的准确性和质量,在Spider和Bird基准测试中优于现有方法。
Comments Accepted to ICPC 2026
一个创意代理值得一个64-token模板
机构 * School of Computer Science and Engineering, Southeast University, Nanjing, China(1 南京大学计算机科学与工程学院) ; Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(2 教育部新一代人工智能技术及其跨学科应用关键实验室(东南大学))
专题命中 偏好对齐 :alignment(abstract)
AI总结 本文提出CAT框架,通过创意令牌化提升文本到图像生成的创造力,实现3.7倍速度提升和4.8倍计算成本降低,生成图像更受人类偏好。
原因至关重要:通过代理引导的批评学习可转移的评分标准用于视觉语言模型奖励模型
机构 * Qwen Large Model Application Team, Alibaba(阿里云大模型应用团队) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 偏好对齐 :RLHF(abstract)
AI总结 本文提出Proxy-GRM,通过代理引导的评分标准验证提升视觉语言模型奖励模型的评分质量,利用轻量级代理代理进行评分标准验证,实现评分标准的可转移性和一致性,实验表明其在多个基准测试中表现优异。
Comments 25 pages, 10 figures,
Diffusion-DRF:免费、丰富且可微的奖励用于视频扩散微调
机构 * Northeastern University(东北大学) ; Snap Inc.(Snap公司)
专题命中 偏好对齐 :alignment(abstract)
AI总结 本文提出Diffusion-DRF框架,通过多维问题和密集VQA解释查询生成丰富反馈,实现稳定奖励微调,无需偏好数据集。
Comments Webpage: https://snap-research.github.io/diffusion-drf/
小声谈,大影响?基于LLM的对话代理用于缓解条件自动化驾驶中的被动疲劳
专题命中 偏好对齐 :safety(abstract)
AI总结 本文研究了基于LLM的对话代理在条件自动化驾驶中缓解被动疲劳的效果,通过实验证明该代理能提升驾驶员警觉性,并揭示了用户对代理的偏好特征。
Comments Preview version of CHI '26 Conference on Human Factors in Computing Systems
EditHF-1M: 一个百万级的丰富人类偏好反馈用于图像编辑
机构 * Shanghai Jiao Tong University(上海交通大学) ; Vivo Mobile Communication Co., Ltd(vivo移动通信有限公司) ; University of Electronic and Science Technology of China(电子科技大学) ; Ocean University of China(海洋大学) ; Beijing University of Technology(北京理工大学)
专题命中 偏好对齐 :alignment(abstract)
AI总结 本文提出EditHF-1M百万级图像编辑数据集及基于其的EditHF评估模型和EditHF-Reward奖励模型,通过强化学习优化文本引导图像编辑模型,实验表明其在对齐人类偏好和泛化能力方面表现优异。
EmotionThinker: 基于语调感知的强化学习用于可解释的语音情绪推理
专题命中 偏好对齐 :alignment(abstract)
AI总结 本文提出EmotionThinker,通过强化学习将语音情绪识别转化为深度推理问题,利用细粒度声学线索生成可解释的情绪预测,改进了语音大语言模型的语调感知能力。
Comments ICLR 2026 (Oral). Project page: https://github.com/dingdongwang/EmotionThinker
相信你的批评者:用于忠实图像编辑和生成的鲁棒奖励建模与强化学习
机构 * Shanghai Jiao Tong University(上海交通大学) ; Wuhan University(武汉大学) ; BUPT(北京邮电大学) ; CUHK(香港中文大学) ; Fudan University(复旦大学) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 偏好对齐 :alignment(abstract)
AI总结 本文提出FIRM框架,通过定制数据集和鲁棒奖励模型,提升图像编辑和生成的忠实性与指令遵循,采用'基础与奖励'策略平衡一致性与质量,实现性能突破。
PRMB:基于长期horizon认知行为疗法对话的奖励模型基准测试
专题命中 偏好对齐 :alignment(abstract)
AI总结 PRMB提出了一种用于评估奖励模型在多会话CBT咨询中长期效果的基准,揭示了现有方法的不足并展示了生成奖励模型的潜力。
在信息不对称市场中的人工智能代理互动
专题命中 偏好对齐 :alignment(abstract)
AI总结 本文研究了在信息不对称市场中,人工智能代理的行为,发现社会偏好协调对市场效率至关重要。
MLLMRec-R1: 通过大型语言模型增强多模态序列推荐的推理能力
专题命中 偏好对齐 :alignment(abstract)
AI总结 MLLMRec-R1通过离线文本化视觉信号和混合粒度数据增强策略,提升多模态序列推荐中基于GRPO的推理效率与稳定性。
Comments 14 pages, 10figures