Guess Where You Go: Generative Next Point-of-Interest Recommendation in Amap
猜猜你要去哪里:高德地图中的生成式下一个兴趣点推荐
专题命中 偏好对齐 :alignment(abstract)
AI总结 该研究提出Gwhere框架,结合SID生成与LLM生成式下一个POI推荐,经实验验证其在高德地图中可提升P-CTR和U-CTR,已部署应用且效果显著。
Comments 10 pages, 4 figures
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
猜猜你要去哪里:高德地图中的生成式下一个兴趣点推荐
专题命中 偏好对齐 :alignment(abstract)
AI总结 该研究提出Gwhere框架,结合SID生成与LLM生成式下一个POI推荐,经实验验证其在高德地图中可提升P-CTR和U-CTR,已部署应用且效果显著。
Comments 10 pages, 4 figures
PRISM:通过基于图像的自我奖励机制进行文本到图像生成的提示优化
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Sun Yat-sen University(中山大学) ; South China University of Technology(华南理工大学) ; Guangdong University of Technology(广东工业大学)
专题命中 偏好对齐 :alignment(abstract)
AI总结 针对文本到图像生成模型对提示制定敏感的问题,提出PRISM框架,通过基于图像的自我奖励机制,利用结构化视觉诊断和多任务监督微调等方法,提高图像质量和语义对齐,并提供可解释反馈。
Comments 18 pages, 5 figures
迈向以人为中心的多智能体系统:在AI智能体中整合认知、文化、价值观与合作
专题命中 偏好对齐 :alignment(abstract)
AI总结 本文综述了从认知科学、文化对齐、价值学习到多智能体协调的研究,指出现有系统缺乏整合认知、文化、价值观和社会行为的统一框架,并提出了构建文化感知、价值对齐、认知基础与合作的多智能体系统的方向。
Comments 14 pages
读回:预训练的多模态语言模型是文本到图像生成的零样本奖励模型
机构 * The University of Hong Kong(香港大学) ; ByteDance Seed(字节跳动Seed) ; Peking University(北京大学)
专题命中 偏好对齐 :alignment(abstract)
AI总结 研究提出SpectraReward将预训练多模态语言模型转为图像生成强化学习奖励模型,用图像条件提示对数似然作奖励,还引入Self-SpectraReward形成闭环框架。经广泛实验验证,二者能提升生成性能,表明奖励-策略对齐是关键。
超越时间偏移:将全能语言模型(Omni-LLM)适配为生成式视听模型的无参考评估器
机构 * Zhejiang University(浙江大学) ; The Hong Kong Polytechnic University(香港理工大学) ; IROOTECH TECHNOLOGY(易路泰克科技)
专题命中 偏好对齐 :alignment(abstract)
AI总结 研究针对视听生成模型跨模态同步评估难题,提出框架解决人类与自动化评估指标的矛盾。通过引入数据集、适配模型及提出优化方法,实现先进的人类偏好对齐,建立标准化基准推动评估从信号相关性到因果关系发展。
Comments Accepted to ECCV 2026
通过语义检索和时间重排实现多模态视频到音乐推荐
机构 * Graduate School of Culture Technology, KAIST(韩国釜山科学技术大学文化科技研究生院) ; Gaudio Lab, Inc(Gaudio实验室)
专题命中 偏好对齐 :alignment(abstract)
AI总结 提出用于视频到音乐推荐的两阶段框架VTMR,第一阶段通过全局嵌入检索语义兼容候选,第二阶段关注时间序列重排。实验显示该框架能提升推荐效果,人类偏好研究表明其在总体偏好上与商业基线相当,音乐质量优于生成基线。
Comments Accepted for publication at The Machine Learning for Audio workshop at ICML 2026
CoRe: 结合视觉语言模型反馈的复合奖励用于偏好对齐强化学习
专题命中 偏好对齐 :alignment(abstract)
AI总结 提出CoRe框架,将奖励分解为基于任务知识的正式奖励和从观察中学习的残差奖励,利用视觉语言模型迭代优化奖励,实现无需人工的偏好对齐,在机器人操作任务中优于现有方法。
Comments ICML 2026
AMALIA-VL: 一个原生欧洲葡萄牙语开源视觉与语言模型
机构 * NOVA School of Science and Technology(NOVA科学与技术学校) ; NOVA LINCS
专题命中 偏好对齐 :alignment(abstract)
AI总结 针对欧洲葡萄牙语缺乏开源多模态模型的问题,提出AMALIA-VL,通过三阶段训练和葡萄牙语中心数据混合,建立强基线并开源所有资源。
更清晰的视野,更少的谎言:面向多模态幻觉缓解的定向拾取偏好优化
机构 * HKUST (GZ)(香港科技大学(广州)) ; HKUST(香港科技大学) ; OPPO AI Center(OPPO AI中心)
专题命中 偏好对齐 :alignment(abstract)
AI总结 提出一种证据感知的对齐目标OPPO,通过对比不同视觉证据强度下的相同忠实响应,将视觉偏好转化为有序视觉证据对齐,以缓解多模态大模型的幻觉问题。
MetaRanker:用于超透镜图像质量的人机协同主动排序
机构 * Hanyang University(翰阳大学) ; Hankuk University of Foreign Studies(韩国民法大学)
专题命中 偏好对齐 :alignment(abstract)
AI总结 提出MetaRanker框架,通过人机协同主动排序,以语义可解释性为指标评估超透镜图像质量,减少80%人工标注量,并实现与人类评估高度一致的排序。
Comments 12 pages, 6 figures
ReSpace:基于文本的自回归3D室内场景合成与编辑
机构 * Stanford University(斯坦福大学)
专题命中 偏好对齐 :alignment(abstract)
AI总结 ReSpace通过自回归方法实现文本驱动的3D室内场景合成与编辑,具备明确房间边界和资产无关部署能力,支持通过自然语言添加、移除和交换物体,实验在物体添加和完整场景合成质量上超越现有方法。
Comments 23 pages, 17 figures, 11 tables (incl. appendix)
DRM: 基于扩散的奖励模型与逐步引导
机构 * Peking University(北京大学) ; WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)
专题命中 偏好对齐 :alignment(abstract)
AI总结 提出基于扩散的奖励模型(DRM),利用预训练扩散模型作为评估骨干,通过逐步评估能力改进强化学习对齐和推理采样,提升图像生成质量。
HAFM:用于音乐伴奏生成的分层自回归基础模型
机构 * Zhejiang Lab(浙江实验室) ; University of Science and Technology of China(中国科学技术大学) ; Zhejiang International Studies University(浙江国际 Studies 大学)
专题命中 偏好对齐 :alignment(abstract)
AI总结 提出HAFM分层自回归基础模型,通过双速率分词和三阶段级联生成框架,在MUSDB18上FAD达1.71,主观偏好率51.5%,优于基线。
Comments This paper is submitted to the to National Conference on Man-Machine Speech Communication (NCMMSC, 2026)
从驾驶视频到可模拟场景
机构 * Dept. Computer Science, Universitat Autònoma de Barcelona (UAB)(巴塞罗那自治大学计算机科学系) ; Computer Vision Center (CVC), UAB(UAB计算机视觉中心)
专题命中 偏好对齐 :safety(abstract)
AI总结 提出D-V2S框架,通过视觉语言模型和大语言模型从驾驶视频自动生成可模拟场景,实现90%语义元素保留和75%偏好率。
Comments 8 pages, 11 figures and Accepted for publication at the IEEE International Conference on Intelligent Transportation Systems (ITSC), 2026
$\phi$-Scene: 物理驱动的图像到3D场景重建
机构 * University of California San Diego(加州大学圣地亚哥分校)
专题命中 偏好对齐 :alignment(abstract)
AI总结 提出$\phi$-Scene方法,将单图像3D场景重建视为拓扑驱动的物理组装过程,通过SDF优化和刚体仿真解决穿透与不稳定接触问题,在3D-Front数据集上取得最优性能。
Comments Project page: https://phi-scene.github.io/
PISCES: 基于最优传输对齐奖励的无标注文本到视频后训练
机构 * Microsoft(微软) ; Stony Brook University(石溪大学)
专题命中 偏好对齐 :alignment(abstract)
AI总结 提出PISCES算法,通过双重最优传输对齐奖励模块,无需人工标注即可提升文本生成视频的质量和语义对齐,在VBench上超越现有方法。
Comments Accepted to ICML 2026. Project page and code: https://roar-ai.github.io/pisces/
面向自然语言引导的多无人机分配中可扩展QAOA的最优性保持分解
机构 * Korea University(高丽大学)
专题命中 偏好对齐 :DPO(abstract)
AI总结 提出端到端框架,集成微调大语言模型与量子-经典后端,通过约束保持图分割和动态规划合并,实现自然语言引导下多无人机任务分配的可扩展量子优化。
Comments 10 pages, 2 figures, 3 tables, preprint
基于分解潜在推理的LLM推荐方法
专题命中 偏好对齐 :alignment(abstract)
AI总结 针对现有潜在推理方法用单向量表示用户意图难以捕捉多面偏好的问题,提出分解潜在推理框架,通过多因子注意力模块解耦偏好因子,结合正则化与强化学习提升推荐性能与可解释性。
SkelDPO: 一种骨架引导的直接偏好优化框架用于高效代码生成
专题命中 偏好对齐 :alignment(abstract)
AI总结 提出SkelDPO框架,通过骨架引导的偏好优化,在代码生成中同时优化语义正确性和执行效率,相比现有方法在Pass@1、Beyond@1和Effi@1上提升3-7%。
CREward:一种类型特定的创造力奖励模型
机构 * Simon Fraser University(西蒙弗雷泽大学) ; Sogang University(首尔大学)
专题命中 偏好对齐 :alignment(abstract)
AI总结 提出首个类型特定的创造力奖励模型CREward,通过几何、材质和纹理三个轴评估创造力,并应用于创造力评估、可解释创造力及创意样本获取。
Comments Accepted to CVPR 2026
立场:好的具身奖励模型需要不良行为数据
机构 * Ran Tian, Yilin Wu, Andrea Bajcsy
专题命中 偏好对齐 :alignment(abstract)
AI总结 本文主张为获得可靠的具身奖励模型,社区必须投资于“不良”机器人数据(失败、次优、易错甚至危险行为),并通过实验证明即使少量真实不良数据也能改善与人类偏好的一致性。
Comments This position paper has been accepted by the ICML 2026 position track as a spotlight paper
Step-Audio-R1.5 技术报告
专题命中 偏好对齐 :RLHF(abstract)
AI总结 本文提出 Step-Audio-R1.5,通过从强化学习验证奖励转向基于人类反馈的强化学习,解决了音频大语言模型在客观基准上表现优异但牺牲真实对话自然度的问题,实现了分析推理与沉浸式交互体验的平衡。
基于混合专家知识图谱检索增强生成的多智能体LLM推荐系统
专题命中 偏好对齐 :alignment(abstract)
AI总结 提出MixRAGRec框架,通过混合专家检索、知识偏好对齐和对比学习增强推荐,解决KG-RAG中检索粒度单一、结构信息丢失和端到端学习困难问题。
Comments Accepted by KDD 2026 Research Track
VOGUE:面向时尚领域对话式推荐的多模态数据集
专题命中 偏好对齐 :alignment(abstract)
AI总结 为弥补多模态对话推荐数据集的不足,构建了包含60个人类对话、2100个细粒度标注话语的VOGUE数据集,支持视觉和上下文推理评估,并揭示了多模态大语言模型在偏好推断上的系统性分布误差。
MuChator: 通过对话式音乐大语言模型在抖音音乐中实现主动音乐发现
专题命中 偏好对齐 :alignment(abstract)
AI总结 提出MuChator框架,通过音乐知识预训练、上下文感知指令微调和偏好对齐,使大语言模型能够理解用户用自然语言表达的情境化音乐意图,并在抖音音乐中实现主动音乐发现。
RAG-Match:面向校准语义相关性的检索增强知识注入与分层推理
专题命中 偏好对齐 :alignment(abstract)
AI总结 提出RAG-Match三阶段框架,通过知识增强预训练、分层推理对齐和偏好决策校准,提升搜索场景中细粒度语义相关性判断的准确性。
Comments 17 pages, 1 figure, 5 tables
OHP-RL:在线人类偏好作为机器人操作强化学习中的指导
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))
专题命中 偏好对齐 :safety(abstract)
AI总结 提出OHP-RL框架,利用人类干预作为偏好信息,通过状态依赖偏好门自适应调节策略学习,在Franka机器人接触丰富的操作任务中实现高成功率、快速收敛和低人类干预。
增强偏好优化用于推理增强的推荐
专题命中 偏好对齐 :alignment(abstract)
AI总结 本文提出RPORec框架,通过统一LLM的推理能力与专用推荐头,提升推荐系统的精确性,实验表明其在公开基准和大规模部署中均优于现有方法。
弥合意图-表达鸿沟:通过层次相关反馈对齐多维偏好
机构 * Tongji University(同济大学)
专题命中 偏好对齐 :alignment(abstract)
AI总结 本文提出一种层次相关反馈驱动框架,通过在文本到图像扩散模型中对齐多维特征,解决用户意图与表达之间的鸿沟问题,提升模型对多维偏好的识别能力。
SpatialReward: 通过显式空间推理弥合在线强化学习中图像编辑的感知差距
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院,清华大学)
专题命中 偏好对齐 :alignment(abstract)
AI总结 本文提出SpatialReward,通过显式空间推理提升在线强化学习中图像编辑的感知准确性,其在MMRB2和EditReward-Bench上表现优异,并在MultiEditReward-Bench上超越专用评估器。
Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)