Safer-Instruct: Aligning Language Models with Automated Preference Data
专题命中 偏好对齐 :RLHF(abstract);safety(abstract);harmlessness(abstract);分类 cs.CL、cs.AI
Comments 16 pages. NAACL 2024 Camera-ready
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 偏好对齐 :RLHF(abstract);safety(abstract);harmlessness(abstract);分类 cs.CL、cs.AI
Comments 16 pages. NAACL 2024 Camera-ready
专题命中 偏好对齐 :alignment(abstract);safety(abstract);harmlessness(abstract);分类 cs.CL、cs.AI
ToolRec: 面向设备端助手的校准偏好对齐查询推荐
专题命中 偏好对齐 :alignment(title,abstract)
AI总结 提出ToolRec框架,通过构建系统工具库和双层校准机制优化点击数据,利用加权KTO对齐模型,在设备端助手查询推荐中提升点击率和相关性。
Comments Under review
Reason4Rec:用于推荐的大语言模型的审慎用户偏好对齐
专题命中 偏好对齐 :alignment(title,abstract)
AI总结 研究旨在开发更可靠的推荐LLMs,引入“审慎推荐”任务并提出“推理驱动的推荐器”框架,利用语言化用户反馈增强推理能力,经实验验证该框架能提升预测准确性和推理质量。
Comments Accepted to IEEE TKDE
DetailAnywhere: 通过跨模态特征对齐蒸馏实现时尚细节生成
机构 * Kuaishou Technology(快手科技) ; AIM for Health Lab, Monash University(Monash大学AIM健康实验室)
专题命中 偏好对齐 :alignment(title,abstract)
AI总结 针对在线购物中用户关注服装细节(如领口、袖口、面料纹理)的需求,提出新任务“时尚细节生成”及基准FDBench,并设计跨模态特征对齐蒸馏(CFAD)方法,结合多模态扩散Transformer和一致性奖励模型,显著优于现有方法。
Follow-Your-Preference++:重新思考图像修复中的偏好对齐
机构 * Zhejiang University(浙江大学) ; The University of Tokyo(东京大学) ; Tsinghua University(清华大学)
专题命中 偏好对齐 :alignment(title,abstract)
AI总结 本文从基本原理出发,通过直接偏好优化框架和公开奖励模型构建偏好数据,系统研究了图像修复中的偏好对齐问题,发现奖励模型存在偏差但可通过集成缓解,并在标准指标、大视觉语言模型评估和人类评估上显著超越先前最先进模型。
Comments 23 pages, 14 figures. arXiv admin note: substantial text overlap with arXiv:2509.23082
多目标测试时对齐的共同代理博弈
专题命中 偏好对齐 :alignment(title,abstract)
AI总结 本文提出CAGE框架,通过游戏理论实现多目标测试时对齐,无需重新训练,支持灵活的权衡和弱到强泛化。
基于熵的奖励引导用于扩散语言模型对齐
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 偏好对齐 :alignment(title);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出EntRGi机制,解决离散扩散语言模型中无法通过自然输出区分的问题,通过动态插值连续token放松与采样硬token,提升奖励模型可靠性与优化精度。
Comments Preprint
HSUGA:基于层次语义理解与群体感知对齐的LLM增强推荐
专题命中 偏好对齐 :alignment(title,abstract)
AI总结 HSUGA通过引入层次语义理解和群体感知对齐模块,解决LLM增强推荐中用户语义嵌入提取与利用的可靠性与适应性问题,提升推荐性能。
Comments Accepted by ACL 2026 Findings
OARS:面向生成真实世界图像超分辨率的在线对齐
机构 * ByteDance Inc.(字节跳动公司) ; Peking University(北京大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 偏好对齐 :alignment(title,abstract)
AI总结 OARS通过过程感知的在线对齐框架,结合COMPASS奖励模型,在线优化图像超分辨率模型,实现感知与保真度的平衡,提升真实世界图像超分辨率性能。
Comments Super-Resolution, Reinforcement Learning
医学视觉-语言模型的视觉对齐以实现基于基础的放射学报告生成
机构 * NEC Laboratories America(NEC美洲实验室) ; University of California, Riverside(加州大学河滨分校)
专题命中 偏好对齐 :alignment(title,abstract)
AI总结 本文提出VALOR方法,通过临床指导文本推理和自监督视觉推理解决医学报告生成中的视觉幻觉问题,提升生成质量与临床准确性。
基于扩散模型的人体网格恢复中的群体偏好对齐
机构 * Nanyang Technological University(南洋理工大学) ; HKUST(GZ)(香港科技大学(广州)) ; SenseTime Research(商汤科技研究院) ; A*STAR(新加坡科技研究局)
专题命中 偏好对齐 :alignment(title,abstract)
AI总结 本文提出了一种基于群体偏好的扩散模型微调框架,通过双内存增强的批评代理生成质量评分,提升人体网格恢复的物理合理性和图像一致性。
Comments Accepted to CVPR 2026
CORAL: 用于改进虚拟试衣的对应对齐
机构 * NC AI Co., Ltd(NC AI公司)
专题命中 偏好对齐 :alignment(title,abstract)
AI总结 CORAL通过引入基于DiT的框架,显式对齐查询-键匹配与外部对应关系,从而提升虚拟试衣中的人-服装对应精度和细节保留能力。
Comments 32 pages, 25 figures
构建智能用户界面以实现人机对齐
专题命中 偏好对齐 :alignment(title,abstract)
AI总结 本文提出参考模型,通过分析用户界面改进人机对齐,展示两个案例研究和六个界面的初步调查,强调人机交互对对齐的促进作用。
HII-DPO: 通过准确的 hallucination-Inducing Counterfactual Images 消除幻觉
机构 * University of Houston(休斯顿大学) ; Rice University(里士满大学) ; Argonne National Laboratory(阿贡国家实验室)
专题命中 偏好对齐 :DPO(title);alignment(abstract)
AI总结 HII-DPO通过生成准确的幻觉诱导图像,有效缓解了VLMs在语言偏见下的幻觉问题,提升了模型的对齐能力。
基于令牌级的协同对齐用于基于大语言模型的生成推荐
专题命中 偏好对齐 :alignment(title,abstract)
AI总结 TCA4Rec通过令牌级协同对齐框架,将协同过滤与大语言模型生成结合,提升推荐系统的准确性和可控性。
Comments 11 pages, 2 figures, 7 tables, WWW 2026
CritiFusion: 语义批评与频谱对齐用于忠实的文本到图像生成
机构 * National Yang Ming Chiao Tung University
专题命中 偏好对齐 :alignment(title,abstract)
AI总结 CritiFusion通过语义批评和频谱对齐提升文本到图像生成的忠实度和细节质量。
专题命中 偏好对齐 :alignment(title,abstract)
Comments The article has been accepted by Frontiers of Computer Science (FCS), with the DOI: {10.1007/s11704-025-50269-4}
机构 * Arizona State University(亚利桑那州立大学)
专题命中 偏好对齐 :alignment(title,abstract)
Comments EMNLP 2025 (Main)
机构 * CyberAgent / Tokyo, Japan(CyberAgent)
专题命中 偏好对齐 :alignment(title);分类 cs.CL、cs.AI、cs.LG
Comments EMNLP Findings, 2025
机构 * Beihang University(北航大学) ; National University of Singapore(国立新加坡大学) ; King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学)
专题命中 偏好对齐 :alignment(title,abstract)
Comments Accepted by ICCV 2025
专题命中 偏好对齐 :alignment(title,abstract)
专题命中 偏好对齐 :alignment(title,abstract)
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Meta FAIR
专题命中 偏好对齐 :alignment(title);分类 cs.CL、cs.AI、cs.LG
Comments ICML 2025 main conference paper. The source code is available at https://github.com/facebookresearch/SelfCite
专题命中 偏好对齐 :alignment(title,abstract)
专题命中 偏好对齐 :alignment(title,abstract)
专题命中 偏好对齐 :RLHF(title);trustworthy(abstract)
Comments Accepted by the Doctoral and Early Career Symposium (DECS) at ICSE 2025
专题命中 偏好对齐 :alignment(title,abstract)
Comments Accepted for publication in CVPR 2025
专题命中 偏好对齐 :alignment(title);DPO(abstract)
专题命中 偏好对齐 :DPO(title,abstract)
Comments AAAI 2025