Transforming and Combining Rewards for Aligning Large Language Models
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL、cs.LG
Comments 42 pages, 13 figures, 33 tables
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.AI、cs.LG
Comments 11 main pages (34 pages with Appendix)
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.LG
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.LG
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI
Comments 10 pages, 1 figure
专题命中 偏好对齐 :RLHF(abstract);safety(abstract);分类 cs.AI、cs.LG
Comments ICLR 2024. Project website and open-source code: https://eureka-research.github.io/
专题命中 偏好对齐 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.CL、cs.LG
Comments 25 pages, 27 Figures, 8 Tables
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.LG
Comments PhD thesis
专题命中 偏好对齐 :RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG
专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.AI、cs.LG
Comments CVPR 2024 accepted; huggingface daily paper
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI
Comments 22 pages, 5 figures, Submitted to ACL 2024
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.LG
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.LG
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.LG
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :alignment(abstract,comments);DPO(abstract);分类 cs.CL
Comments Accepted by AAAI-2025, 16 pages, reward model, LLM Alignment, code repository at (https://github.com/e0397123/FLR)
GenFacet:通过多任务偏好对齐的端到端生成方法实现电商多维搜索
专题命中 偏好对齐 :alignment(title)
AI总结 本文提出GenFacet,一种端到端生成框架,通过多任务偏好对齐提升电商多维搜索效果,实验证明显著提升点击率和转化率。
生成扩散模型在农业AI中的应用:植物图像生成、室内外转换以及专家偏好对齐
机构 * University of Manitoba(曼尼托巴大学) ; University of Winnipeg(温哥华大学)
专题命中 偏好对齐 :alignment(title)
AI总结 本文提出基于扩散模型的生成方法,通过合成植物图像、室内外转换和专家偏好对齐,提升农业AI的数据效率和性能。
专题命中 偏好对齐 :alignment(title)
Comments 73 pages
专题命中 偏好对齐 :alignment(title)
Comments 7 pages, 9 figures, 3 tables; appendix 16 pages, 9 figures, 6 tables
机构 * Lenovo Research(联想研究) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Tsinghua University(清华大学) ; Beijing Jiaotong University(北京交通大学) ; Shandong University(山东大学)
专题命中 偏好对齐 :alignment(title)