Towards Improved Preference Optimization Pipeline: from Data Generation to Budget-Controlled Regularization
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 15 pages
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 15 pages
专题命中 偏好对齐 :DPO(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Findings of EMNLP 2024
专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Code available at: https://github.com/AlaaLab/Dr-LLaVA
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to EMNLP 2024 Main Conference. Project website: https://feiwang96.github.io/mDPO
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
Comments weirdlabuw.github.io/vpl
专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
Comments AIES '24: Proceedings of the 2024 AAAI/ACM Conference on AI, Ethics, and Society
专题命中 偏好对齐 :RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 13 pages, 5 figures, 6 tables
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
Comments In Proceedings of the 41st International Conference on Machine Learning (ICML 2024)
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG
Comments NAACL 2024 (Findings)
专题命中 偏好对齐 :RLHF(abstract);prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 15 pages, 6 figures
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 22 pages, 9 figures, 12 tables
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 28 pages, 8 figures, 10 tables
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 14 pages, 9 figures
专题命中 偏好对齐 :DPO(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Spotlight at NeurIPS 2023
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * Northeastern University, China(东北大学) ; Alibaba Group, Hangzhou, China(阿里巴巴集团)
专题命中 偏好对齐 :RLHF(abstract,comments);safety(abstract);分类 cs.CL、cs.CY
Comments Compared with the previous version, reinforcement learning has been added (as a new section), including RLHF, RLVR, and RLAIF
机构 * Komorebi AI Technologies, Madrid, Spain(Komorebi人工智能技术公司)
专题命中 偏好对齐 :alignment(abstract,comments);DPO(abstract);分类 cs.CL、cs.AI
Comments Accepted to ICML 2025 Workshop on Models of Human Feedback for AI Alignment
专题命中 偏好对齐 :alignment(abstract,comments);RLHF(abstract);分类 cs.CL、cs.LG
Comments Code is available at https://github.com/alecwangcq/multi-sample-alignment
专题命中 偏好对齐 :RLHF(abstract,comments);alignment(abstract);分类 cs.CL、cs.LG
Comments Data available at https://github.com/anthropics/hh-rlhf