SPPD: Self-training with Process Preference Learning Using Dynamic Value Margin
专题命中 偏好对齐 :DPO(abstract);分类 cs.AI
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 偏好对齐 :DPO(abstract);分类 cs.AI
专题命中 偏好对齐 :DPO(abstract);分类 cs.LG
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL
Comments 28 pages, 11 figures. ICLR 2025
专题命中 偏好对齐 :safety(abstract);分类 cs.AI
Comments arXiv admin note: substantial text overlap with arXiv:2410.15281
专题命中 偏好对齐 :DPO(abstract);分类 cs.CY
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL
Comments 12 pages, 6 figures
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL
Comments Project: https://github.com/Gen-Verse/ScoreFlow
专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG
专题命中 偏好对齐 :alignment(abstract);分类 cs.LG
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
Comments Accepted by AAAI 2025
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL
Comments Accepted by ICLR 2025
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL
专题命中 偏好对齐 :alignment(abstract);分类 cs.LG
Comments EMNLP 2024
专题命中 偏好对齐 :alignment(abstract);分类 cs.LG
Comments Accepted (oral) at AAAI 25
专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI
专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
Comments 12 pages, 9 figures
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL
Comments 12 pages, 9 figures
专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
Comments Under review of Science China
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL
Comments Published at AAAI 2025
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
Comments Under review
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
Comments Accepted by COLING 2025
专题命中 偏好对齐 :DPO(abstract);分类 cs.AI