Semi-Supervised Reward Modeling via Iterative Self-Training
专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
Comments to be published in Interspeech 2024
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG
专题命中 偏好对齐 :alignment(abstract);分类 cs.LG
Comments Published at the 2024 Conference on Language Modeling (CoLM)
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
Comments 17 pages, 4 figures. COLM 2024
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
Comments Accepted by ACL2024 Findings
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
Comments ECCV 2024. 56 pages, 24 figures. Caution: This paper contains discussions and examples related to harmful content, including text and images. Reader discretion is advised. Code is available at https://github.com/nannullna/safeguard-hfi
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL
专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI
专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL
Comments EAMT 2024
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL
Comments 27pages, 15 tables
专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
专题命中 偏好对齐 :safety(abstract);分类 cs.AI
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
Comments IEEE copyright statement added (also applied to the former version)
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL
专题命中 偏好对齐 :alignment(abstract);分类 cs.LG
专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL
Comments Accepted to Findings of ACL 2024. The code, datasets, and models are publicly available at https://github.com/boschresearch/ACL24-MLLM
专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL
Comments Accepted to Findings of ACL 2024. Code and data available at https://github.com/andyjliu/persona-steered-generation-bias
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
Comments Accepted by ACL 2024 Findings
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL
Comments Accepted to LREC-COLING 2024 main conference. The code is available at https://github.com/text-machine-lab/Understanding_prompts_via_corruption
专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG
专题命中 偏好对齐 :trustworthy(abstract);分类 cs.LG