Adam-mini: Use Fewer Learning Rates To Gain More
专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.LG
Comments Accepted by EMNLP 2024 Main
专题命中 偏好对齐 :safety(abstract);分类 cs.AI、cs.LG
Comments Accepted to ICLR 2025
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
Comments Under review
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.LG
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI
Comments Under review
专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG
Comments 17 pages, 7 figures
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
Comments the Nations of the Americas Chapter of the Association for Computational Linguistics (NAACL), Findings, Accepted
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
Comments Accepted to ICLR 2025. 23 pages,13 figures,11 tables
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.LG
专题命中 偏好对齐 :safety(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG
专题命中 偏好对齐 :trustworthy(abstract);分类 cs.AI、cs.LG
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.CY
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI
Comments Published in JMIR: https://www.jmir.org/2025/1/e66220
专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI
Comments NeurIPS 2024
专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.LG
Comments Accepted at ICASSP 2025
专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI
Comments Accept by AAAI 2025
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
Comments 23 pages
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.LG
Comments New experimental results on general chat
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.LG
专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI