Hidden Persuaders: LLMs' Political Leaning and Their Influence on Voters
专题命中 偏好对齐 :safety(abstract);分类 cs.CL、cs.CY
Comments EMNLP 2024 Main
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 偏好对齐 :safety(abstract);分类 cs.CL、cs.CY
Comments EMNLP 2024 Main
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI
Comments We share our latest dataset on https://github.com/findalexli/Abstract2Appendix
专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI
Comments Published in ICML 2024
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.LG
Comments Published as a conference proceeding for NeurIPS 2024
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.LG
Comments Added some experiments and charts, and redrew some figures V4
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.LG
Comments To appear in NeurIPS 2024 in the Fine-Tuning in Machine Learning Workshop
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.LG
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG
Comments Under Review
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.LG
专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI
Comments NeurIPS 2024
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.LG
Comments Published in Transactions on Machine Learning Research (TMLR)
专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.LG
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
Comments EMNLP24, Main, Long
专题命中 偏好对齐 :safety(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI
Comments 17 pages, 9 figures. EMNLP 2024
专题命中 偏好对齐 :safety(abstract);分类 cs.CL、cs.LG
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.LG
专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI
Comments Accepted by EMNLP 2024
专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG
专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI
专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.LG
专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG