Reinforcement Learning from User Feedback
机构 * Meta GenAI(Meta 生成式人工智能)
专题命中 偏好对齐 :RLHF(abstract);safety(abstract);分类 cs.AI
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * Meta GenAI(Meta 生成式人工智能)
专题命中 偏好对齐 :RLHF(abstract);safety(abstract);分类 cs.AI
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校) ; Stanford University(斯坦福大学)
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL
机构 * FAIR, Meta(FAIR与Meta) ; Meta United States(Meta美国分公司) ; Meta France(Meta法国分公司) ; Gen AI, Meta(Meta生成式人工智能部门) ; UCLA United States(加州大学洛杉矶分校)
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL
Comments Accepted to 2025 ACM FAccT
机构 * Antiquus S. Hippocampus, Natalia Cerebro & Amelie P. Amygdale Department of Computer Science Cranberry-Lemon University Pittsburgh, PA 15213, USA(计算机科学系, Cranberry-Lemon 大学) ; Ji Q. Ren & Yevgeny LeNet Department of Computational Neuroscience University of the Witwatersrand Joburg, South Africa(计算神经科学系, 威特沃特斯兰大学)
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL
Comments To appear in ICML 2025
机构 * University of Minnesota(明尼苏达大学) ; Georgia Institute of Technology(佐治亚理工学院) ; Grammarly ; University of Arizona(亚利桑那大学)
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.LG
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.AI
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.LG
Comments 16 pages, 7 figures
专题命中 偏好对齐 :safety(abstract);jailbreak(abstract);分类 cs.CL
专题命中 偏好对齐 :RLHF(abstract);safety(abstract);分类 cs.CL
Comments This paper is a work in progress with findings based on limited evidence. Please exercise discretion when interpreting the findings
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.AI
专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.CL
Comments 8 pages, 6 figures
专题命中 偏好对齐 :DPO(abstract);safety(abstract);分类 cs.CL
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.AI
专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.LG
专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.LG
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.AI
Comments 4pages, 3 figures
Journal ref Proc. 1st Workshop on Post-Singularity Symbiosis, PSS-2025-007, March 3, 2025
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL
Comments 20 pages, 9 figures, 12 tables. Accepted at ICLR 2025
专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.CL
Journal ref Proceedings of the 31st International Conference on Computational Linguistics (2025), pages 6298-6316
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.LG
专题命中 偏好对齐 :RLHF(abstract);jailbreak(abstract);分类 cs.AI
Comments 23 pages, 14 figures
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL
Comments Accepted by NAACL 2025
专题命中 偏好对齐 :RLHF(abstract);safety(abstract);分类 cs.AI
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL
Comments NAACL 2025 (Findings, Long). Resources are available at https://github.com/youngerous/qtree
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.AI
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.LG
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL
Comments 17 pages, 5 figures
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.LG
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.LG
Comments AAAI 2025. The code is available at https://github.com/WentaoTan/SENA