Generative RLHF-V: Learning Principles from Multi-modal Human Preference
机构 * Peking University(北京大学) ; Hong Kong University of Science and Technology(香港科技大学) ; University College London(伦敦大学学院)
专题命中 后训练与偏好优化 :RLHF(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
Comments 9 pages, 8 figures