Multidimensional Rubric-oriented Reward Model Learning via Geometric Projection Reference Constraints
通过几何投影参考约束的多维评分导向奖励模型学习
机构 * Shanghai Mingpin Medical Data Technology Co., Ltd.(上海明品医疗数据技术有限公司)
专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 通过几何投影参考约束的多维评分导向奖励模型学习,提升医疗领域大型语言模型的性能和对齐能力。