VORTEX: Aligning Task Utility and Human Preferences through LLM-Guided Reward Shaping
机构 * Department of Computer Science, Harvard University(计算机科学系,哈佛大学)
专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI
Comments 28pages, 19figures