HARGO: Heterogeneity-Aware Reward-Guided Optimization for RL Post-Training of LLMs on HPC Tasks
HARGO:面向HPC任务的LLM RL后训练的异质性感知奖励引导优化
专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);post-training(title,abstract);SFT(abstract,abstract_cn);large language model(abstract)
AI总结 针对HPC任务的LLM RL后训练的异质性问题,提出HARGO方法,通过置信度调制优势实现逐响应重要性加权,在四项HPC任务的三项核心指标上均取得最优性能。