PERSA: Reinforcement Learning for Professor-Style Personalized Feedback with LLMs
PERSA:利用强化学习生成教授风格的个性化反馈
机构 * Florida International University(佛罗里达国际大学) ; University of South Florida(佛罗里达州立大学)
专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 PERSA通过结合监督微调、奖励建模和PPO,利用LLM生成符合教授风格的编程反馈,提升反馈的风格匹配度和准确性。
Comments 18 pages, 6 figures, 7 tables, accepted to conference ACL-2026, BEA