Taming the Implicit: Dual-Channel Risk-Aware Reinforcement Fine-Tuning for Continual Multimodal Post-Training
驯服隐式:面向持续多模态后训练的双通道风险感知强化微调
专题命中 指令微调 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对持续多模态后训练中RFT算法在任务分布偏移下遗忘加剧的问题,提出双通道风险感知强化微调框架RAPO,通过策略与数据通道的风险管控降低遗忘,在MLLM-CL基准上使遗忘减少79.8%且保留新任务竞争力。