PAMT: Process-Aligned Reinforcement Learning for Multi-Domain Machine Translation
PAMT:面向多领域机器翻译的过程对齐强化学习
专题命中 测试时计算 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.CL
AI总结 针对多领域机器翻译中显式推理的偏差问题,提出过程对齐强化学习框架PAMT,结合长思维链监督与多维度奖励机制,在多种场景下表现优于基线模型。
Comments 23 pages, 10 figures, and 18 tables