Switch-Reasoner: Learn When to Think in Multitask Mixtures via Reinforcement Learning
Switch-Reasoner:通过强化学习在多任务混合中学习何时思考
Yiyang Fang, Pei Fu, Jinjie Li, Jian Liang, Wenke Huang, Ruijie Luo, Shaojie Zhang, Jian Luan, Yi R. Fung, Mang Ye
机构
*
Wuhan University(武汉大学)
;
Xiaomi Inc(小米公司)
;
Wuhan University of Technology(武汉理工大学)
;
Nanyang Technological University(南洋理工大学)
;
The Hong Kong University of Science and Technology(香港科技大学)