RAIN-Merging: A Gradient-Free Method to Enhance Instruction Following in Large Reasoning Models with Preserved Thinking Format
RAIN-Merging: 一种无梯度方法,用于在保持推理格式的前提下提升大推理模型的指令遵循能力
机构 * Institute of Image Processing and Pattern Recoginition, School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(图像处理与模式识别研究所,自动化与智能感知学院,上海交通大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; MoE Key Laboratory of System Control and Information Processing (Shanghai)(系统控制与信息处理国家重点实验室(上海))
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.LG
AI总结 RAIN-Merging通过无梯度方法提升大推理模型的指令遵循能力,同时保持推理格式和性能。
Comments 41 pages, ICLR 2026 Oral