MathShikkha: A Controlled Study of Answer-Only and Chain-of-Thought Supervision for Bangla Mathematical Reasoning in Small Language Models
MathShikkha:针对小型语言模型孟加拉语数学推理的仅答案与思维链监督对照研究
机构 * University at Albany(奥尔巴尼大学)
专题命中 数学推理 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究构建含GPT-5.4推理依据的孟加拉语数学数据集MathShikkha,微调4个4B-7B模型,发现CoT监督对域内强骨干无增益但提升弱模型,域外及BanglaMATH基准上均优于仅答案,核心益处为语言贴合度、可审核推理及域外鲁棒性。