Distributional Alignment Games for Answer-Level Fine-Tuning
分布对齐博弈用于答案级微调
机构 * Google Research(谷歌研究) ; Microsoft Research(微软研究)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出分布对齐博弈框架,通过策略与目标的博弈达到答案级优化,统一了多样性与自改进方法,提升数学推理任务效率。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
分布对齐博弈用于答案级微调
机构 * Google Research(谷歌研究) ; Microsoft Research(微软研究)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出分布对齐博弈框架,通过策略与目标的博弈达到答案级优化,统一了多样性与自改进方法,提升数学推理任务效率。
探索剪枝的极限:任务特定神经元、模型崩溃与任务特定大语言模型中的恢复
机构 * BRAC University(布拉格大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 研究通过系统剪枝实验揭示任务特定语言模型中神经元的专有性,发现任务特定神经元对性能至关重要,剪枝策略影响模型鲁棒性和恢复能力。