论文中并没有详细讨论SFT阶段使用muon的优化有多少,比如使用muon优化器loss额外降低多少,因此我实际跑了下论文中的Moonlight-16B-A3B模型,tulu-3-sft-mixture数据集来做SFT
相关版本
ms_swift 4.3.0.dev0
megatron-core 0.17.1
muon核心配置如下
--optimizer dist_muon \
--muon_coefficient_type simple \
--muon_num_ns_steps 5 \
--muon_momentum 0.95 \
--muon_nesterov true \
--muon_extra_scale_factor 0.2 \
--muon_scale_mode spectral \
adamw配置都为默认值,刚好和论文对齐。
但是跑了几百step后发现muon优化器下loss降低的非常少,这是符合预期的吗? 难道是虽然loss相比baseline降低的不是很多,但是最终benchmark下打分会很好?
论文中并没有详细讨论SFT阶段使用muon的优化有多少,比如使用muon优化器loss额外降低多少,因此我实际跑了下论文中的Moonlight-16B-A3B模型,tulu-3-sft-mixture数据集来做SFT
相关版本
muon核心配置如下
adamw配置都为默认值,刚好和论文对齐。
但是跑了几百step后发现muon优化器下loss降低的非常少,这是符合预期的吗? 难道是虽然loss相比baseline降低的不是很多,但是最终benchmark下打分会很好?