MoE 학습에서 옵티마이저 상태가 가장 큰 메모리 차지 비율을 차지합니다. AdamW는 6.78B 파라미터 MoE 언어 모델에서 50.6GB의 첫 번째 및 두 번째 모멘트를 유지하며, 이는 12.6GB의 bfloat16 가중치를 업데이트하는 데 사용됩니다.
SkewAdam은 MoE의 밀집 백본, 전문가, 라우터의 세 가지 파라미터 집합이 크기와 기울기 통계에서 충분히 다르기 때문에 동일한 상태를 받아서는 안 된다는 관찰을 바탕으로 구축된 옵티마이저입니다.
SkewAdam은 백본(파라미터의 5%)에 대해 float32 모멘텀과 인수된 두 번째 모멘트, 전문가(95%)에 대해 인수된 두 번째 모멘트만, 라우터(<0.01%)에 대해 정확한 두 번째 모멘트를 유지합니다. 결과 상태는 1.29GB를 차지하며, 이는 AdamW의 2.6%에 해당합니다.
SkewAdam은 AdamW(126.8), Muon(120.2), Lion(393.7)보다 앞서 검증 퍼플렉시티 108.4를 달성하며, 라우터 로드 밸런스를 균일한 최소값에서 1% 이내로 조정합니다.