MoE 학습에서 옵티마이저 상태가 가장 큰 메모리 차지 비율을 차지합니다. AdamW는 6.78B 파라미터 MoE 언어 모델에서 50.6GB의 첫 번째 및 두 번째 모멘트를 유지하며 12.6GB의 bfloat16 가중치를 업데이트합니다.
SkewAdam은 MoE의 밀집 백본, 전문가, 라우터의 세 가지 파라미터 집합이 크기와 기울기 통계에서 차이가 있으므로 동일한 상태를 받아서는 안 된다는 관찰을 바탕으로 구축된 옵티마이저입니다.
SkewAdam은 백본(파라미터의 5%)에 대해 float32 모멘텀과 인수된 두 번째 모멘트, 전문가(95%)에 대해 인수된 두 번째 모멘트만, 라우터(<0.01%)에 대해 정확한 두 번째 모멘트를 유지합니다.
SkewAdam은 1.29GB의 상태를 차지하며 AdamW의 2.6%에 불과하며, 피크 학습 메모리는 81.4GB에서 31.3GB로 감소하여 40GB 가속기의 예산 내에 들어옵니다.