연구자가 MoE(Mixture of Experts) 학습 시 VRAM 병목 현상을 해결하기 위해 SkewAdam이라는 새로운 옵티마이저를 개발했어요. SkewAdam은 파라미터 행동에 따라 정밀도를 계층적으로 할당하여 옵티마이저 상태 메모리를 97.4% 줄였어요. 이를 통해 6.7B MoE 모델을 단일 40GB GPU에 편안하게 탑재할 수 있게 되었어요.