Pulse · AI 뉴스

옵티마이저 상태는 어디에 위치해야 할까? 메모리 효율적인 MoE 학습을 위한 계층적 상태 할당

SkewAdam · 2026-07-21

MoE 학습에서 옵티마이저 상태가 가장 큰 메모리 차지 비율을 차지합니다. AdamW는 6.78B 파라미터 MoE 언어 모델에서 50.6GB의 첫 번째 및 두 번째 모멘트를 유지하며 12.6GB의 bfloat16 가중치를 업데이트합니다.

SkewAdam은 MoE의 밀집 백본, 전문가, 라우터의 세 가지 파라미터 집합이 크기와 기울기 통계에서 차이가 있으므로 동일한 상태를 받아서는 안 된다는 관찰을 바탕으로 구축된 옵티마이저입니다.

SkewAdam은 백본(파라미터의 5%)에 대해 float32 모멘텀과 인수된 두 번째 모멘트, 전문가(95%)에 대해 인수된 두 번째 모멘트만, 라우터(<0.01%)에 대해 정확한 두 번째 모멘트를 유지합니다.

SkewAdam은 1.29GB의 상태를 차지하며 AdamW의 2.6%에 불과하며, 피크 학습 메모리는 81.4GB에서 31.3GB로 감소하여 40GB 가속기의 예산 내에 들어옵니다.

##MoE##SkewAdam##옵티마이저
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기