사용자가 90G VRAM 환경에서 DeepSeek-V4-Flash 모델의 LoRA 학습을 성공적으로 수행했어요. Strix Halo에서 19초/iteration으로 실행되며, sliding attention 등 Triton 커널 최적화로 빠른 속도를 보여줘요. GGUF 통합을 통해 모델 수술 등 비학습 작업 접근성을 높이는 것을 목표로 하고 있어요.
GGUF 기반 학습을 통해 기존 CPU 오프로딩 없이 284B 파라미터 모델도 학습 가능하며, Heretic과 같은 모델 수술 작업도 용이해질 것으로 기대돼요. mHC ablation과 같은 해결해야 할 과제도 남아있어요.
Triton 커널 최적화로 sliding attention, CSA, HCA 등 WTF 파트의 성능을 향상시켰으며, 관련 작업은 PyTorch 생태계 통합을 통해 더 많은 사용자가 접근할 수 있도록 할 예정이에요.