사용자가 GGUF 형식을 bitsandbytes 대신 저 VRAM LoRA 학습의 기본 모델 형식으로 제안했어요. APEX 양자화를 통해 Qwen3.6-35B-A3B 모델을 13.3GB로 줄여 16GB VRAM에서 학습 가능하게 만들었어요. Strix Halo에서 테스트 결과 6.5초/반복 성능을 보여줬어요.
GGUF 융합 양자화-행렬 곱셈/MoE 커널 덕분에 Qwen3.6-35B-A3B 모델을 배치 크기 1, 컨텍스트 길이 2048, LoRA 순위 4로 16GB VRAM에서 CPU 오프로딩 없이 학습할 수 있어요. RDNA3 GPU에서 원활하게 작동하며 다른 GPU로 이식도 용이할 것으로 예상돼요.
PyTorch 바인딩의 GGUF 융합 양자화-행렬 곱셈/MoE 커널을 제공하는 torch-ggml-ops GitHub 저장소도 공개됐어요.