사용자가 C99 기반의 추론 엔진을 직접 개발하여 BitNet의 ternary 모델을 CPU에서 실행했어요.
AVX-512 vpermt2w를 활용한 matmul kernel 최적화를 통해 29배 빠른 성능을 달성했지만, 실제로는 DRAM 병목 현상으로 인해 6~10%의 성능 향상에 그쳤어요.
개발된 엔진은 BitNet b1.58-2B-4T 모델을 4개의 스레드로 36 tok/s 속도로 실행하며, GGUF dense 모델도 지원해요.
GitHub에서 바이너리 파일을 제공하며, 소스 코드는 gcc와 make로 빌드할 수 있습니다.