개발자 fuzhongkai가 TensorSharp라는 새로운 오픈소스 LLM 추론 엔진을 공개했어요. TensorSharp는 Gemma 4, Qwen 3.6 등 다양한 모델을 지원하며 Windows/MacOS/Linux에서 Vulkan, CUDA, Metal을 통해 GPU 성능을 최대한 활용해요.
TensorSharp는 llama.cpp 대비 최대 1.28배 빠른 속도를 보여줬으며, 특히 CUDA 백엔드에서 decode, prefill, TTFT 성능이 우수했어요. Qwen 3.6 모델의 경우 Vulkan 백엔드에서 1.02배 빠른 속도를 기록했어요.
TensorSharp는 llama.cpp의 GGUF 양자화 방식을 참고하고 vLLM의 페이지드 KV 캐시, oMLX의 SSD 캐시 등 다양한 최적화 기술을 적용했어요. GitHub 스타를 통해 프로젝트에 대한 피드백과 의견을 환영해요.