Neroued 사용자가 NInfer라는 새로운 C++/CUDA 추론 엔진을 공개했어요. 이 엔진은 Qwen3.6 모델을 최적화하여 단일 RTX 5090 GPU에서 543 토큰/초의 빠른 추론 속도를 달성했어요.
NInfer는 Qwen3.6-27B 및 Qwen3.6-35B-A3B 모델을 지원하며, 65,536 토큰 완성을 처리하는 데 73%의 MTP 수용률을 보여줘요.
현재 NInfer는 RTX 5090에서만 작동하며, 향후 더 강력한 모델을 지원할 예정이에요. 더 빠른 추론 엔진 개발에 도전하겠다는 의지를 밝혔어요.