넷플릭스가 기존 ML 인프라에 통합된 사내 LLM 서빙 플랫폼을 구축했어요. vLLM과 Triton을 결합해 사용자 정의 모델 지원과 디버깅 용이성을 확보했어요. 기본 엔진으로 선택된 vLLM은 연구 환경과의 친숙성을 제공하며, 확장 훅을 지원해 유연성을 높였어요. 넷플릭스는 LLM을 별도 사일로로 분리하지 않고 기존 인프라에서 함께 운영해요.