LLM 모델 파인튜닝을 위해 GPU를 임대하는 사용자가 현재 GPU 플랫폼들이 코드 실행, 장애 처리, 공정한 요금 중 두 가지만 제공하는 데 주목했습니다.
RunPod, Vast, Lambda는 저렴하지만 사용자가 직접 장애를 관리해야 하며, Modal은 인프라가 뛰어나지만 SDK로 코드를 재작성해야 하고, Tinker는 사용 편의성이 있지만 기능 제한이 있습니다.
AWS HyperPod는 자동 복구가 가능하지만 기업 고객만 이용할 수 있으며, 대부분의 플랫폼은 장애 발생 시 사용자가 승인해야 하거나, 훈련 상태를 관리해야 하는 불편함이 있습니다.