Inflect 개발자가 396만 파라미터 TTS 모델 Inflect-Nano-v2의 튜닝 툴킷을 공개했어요. 사용자는 자신의 음성 데이터와 텍스트를 활용해 모델을 튜닝하고 PyTorch 또는 ONNX 형식으로 내보낼 수 있어요. 튜닝 툴킷은 기존 모델의 학습 구성 요소를 재구성하고 새로운 음소 목록을 처리하는 기능을 포함하고 있어요. 영어 외 다른 언어 모델 튜닝은 아직 초기 단계이며, 언어 선택을 위한 간단한 설문조사를 진행 중이에요.
Inflect-Nano-v2는 396만 파라미터, 15.97MB 용량으로, Inflect-Micro-v2는 935만 파라미터, 37.53MB 용량이에요. 이 모델들은 24kHz 파형 디코더를 포함하며, eSpeak-ng는 음소화 작업을 별도로 수행해요. 튜닝 툴킷은 CUDA 기반 학습, 저장 및 재개, PyTorch 로딩, ONNX 런타임 호환성을 지원해요.
현재 영어 모델의 가중치는 변경되지 않았으며, 새로운 언어 모델 튜닝은 감독적 적응 방식으로, 각 실행은 특정 언어에 대한 고정된 음성을 생성해요. 개발자는 다른 언어로 작은 TTS 모델을 튜닝해 본 경험이 있는 사용자로부터 어떤 부분이 가장 먼저 실패하는지 피드백을 구하고 있어요.