연구진은 HuBERT와 같은 SSL 모델의 토큰이 화자 정보, 운율, 채널 조건 등 비언어적 변동을 포함하고 있다는 점을 발견했어요. PINT(Parallel INvariant Tokenization)라는 새로운 방법을 제안하여 병렬 발화와 증강을 활용해 공유되는 잔여 정보를 추출했어요. PINT는 동일한 단어를 일관된 토큰 시퀀스로 묶어 조건부 엔트로피를 크게 줄여요.
PINT 토큰은 프레임 수준의 시간적 정보를 보존하며 오디오 코덱의 의미 대상(semantic target)으로 활용 가능해요. 실험 결과, 화자 식별 정확도가 98.7% 감소하고 ABX 오류율이 42% 낮아지는 등 기존 방식 대비 성능이 향상됐어요.
연구는 음성 토큰화에서 올바른 불변성을 확보하는 것이 효율적인 학습에 중요하다는 점을 입증했어요.