연구진은 다양한 토크나이저를 가진 언어 모델을 통합하는 온폴리시 증류(OPD) 방법인 바이트 접두사 마진(BPM)을 제안했어요. BPM은 교사 모델의 다음 토큰 분포를 공유된 바이트 공간에서 재표현하여 학생 모델의 어휘를 완전하게 활용하고, 토큰 간 연관성이 없는 내용을 매핑하는 문제를 해결해요.
BPM은 교사 토큰의 확률을 교사 토큰의 바이트 시퀀스의 접두사로 가장 긴 학생 토큰에 할당하고, 동일한 학생 토큰에 매핑된 확률을 집계하며, 일치하지 않는 확률을 명시적인 잔여 범주에 배치해요. 이 과정은 99% 이상의 학습 위치에서 교사 모델이 유도하는 바이트 접두사 마진을 정확하게 복원해요.
Qwen3-32B, GLM-Z1-9B-0414, MiniMax-M2.7을 교사 모델로 사용했을 때, BPM은 수학 및 프로그래밍 벤치마크에서 기존 크로스 토크나이저 방법보다 우수한 성능을 보여 6개 벤치마크 평균 정확도를 3.7~6.6 포인트 향상시켰어요.