연구진은 문법서에서 문법 규칙, 예문, 어휘를 추출하여 합성 병렬 코퍼스를 생성하는 파이프라인을 개발했어요. 이 파이프라인은 Kalamang, Tuatschin, Mandan과 같은 저자원 언어의 기계 번역 성능을 향상시키는 데 사용돼요. 실험 결과, 합성 데이터로 fine-tuning 했을 때 기존 방식보다 75% (Kalamang) 및 59% (Tuatschin)의 성능 향상을 보였어요.
연구진은 파트 오브 스피치, 검색 세분성, 샘플 볼륨 등 96가지 요인을 실험하며, 어떤 조합이 성능 향상에 기여하고 어떤 조합이 효과를 떨어뜨리는지 분석했어요. 이 연구는 정적인 언어 문서를 기계 번역 fine-tuning에 활용할 수 있음을 보여주며, 극심한 자원 부족 언어에 대한 번역 도구를 개발하는 데 기여할 수 있어요.
Kalamang에서 ChrF++ 점수가 최대 8.8점, Tuatschin에서 5.3점, Mandan에서 3.3점 향상되는 결과를 확인했어요.