Pulse · AI 뉴스

문법서 기반 저자원 기계 번역을 위한 합성 데이터 생성에 관한 요인 실험 연구

arXiv cs.CL · 2026-07-25

연구진은 문법서에서 문법 규칙, 예문, 어휘를 추출하여 합성 병렬 코퍼스를 생성하는 파이프라인을 개발했어요. 이 파이프라인은 Kalamang, Tuatschin, Mandan과 같은 저자원 언어의 기계 번역 성능을 향상시키는 데 사용돼요. 실험 결과, 합성 데이터로 fine-tuning 했을 때 기존 방식보다 75% (Kalamang) 및 59% (Tuatschin)의 성능 향상을 보였어요.

연구진은 파트 오브 스피치, 검색 세분성, 샘플 볼륨 등 96가지 요인을 실험하며, 어떤 조합이 성능 향상에 기여하고 어떤 조합이 효과를 떨어뜨리는지 분석했어요. 이 연구는 정적인 언어 문서를 기계 번역 fine-tuning에 활용할 수 있음을 보여주며, 극심한 자원 부족 언어에 대한 번역 도구를 개발하는 데 기여할 수 있어요.

Kalamang에서 ChrF++ 점수가 최대 8.8점, Tuatschin에서 5.3점, Mandan에서 3.3점 향상되는 결과를 확인했어요.

##기계번역##저자원##합성데이터##언어학
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기