이 연구는 영어-타밀, 타밀-영어 번역에서 NTREX, EnTamV2, WikiMatrix, PMIndia 등 다양한 데이터셋을 활용해 NMT, NLLB, mBART 등 다국어 번역 모델의 성능을 종합적으로 평가했어요.
BLEU, chrF 지표를 사용해 데이터 품질과 도메인에 따른 모델 성능 변화를 분석하고, 어텐션 기반 분석을 통해 영어-타밀 토큰 정렬을 시각화하여 모델 해석력을 높였어요.
TamilLaMA 모델을 활용한 few-shot 번역 실험 결과, 데이터 품질과 도메인 일치가 모델 성능에 큰 영향을 미치며, few-shot LLM도 구조적으로 일관된 타밀 번역이 가능하다는 점을 확인했어요.