연구진은 강화 학습을 활용한 신경망 기계 번역(NMT)에서 모델의 추론 과정을 반영하는 것이 번역 품질에 긍정적인 영향을 미친다는 사실을 밝혀냈습니다. 추론 과정은 번역 품질을 향상시키지만, 출력 토큰 수를 늘려 계산 비용을 증가시키는 단점도 있습니다. 법률 문서 번역에 강화 학습이 선호되는 이유가 추론 능력 때문인지, 아니면 단순히 학습 패러다임 때문인지 조사했습니다.
추론 과정을 추론 과정이 포함된 상태로 학습하고 추론 과정이 없는 상태로 추론하는 실험을 진행한 결과, 추론 과정이 번역 품질을 향상시키는 효과가 있다는 것을 확인했습니다. 특히 추론 과정은 번역 품질을 향상시키지만, 출력 토큰 수를 늘려 계산 비용을 증가시키는 단점도 있습니다.
연구 결과는 강화 학습을 활용한 NMT에서 추론 과정의 중요성을 강조하며, 비용과 품질 간의 균형을 고려해야 함을 시사합니다.