본 연구는 대규모 언어 모델(LLM) 기반 기계 번역 시스템이 문화적 맥락이 담긴 표현을 처리하는 데 어려움이 있음을 체계적으로 조사합니다. 중국-일본 양방향 번역 데이터셋을 문화적 대표성 있는 작품 '꿈속의 붉은 방'에서 구축했습니다. 평가 결과, LLM은 문화적 맥락 이해에 어려움을 겪고, 평가자 배경에 따라 평가가 크게 달라지며, 기존 자동 평가 지표가 품질을 제대로 반영하지 못하는 문제가 확인됐습니다.