연구진은 고대어 텍스트 분석을 위한 문장 표현 학습 방법을 연구했어요. 기존 방법들이 고대어에 적합하지 않아, TSDAE와 CSE라는 비지도 학습 전략을 활용했어요.
성경 재사용 분석을 통해 개발된 모델은 기존 방법보다 성능이 뛰어나며, TSDAE는 대규모 코퍼스에서, CSE는 적은 양의 데이터로도 효과적이었어요.
연구 결과는 HTR 오류와 필사법 약어를 모방한 노이즈 데이터에서도 유효했으며, 온라인 도구 Paraphrasis를 통해 비전문가도 활용할 수 있도록 제공돼요.
UMAP 분석 결과, 각 전략의 기하학적 효과가 성능 향상과 관련이 있음을 확인했어요.