연구자들이 직접 관리하는 온톨로지 구축은 과학 지식 관리의 주요 병목 현상입니다. LLM은 자동 온톨로지 생성에 도움을 줄 수 있지만, 전문 분야의 복잡한 의미를 분류하려면 체계적인 평가가 필요합니다.
연구진은 90억 파라미터 이하의 5개 소규모 오픈소스 LLM을 평가하고, 의료 주제 명명법(MeSH)에서 추출한 4천 개의 의미 관계 데이터셋 MeSH-Rel-4K를 활용했습니다.
표준 프롬프트, Chain-of-Thought 프롬프트, 파인튜닝 전략을 비교한 결과, 파인튜닝을 통해 평균 F1 점수가 34.1% 향상되어 소규모 LLM의 추론 병목 현상을 극복할 수 있음을 확인했습니다.