연구진은 LLM의 성능과 비용 변동성을 평가하기 위해 HuGLEN이라는 단계별 평가 파이프라인을 개발했어요. HuGLEN은 LLM-as-a-judge와 전문가 평가를 결합해 LLM 후보를 비교하고 품질 효율성 점수(QES)로 순위를 매겨요.
XAI 모델의 광 네트워크 품질 추정 결과를 작업자 친화적인 설명으로 변환하는 데 HuGLEN을 적용한 결과, 120억 파라미터 규모의 LLM이 가장 높은 QES를 달성했어요.
HuGLEN은 인간 레이블링 부담을 줄이면서 작업자 대상 자동화 작업에 적합한 모델 선택을 지원해요.