연구진은 LLM 평가가 단순히 성능 측정뿐 아니라 다음 모델 개선 방향을 제시하고 맞춤형 파인튜닝 데이터를 생성하는 데 활용되어야 한다고 주장했어요.
CRAFT는 루브릭 기반 평가 데이터셋을 모델별 약점 역량 진단으로 전환하는 방법으로, 각 평가 기준을 역량 탐침으로 활용하여 계층적 역량 트리 구축 및 모델 성능 점수를 측정해요.
CRAFT는 진단 데이터를 기반으로 생성된 파인튜닝 데이터를 통해 금융 분야에서 네 모델 모두 최고 성능을 달성했으며, 법률 분야에서도 세 모델에서 최고 성능을 보였어요.