연구진은 LLM이 창의성을 평가할 때 인간과 얼마나 일치하는지 세 차례 연구를 통해 분석했어요. LLM은 인간 평가 기준 중에서도 참신성(novelty)에서는 일치하지만, 사회적 맥락(context)에서는 의견이 엇갈리는 경향을 보였어요. LLM마다 평가 기준이 달라 창의성 판단 결과도 차이를 보였으며, 맥락 정보에 덜 민감한 점이 확인됐어요.