7개 프런티어 모델을 분석한 결과, 특정 프롬프트에 맞춰 성능을 최적화하는 pelicanmaxxing 현상은 발견되지 않았어요. 8종 동물과 6종 탈것 조합, 총 48개 프롬프트를 GPT-5.6 Luna로 테스트했어요. 동물·탈것·행동 일관성 평가 결과, 모델별 차이가 미미했어요.
연구는 유명 프롬프트에 맞춰 모델 성능을 끌어올리는 현상(pelicanmaxxing)이 있는지 확인하기 위해 진행됐어요. SVG 이미지 1,008개를 비교 분석했고, GPT-5.6 Luna를 활용해 일관성을 평가했어요.
결과적으로 AI 모델이 특정 프롬프트에 맞춰 성능을 최적화한다는 기존 가설은 뒷받침되지 않았으며, 모델 간 일관성 차이는 크지 않았던 것으로 나타났어요.