새로운 arXiv 논문에 따르면 GPT-5.5가 ActiveVision 벤치마크에서 10.6%의 낮은 점수를 기록했어요. 이 벤치마크는 시각적 인식 능력을 반복적으로 테스트하도록 설계됐어요.
Claude Fable 5는 3.5%의 점수를 기록했고, 인간 참가자들은 평균 96.1%의 높은 점수를 기록하며 모델과 큰 격차를 보였어요.
모델이 스스로 코드를 작성해 문제를 해결하지 못하는 점이 흥미로운 부분이며, 이는 모델의 한계를 드러내는 것으로 분석돼요.