Pulse · AI 뉴스

GPT-5.5, ActiveVision 벤치마크에서 10.6% 기록… 인간은 96.1%

OpenAI · 2026-07-24

새로운 arXiv 논문에 따르면 GPT-5.5가 ActiveVision 벤치마크에서 10.6%의 낮은 점수를 기록했어요. 이 벤치마크는 시각적 인식 능력을 반복적으로 테스트하도록 설계됐어요.

Claude Fable 5는 3.5%의 점수를 기록했고, 인간 참가자들은 평균 96.1%의 높은 점수를 기록하며 모델과 큰 격차를 보였어요.

모델이 스스로 코드를 작성해 문제를 해결하지 못하는 점이 흥미로운 부분이며, 이는 모델의 한계를 드러내는 것으로 분석돼요.

##GPT-5.5##ActiveVision##벤치마크##OpenAI
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기