SignalPilot Labs가 국제 수학 올림피아드(IMO) 2026 문제를 활용해 LLM 성능을 평가했어요. 최신 모델은 하네스에 관계없이 완벽 또는 거의 완벽한 점수를 기록했어요. Claude Opus는 웹앱 성능이 낮았지만, SignalPilot Labs의 AutoFyn 하네스를 통해 성능이 개선됐어요.
GLM과 같은 오픈소스 모델은 Claude Sonnet과 비슷한 수준의 성능을 보였고, AutoFyn을 통해 성능이 향상됐어요. 하지만 최신 모델 수준에는 미치지 못했어요.
모델이 잘못된 답을 제시하는 환각 현상 문제는 여전히 존재하며, 특히 가장 어려운 문제에서는 핵심 아이디어를 놓치는 경우가 있었어요. SignalPilot Labs는 이 연구 결과를 논문과 감사 로그로 공개했어요.