ArvidSU가 모델의 Base64 응답 생성 능력을 측정하는 새로운 벤치마크 'Encode Bench'를 공개했어요. Encode Bench의 통과율은 AI 지능 지수와 0.91의 높은 상관관계를 보였어요. 이는 단순한 토크나이저·훈련 데이터의 영향일 수 있다는 분석도 있어요.
Encode Bench는 모델이 문제를 해결하고 정확한 답변을 Base64로 인코딩하는 능력을 평가하며, 코딩, 논리, 구조화된 데이터 등 24가지의 deterministic task를 사용해요. GPT-5.6 Sol은 70/72 (97.2%)의 가장 높은 점수를 기록했어요.
ArvidSU는 Base64 생성 능력과 AI 지능 간의 연관성에 대한 커뮤니티의 의견을 구하며, 벤치마크가 훈련 데이터에 포함되면 신호가 개선될지, 아니면 의미를 잃을지 궁금해해요.