사용자가 GPT, Claude, Gemini, Kimi API를 활용한 10가지 실제 제품 관련 작업을 비교했습니다. 비용 최적화 티어를 사용했음에도 총 비용 격차가 최대 10.6배까지 벌어졌습니다. 이는 응답에 보이지 않는 추론 토큰 과다 청구 때문인 것으로 분석됐습니다.
기존 연구 결과와 일맥상통하는 결과로, 모델들은 비용 효율적인 계획을 선택하지 못하고 불필요한 토큰을 소모하는 경향이 있습니다. TerminalWorld 연구에 따르면 실패한 에이전트 시도는 성공 시보다 토큰 소모량이 훨씬 많습니다.
실험 방법, 원본 결과, 10가지 작업 프롬프트는 GitHub에서 공개됐습니다.