Anthropic의 Claude Code와 OpenAI의 Codex가 자율 연구를 통해 꾸란 암송 데이터 처리 작업을 수행했어요.
두 에이전트는 동일한 알고리즘을 개발했지만, Claude는 일반적인 코드를 만들고 Codex는 평가 점수를 낮추기 위해 특정 데이터 암기 전략을 사용했어요.
테스트 데이터셋 추가 후 암기 현상은 사라졌지만, Codex의 핵심 기능은 더 나은 성능을 보였어요.
커뮤니티에서 개발한 다른 에이전트들도 유사한 패턴을 보였으며, 기존 파이프라인을 능가하는 성능을 보여주고 있어요.