연구진은 AI 에이전트가 배포 후 발생하는 피드백(결과 판정 및 수정 사항)을 활용하여 지속적으로 학습할 수 있는 방법을 제시했어요. 이를 위해 기존 모델은 동결하고 외부 메모리를 활용하여 각 에피소드를 검색 가능한 자연어 규칙으로 추출합니다.
$τ$-bench 뱅킹 도메인에서 기존 방식보다 결과 판정 피드백을 활용하면 단일 시도 성공률이 1.6배 향상되고, 수정 사항 피드백을 활용하면 2.6배 향상되며, 기존에 해결하지 못했던 84개 작업 중 22개를 해결할 수 있어요.
Mistral Large 모델과 Claude Sonnet 5 모델에서 성능 향상을 확인했으며, 누적된 메모리는 모델 간에도 이전되어 각 모델의 초기 성능을 능가하는 결과를 보여줘요. 관련 자료는 공개됐어요.