연구진은 환경과의 상호작용 제약 문제를 해결하기 위해 에이전트 경험 증류(Experience Distillation)라는 새로운 방법을 제시했어요. 이 방법은 기존 에이전트의 상호작용 기록을 모델 가중치에 내재화하여 환경 샘플링 효율성을 유지해요. 소프트웨어 엔지니어링 작업과 텍스트 어드벤처 게임 실험 결과, 에이전트 경험 증류는 기존 방식 대비 64.8% 이상의 학습 효율성을 유지했어요.
기존 강화 학습 방식과 비교했을 때, 에이전트 경험 기반 학습 후 경험 증류를 적용하면 최소 9.6배 적은 환경 샘플로 동일한 성능을 달성했어요. 이는 환경과의 상호작용 비용을 크게 절감할 수 있음을 의미해요.
연구 결과는 에이전트 학습 효율성을 높이는 데 기여하며, 실제 환경 상호작용이 제한적인 상황에서 더욱 유용하게 활용될 수 있을 것으로 기대돼요.