연구진은 LLM 훈련 방식을 수동 설계에서 상호작용 기반의 자가 진화로 전환하는 Skill Self-Play (Skill-SP) 프레임워크를 제안했어요.
Skill-SP는 proposer, solver, skill controller 세 요소가 강화 학습 루프를 통해 공진화하며, proposer는 다양한 skill을 활용해 어려운 task를 생성하고, solver는 해결책을 탐색하며, skill controller는 실행 피드백을 수집해 skill 라이브러리를 업데이트해요.
tool-use 및 추론 벤치마크 실험 결과, Skill-SP는 기존 모델 성능을 꾸준히 향상시키고, 초기에는 잘못 정렬된 모델도 궤도 수정하는 데 기여했어요. 관련 코드는 GitHub에서 확인할 수 있어요.