연구진은 LLM 훈련 방식을 수동 설계에서 상호작용 기반의 자기 진화로 전환하는 Skill Self-Play(Skill-SP) 프레임워크를 제안했어요.
Skill-SP는 proposer, solver, skill controller 세 요소가 강화 학습 루프를 통해 공진화하며, proposer는 역동적으로 샘플링된 skill에 기반한 도전적인 task를 생성해요.
tool-use 및 추론 벤치마크 실험 결과, Skill-SP는 기존 모델 성능을 꾸준히 향상시키고, 초기에는 방향성이 맞지 않았던 모델도 획기적으로 개선했어요.