Pulse · AI 뉴스

Skill Self-Play: LLM 능력 향상을 위한 공진화 기술

Skill Self-Play · 2026-07-24

연구진은 LLM 훈련 방식을 수동 설계에서 상호작용 기반의 자기 진화로 전환하는 Skill Self-Play(Skill-SP) 프레임워크를 제안했어요.

Skill-SP는 proposer, solver, skill controller 세 요소가 강화 학습 루프를 통해 공진화하며, proposer는 역동적으로 샘플링된 skill에 기반한 도전적인 task를 생성해요.

tool-use 및 추론 벤치마크 실험 결과, Skill-SP는 기존 모델 성능을 꾸준히 향상시키고, 초기에는 방향성이 맞지 않았던 모델도 획기적으로 개선했어요.

##LLM##자기진화##SkillSP##강화학습
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기