연구진은 LLM의 평가 기준을 스칼라 보상으로 압축하는 기존 강화 학습의 한계를 지적하며, LLM-as-a-Judge의 피드백 모델을 활용한 LLM-as-a-Coach를 제안했어요.
LLM-as-a-Coach는 정책 응답에 대한 평가를 경험 기반 지식으로 변환하여 교사 모델을 조건부로 설정하고, 정책은 온-정책 컨텍스트 증류를 통해 이 지식을 내면화해요.
두 가지 정책 패밀리에서 자체 피드백 또는 독점 모델 피드백을 사용했을 때, 경험 기반 학습은 기존의 루브릭 기반 강화 학습보다 더 뛰어난 성능을 보였고, 일반화 능력 향상 및 보상 해킹 완화 효과도 확인됐어요.