연구진은 LLM의 평가 기준을 스칼라 보상으로 압축하는 기존 강화 학습의 한계를 지적했어요. 이를 해결하기 위해 LLM-as-a-Judge의 피드백 모델을 LLM-as-a-Coach로 재활용하는 경험적 학습(EL) 방법을 제안했어요. EL은 정책 모델의 응답을 조건부로 설정하고, 교사 모델을 훈련시켜 정책 모델이 경험적 지식을 내면화하도록 돕는 방식이에요.
두 가지 정책 패밀리에 EL을 적용한 결과, 기존의 척도 기반 강화 학습보다 더 뛰어난 성능을 보였으며, 훈련 데이터 분포를 벗어난 일반화 능력도 향상됐어요. 또한, 보상 해킹 문제를 완화하는 효과도 확인됐어요.
연구 결과는 비검증 작업에 대한 사후 훈련에서 경험적 지식이 더 풍부하고 일반화 가능한 학습 신호임을 입증했어요.