네이버 AI가 On-Policy Delta Distillation (OPD^2)이라는 새로운 증류 방식을 발표했어요. 기존 방식 대신 교사 모델과 기반 모델의 차이인 '델타 신호'를 활용해 추론 능력을 전달합니다. 수학, 과학, 코딩 추론 벤치마크에서 기존 방식보다 성능이 뛰어나 짧은 기간 내에 강력한 성능을 달성했어요.
델타 신호는 교사 모델의 추론 능력 변화를 직접적으로 반영하여, 기존 방식의 한계를 극복합니다. OPD^2는 교사 모델의 출력을 직접 모방하는 대신, 델타 신호를 활용하여 추론 능력을 증류합니다.