Amazon이 지도 학습 미세 조정 시 추론 토큰 생성 문제를 해결하기 위해 Self-Distilled Reasoning(SDR)이라는 새로운 방법을 제시했어요. SDR은 기존 데이터에 추론 과정을 명시적으로 추가하지 않고도 효과적인 학습을 가능하게 해요. 세 가지 벤치마크 테스트 결과, SDR은 기존 방식보다 성능이 우수했으며, 실제 적용을 위한 실용적인 가이드라인을 제공해요. 이 방법은 추론 과정이 부족한 데이터셋에 특히 유용해요.