연구진은 지도 학습(SFT)과 강화 학습(RL) 방식의 LLM 모델 병합 성능을 비교 분석했어요. 분석 결과, RL 방식으로 학습한 LLM은 작업 충돌을 줄이고 병합 후 성능 저하를 최소화하는 것으로 나타났어요. RL 방식이 모델 병합에 적합한 이유는 정책 학습 데이터의 작은 경사도, ‘충분함이 최고’라는 최적화 목표, 양/음 예시의 공동 최적화 때문이에요.