연구진이 소형 모델의 추론 성능을 향상시키는 MADA-RL 프레임워크를 공개했어요. 이 프레임워크는 LoRA 어댑터를 통해 일부 파라미터만 조정하여 생성자와 비평가 역할을 하는 다중 에이전트를 활용해요.
MADA-RL은 '반사실적 비평가 우위'라는 새로운 학습 신호를 도입하여, 비평가가 생성자 집단의 정확도를 기준으로 학습하도록 유도하여 더욱 정확한 피드백을 제공해요.
DeepSeek-R1-Distill-Qwen-1.5B 모델의 정확도를 39.9%에서 41.9%로 향상시켰으며, 기존의 전체 파인튜닝 방식보다 16배 적은 파라미터로 학습했어요.
연구 결과, MADA-RL의 비평가 모델은 생성자 오류를 수정하는 방향으로 학습하며, 이는 기존 방식보다 높은 개선율을 보였어요.