연구진이 Muon 최적화기가 에이전트 강화 학습에 미치는 영향을 조사했어요. ALFWorld 환경에서 Qwen2.5-0.5B-Instruct 모델을 활용해 AdamW와 비교했죠.
GiGPO 환경에서 Muon을 적용하면 최종 검증 성공률이 88% 향상되는 효과가 있었으며, 학습률에 따라 성능 변화가 관찰됐어요.
Muon은 에이전트 강화 학습에 도움이 될 수 있으며, 정책 최적화기, 장점 추정기, 학습률 간의 상호작용 연구가 필요하다는 점을 시사합니다.