연구진이 Qwen3-1.7B/4B/8B 모델을 ALFWorld 환경에서 테스트한 결과, 밀집 예측 보상은 오히려 정책을 파괴하는 '어두운 방' 병리 현상을 유발했어요.
GRPO의 std 정규화 제거 시, 밀집 예측 보상은 파국적인 결과(0%)에서 기준 수준의 성능으로 회복돼 원인이 GRPO의 std 정규화에 있음을 확인했어요.
연구진은 z-점수가 그룹 내 분산을 증폭시키고, 실패 그룹이 지배할 때 밀집 신호의 분산이 감소하는 신호가 안전하다는 기준을 제시했어요.
제어된 신호 전달 행렬 실험 결과, 보조 손실 채널이 ~20 포인트 성능 향상을 보였고, 섞인 데이터(placebo)도 실제 데이터와 유사한 성능을 보여 정확한 레이블 없이도 효과가 있음을 시사했어요.
연구 결과는 기존 연구의 성공 사례와 일관되며, 더 많은 실험을 통해 재현 가능성과 그룹 크기 제어를 진행할 예정이에요.