연구진은 비동기 강화 학습에서 발생하는 데이터 노후화 문제를 해결하기 위해 Staleness-Adaptive Trust Region (SAT)을 제안했어요. SAT는 노후화 정도에 따라 업데이트 범위를 조절하여 정책 불일치를 줄이고 안정성을 높여요.
SAT는 샘플링된 로그 비율을 노후화 지표로 활용하고, 각 배치 내에서 불일치 정도에 따라 커널 크기를 조정하여 보수적인 업데이트를 적용해요.
Qwen3-30B-A3B-Base 모델과 SGLang 엔진을 사용한 실험에서 SAT-GSPO는 AIME24 avg@8에서 35.83의 우수한 성능을 보여줬어요.
연구 결과, 노후화 정도에 맞춰 클리핑 간격을 조정하면 비동기 강화 학습을 효과적으로 안정화할 수 있음을 확인했어요.