연구진은 비동기 강화 학습에서 발생하는 데이터 노후화 문제를 해결하기 위해 Staleness-Adaptive Trust Region (SAT) 기술을 개발했어요. SAT는 샘플링된 로그 비율을 활용해 노후화 정도를 파악하고, 업데이트 범위를 조정하여 정책 불일치를 완화합니다. Qwen3-30B-A3B-Base 모델과 SGLang 엔진을 활용한 실험에서 SAT-GSPO는 AIME24 평균 8위를 달성하며 기존 방식보다 우수한 성능을 보였어요.
SAT 기술은 PPO 클리핑 간격을 노후화 정도에 맞춰 조정하여, 일반적인 토큰은 기존 성능을 유지하면서도, 새로운 토큰에 대한 업데이트를 더욱 보수적으로 제어합니다. 이는 노후화된 데이터가 중요한 비동기 학습 환경에서 특히 효과적이에요.
연구 결과, SAT는 지역 간격 포함 및 PPO에 대한 점진적인 비관성을 증명하며, 이질적인 노후화 환경에서 업데이트 형상을 어떻게 재구성하는지 보여줍니다. 또한, 적응형 클리핑과 라우팅 리플레이는 불일치 꼬리 및 라우팅 불일치를 대상으로 하는 상호 보완적인 안정화 역할을 수행해요.
SAT 기술은 비동기 강화 학습의 안정성을 높이는 데 기여하며, 향후 더욱 효율적인 학습 환경을 구축하는 데 활용될 수 있을 것으로 기대됩니다.