연구진은 비동기 강화 학습에서 발생하는 데이터 스텔링 문제를 해결하기 위해 엔트로피 스케일링 기법을 제안했어요. 기존 방법은 중요도 비율의 크기만으로 토큰을 유지하거나 버리는데, 토큰 엔트로피에 따른 자연스러운 스케일 차이를 고려하지 않았어요. Entropy-Scaled Trust Region (ESTR)은 각 토큰의 오프라인 편차를 로컬 엔트로피로 스케일링하여, 기존 방법보다 성능을 향상시키고 학습 속도를 2.6배 개선했어요.