Pulse · AI 뉴스

Staleness-Adaptive Trust Region: 비동기 강화 학습 안정화

Qwen · 2026-07-21

연구진은 비동기 강화 학습에서 발생하는 데이터 노후화 문제를 해결하기 위해 Staleness-Adaptive Trust Region (SAT)을 제안했어요. SAT는 노후화 정도에 따라 업데이트 범위를 조절하여 정책 불일치를 줄이고 안정성을 높여요.

SAT는 샘플링된 로그 비율을 노후화 지표로 활용하고, 각 배치 내에서 불일치 정도에 따라 커널 크기를 조정하여 보수적인 업데이트를 적용해요.

Qwen3-30B-A3B-Base 모델과 SGLang 엔진을 사용한 실험에서 SAT-GSPO는 AIME24 avg@8에서 35.83의 우수한 성능을 보여줬어요.

연구 결과, 노후화 정도에 맞춰 클리핑 간격을 조정하면 비동기 강화 학습을 효과적으로 안정화할 수 있음을 확인했어요.

##강화학습##비동기##안정화##SAT
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기