연구진은 온라인 강화 학습의 샘플 효율성을 높이기 위해 전문가 행동 우선순위(EBP) 알고리즘을 제안했어요.
EBP는 Q-가이드형 조건부 변이 자동 인코더(Q-CVAE)를 활용해 온라인 리플레이 버퍼에서 직접 전문가 정책 우선순위를 생성하고, 기존의 정적 오프라인 데이터셋의 한계를 극복해요.
Gym, PyBullet, DMControl 벤치마크 실험 결과, EBP는 기존 온라인 강화 학습 알고리즘보다 높은 샘플 효율성과 안정적인 수렴을 달성했어요.