이 논문은 계층적 강화 학습(HRL)에서 고위 레벨 에이전트가 환경 전환 예측 불확실성을 최소화하여 전략적으로 하위 목표를 선택하도록 유도하는 방법을 연구해요.
고위 레벨 에이전트가 여러 단계에 걸친 거친 전환을 사용하여 예측 불확실성을 모델링하고, 이를 통해 안정적인 정책 학습과 탐색 구조를 제공해요.
실험 결과, 역학 기반의 내재적 보상은 위험 회피적인 하위 목표 선택을 가능하게 하여 비정상적인 장기 환경에서 기존 HRL 방법보다 우수한 성능을 보여줬어요.