Pulse · AI 뉴스

S3: 불확실성 제약을 통한 계층적 강화 학습의 안정적인 하위 목표 선택

arXiv cs.LG · 2026-07-22

이 논문은 계층적 강화 학습(HRL)에서 고위 레벨 에이전트가 환경 전환 예측 불확실성을 최소화하여 전략적으로 하위 목표를 선택하도록 유도하는 방법을 연구해요.

고위 레벨 에이전트가 여러 단계에 걸친 거친 전환을 사용하여 예측 불확실성을 모델링하고, 이를 통해 안정적인 정책 학습과 탐색 구조를 제공해요.

실험 결과, 역학 기반의 내재적 보상은 위험 회피적인 하위 목표 선택을 가능하게 하여 비정상적인 장기 환경에서 기존 HRL 방법보다 우수한 성능을 보여줬어요.

##강화학습##계층적강화학습##HRL##불확실성##dynamics
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기