Pulse · AI 뉴스

온라인 강화 학습, 전문가 행동 우선순위 활용으로 효율성 높인다

Expert Behavior Prior (EBP) · 2026-07-23

연구진은 온라인 강화 학습의 샘플 효율성을 높이기 위해 전문가 행동 우선순위(EBP) 알고리즘을 제안했어요.

EBP는 Q-가이드형 조건부 변이 자동 인코더(Q-CVAE)를 활용해 온라인 리플레이 버퍼에서 직접 전문가 정책 우선순위를 생성하고, 기존의 정적 오프라인 데이터셋의 한계를 극복해요.

Gym, PyBullet, DMControl 벤치마크 실험 결과, EBP는 기존 온라인 강화 학습 알고리즘보다 높은 샘플 효율성과 안정적인 수렴을 달성했어요.

##강화학습##온라인RL##정책최적화##EBP
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기