Pulse · AI 뉴스

불확실성 추정 기반 보수적 쿼리와 적응적 정규화를 이용한 오프라인 강화 학습

D4RL · 2026-07-22

연구진은 오프라인 강화 학습의 데이터 커버리지 문제를 해결하기 위해 전문가 피드백을 활용하는 액션 선호도 쿼리 방법을 제안했어요.

새로운 프레임워크는 정책 행동의 불확실성을 추정하는 Morse 네트워크를 활용하여 데이터셋 주변의 보수적인 액션을 선택하고, 정책 업데이트의 안정성을 유지해요.

D4RL 벤치마크에서 실험 결과, 기존 방법 대비 우수한 성능을 보였으며, 불확실성을 고려한 적응적 정규화 방식으로 데이터 수준 제약을 동적으로 조정해요.

##강화학습##오프라인RL##불확실성##D4RL
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기