강화 학습에서 기존 방식은 상태 가치를 절대적으로 평가했지만, 실제 제어에는 가치 차이가 중요합니다. 연구진은 상태 가치 차이를 직접 학습하는 '상대 가치 학습(RV)' 프레임워크를 제안했습니다. RV는 쌍별 벨만 연산자를 활용하여 실제 가치 차이로 수렴하며, PPO와 결합하여 Atari 게임 벤치마크에서 경쟁력 있는 성능을 보였습니다.
상대 가치 학습은 절대 가치 평가 방식의 대안으로, 기존 방식보다 효율적인 제어가 가능합니다. 연구진은 RV를 PPO에 통합하여 49개의 Atari 게임에서 표준 PPO와 유사한 성능을 달성했습니다.
연구진은 쌍별 벨만 연산자를 통해 가치 차이를 학습하고, 일반화된 장점 추정 방법을 재구성하여 편향되지 않은 정책 경사 추정기를 개발했습니다. 이 방법은 1단계, n단계, λ-리턴 타겟을 도출하는 데 사용되었습니다.