연구진은 복잡한 교차로 통제 문제를 해결하기 위해 Master-Agent Proto-plan System (MAPS)이라는 계층적 딥 강화 학습(DRL) 아키텍처를 제안했어요.
MAPS는 중앙 Master 에이전트가 전역 조정 전략을 담은 proto-plan이라는 간결한 임베딩을 생성하고, Worker 에이전트가 이를 활용해 개별 차량 제어를 수행하는 방식이에요.
HighwayEnv 환경에서 MAPS는 기존 방식보다 평균 통행 시간을 단축하고, 3대 차량으로 학습한 시스템이 5대 차량 환경에서도 94%의 성공률을 보여주며 뛰어난 일반화 성능을 입증했어요.