연구진은 기존 엔트로피 기반 RLVR의 한계를 지적하며, 토큰 단위의 정확도를 반영하는 CPO(Contrastive Policy Optimization)를 제안했어요.
CPO는 참조 가이드 및 일반 생성 분포 간의 토큰 단위 불일치를 활용하여 유용한 불확실성과 해로운 혼동을 구별하며, 이론적·실험적 검증을 거쳤어요.
인접 및 외부 도메인 벤치마크에서 CPO는 엔트로피 기반 RLVR 방법보다 성능이 우수했으며, 올바른 답변과 잘못된 답변이 탐험과 활용을 자연스럽게 지원하는 것으로 나타났어요.