Pulse · AI 뉴스

Beyond Entropy: CPO를 활용한 정확도 기반 어드밴티지 쉐이핑

HuggingFace Papers · 2026-07-16

연구진은 기존 엔트로피 기반 RLVR의 한계를 지적하며, 토큰 단위의 정확도를 반영하는 CPO(Contrastive Policy Optimization)를 제안했어요.

CPO는 참조 가이드 및 일반 생성 분포 간의 토큰 단위 불일치를 활용하여 유용한 불확실성과 해로운 혼동을 구별하며, 이론적·실험적 검증을 거쳤어요.

인접 및 외부 도메인 벤치마크에서 CPO는 엔트로피 기반 RLVR 방법보다 성능이 우수했으며, 올바른 답변과 잘못된 답변이 탐험과 활용을 자연스럽게 지원하는 것으로 나타났어요.

##RLVR##CPO##ReinforcementLearni##정확도##언어모델
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기