연구진은 비검증 가능 작업의 신뢰성 있는 평가가 여전히 어려운 문제임을 지적하며 CSPF(Constrained Shared-Private Fusion)라는 새로운 융합 방법을 제안했어요.
CSPF는 다양한 평가 기준을 가진 인간의 선호도를 파악하기 위해 서로 다른 frozen reward 모델을 상호 보완적인 평가자로 활용하고, pairwise 인간 선호도 감독 하에 hidden-state 표현을 통합해요.
LM-Arena 타겟 도메인 적응 및 PPE out-of-distribution 선호도 평가 실험에서 CSPF는 기존 방법보다 우수한 성능을 보여주며, hidden-state 표현 융합이 선호도 평가에 더 효과적임을 시사해요.