연구진은 LLM 평가기 피드백을 활용한 정책 최적화 과정에서 발생하는 평가 점수 간 간극 축소 문제를 지적했어요.
평가 점수 간 간극이 줄어들면 정책 최적화 신호가 약해지거나 오해를 불러일으킬 수 있다는 이론적 근거를 제시했어요.
연구진은 동적 루브릭(DynamicRubric)이라는 평가기-정책 공동 진화 프레임워크를 제안하여, 후보 집합에 따라 가중치를 부여한 이분법적 루브릭 항목을 생성하고 이를 응답 수준 점수로 통합했어요.
DynamicRubric은 기존 방식 대비 평가기 성능을 향상시키고, 추론 및 코딩 작업에서 정책 최적화 효과를 보여줬으며, 실제로 WeChat Search의 AI 답변 시나리오에 적용되어 온라인 지표 개선에 기여했어요.