Pulse · AI 뉴스

동적 루브릭: LLM 평가기 및 정책의 공동 진화

DynamicRubric · 2026-07-22

연구진은 LLM 평가기 피드백을 활용한 정책 최적화 과정에서 발생하는 평가 점수 간 간극 축소 문제를 지적했어요.

평가 점수 간 간극이 줄어들면 정책 최적화 신호가 약해지거나 오해를 불러일으킬 수 있다는 이론적 근거를 제시했어요.

연구진은 동적 루브릭(DynamicRubric)이라는 평가기-정책 공동 진화 프레임워크를 제안하여, 후보 집합에 따라 가중치를 부여한 이분법적 루브릭 항목을 생성하고 이를 응답 수준 점수로 통합했어요.

DynamicRubric은 기존 방식 대비 평가기 성능을 향상시키고, 추론 및 코딩 작업에서 정책 최적화 효과를 보여줬으며, 실제로 WeChat Search의 AI 답변 시나리오에 적용되어 온라인 지표 개선에 기여했어요.

##LLM##평가기##정책최적화##DynamicRubric
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기