Pulse · AI 뉴스

자기 증류를 활용한 루브릭 기반 강화 학습 성능 향상

Criterion-Distilled Policy Optimization · 2026-07-21

연구진은 루브릭 기반 강화 학습의 제한점인 제한적인 탐색(Unexplored Criteria, UC)과 억제된 기준(Suppressed Criteria, SC) 문제를 해결하기 위해 자기 증류를 활용한 Criterion-Distilled Policy Optimization (CriPO) 방법을 제안했어요.

CriPO는 UC 문제를 해결하기 위해 기준 주입 자기 지도자를 활용하고, SC 문제를 해결하기 위해 부적절한 기준 관련 토큰의 이점을 긍정적으로 전환하는 역방향 자기 지도자를 사용해요.

실험 결과, CriPO는 기존 루브릭 기반 강화 학습보다 우수한 성능을 보였으며, 약 2배 적은 최적화 단계로 더 강력한 최종 성능을 달성했어요.

##강화학습##자기증류##루브릭##CriPO
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기