Pulse · AI 뉴스

FlowCTS: 플로우 모델의 연속적인 경로 감독

FlowCTS · 2026-07-28

연구진은 플로우 모델에 대한 온-정책 증류(OPD) 방법인 FlowCTS를 제안했어요. FlowCTS는 학생 모델의 상태에서 시작된 학생 및 참조 경로를 일치시켜 플로우 모델의 성능을 향상시킵니다.

FlowCTS-OPD는 GenEval, OCR, PickScore 지표에서 기존 KL 기반 OPD보다 성능이 뛰어나며, 혼합 보상 강화 학습(RL) 기반 방법보다 우수한 결과를 보여줬어요.

연구 결과, 기존 KL 기반 OPD는 시간적 감독 불일치를 겪는다는 것을 밝혀냈으며, FlowCTS는 온-정책 설정에서 SFT보다 우수한 성능을 보였고, 감독 단계를 늘리면 더 풍부한 경로 정보를 얻을 수 있지만 최적화 난이도가 높아지는 것을 확인했어요.

##플로우모델##온정책증류##FlowCTS##SFT##강화학습
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기