연구진은 기존 추론 속도 가속 방식인 스펙큐레이티브 디코딩의 한계점을 분석했어요. 특히, 디퓨전 드래프터를 활용한 DFlash 방식에서 발생하는 변동성 문제를 지적했어요. 이를 해결하기 위해 AdaFlash 프레임워크를 제안했는데, 이는 온-정책 증류(OPD)와 적응형 길이 헤드를 포함해요.
AdaFlash의 온-정책 증류는 도메인별 변동성을 줄이고, 적응형 길이 헤드는 타겟 모델의 검증 비용을 낮춰 토큰별 변동성을 해결해요. 결과적으로 AdaFlash는 기존 방식보다 최대 66% 높은 처리량을 달성했어요.
AdaFlash는 고병렬 환경에서 특히 효과적이며, 추론 속도 향상에 기여해요. 연구는 스펙큐레이티브 디코딩의 효율성을 높이는 새로운 방향을 제시해요.
연구진은 AdaFlash 프레임워크를 통해 스펙큐레이티브 디코딩의 성능을 개선하고, 대규모 언어 모델 추론의 효율성을 높이는 데 기여했어요.