SLAI T-Rex는 DeepSeek-V4 모델 패밀리를 Ascend NPU SuperPOD에서 후훈련하는 시스템입니다.
모델 병렬 처리, 연산-통신 조율, 저수준 커널 실행을 최적화하여 34.22%의 모델 FLOPs 활용률(MFU)을 달성했습니다.
후훈련된 DeepSeek-V4-Flash 모델은 GPT-5.4-Mini와 DeepSeek-V4-Flash 기본 모델을 각각 3.98%p, 11.27%p 앞선 71.81%의 Pass@1 점수를 기록했습니다.
이 연구는 Ascend 인프라에서 효율적인 조율 후훈련부터 복잡한 추론을 위한 도메인 특화 Flash 모델 구축까지의 전체 경로를 보여줍니다.