연구진이 적은 단계로 고품질 텍스트를 생성하는 데 어려움을 겪는 Multi-Mask Diffusion 모델(MDM)의 한계를 분석했어요. MultiMDM은 마스크 구조를 유지하여 역방향 과정에서 마스크를 예측하고 텍스트를 개선하는 방식을 도입했어요. 이를 통해 기존 모델보다 효율적인 학습과 고품질 텍스트 생성이 가능해졌어요.
MultiMDM은 각 텍스트 토큰을 특정 마스크로 밀어 넣고 점진적으로 마스크 세트를 혼합하는 방식으로 작동하며, 이를 통해 역방향 과정에서 마스크를 예측하고 텍스트를 개선하는 기능을 제공해요. 연구진은 이를 위해 폐쇄형 ELBO 학습 목표를 도출하고, 경로 의존성을 줄이기 위한 새로운 정제 방식을 개발했어요.
사전 훈련 및 정제 실험 결과, MultiMDM은 원활한 few-step 생성의 효과적인 기반을 제공하는 것으로 나타났어요. 이 모델은 기존 MDM에서 발생하는 문제점을 해결하고, 더 효율적이고 고품질의 텍스트 생성 모델을 구축하는 데 기여할 것으로 기대돼요.