Reddit 사용자가 직접 이미지 모델을 학습시키며 겪는 과정 3탄을 공유했어요. 512x512 해상도를 선택한 이유는 GPU 메모리 제약 때문이었어요. 더 높은 해상도(768x768, 1024x1024)에서는 배경이 노이즈로 변하거나 모델이 현실과 동떨어진 이미지를 생성하는 문제가 발생했어요.
기존 VAE(Variational Autoencoder)의 한계로 인해 고해상도 이미지의 품질이 저하되었고, 이를 해결하기 위해 VAE 인코더를 고정하고 디코더만 재학습하는 방법을 시도했어요. 이 방법은 기존 생성 모델의 학습 진행 상황을 유지하면서 이미지 품질을 개선하는 것을 목표로 해요.
다음 Part 4에서는 이 방법이 실제로 효과가 있었는지, 새로운 문제가 발생했는지에 대한 내용을 다룰 예정이에요. 추가 내용 공개 여부는 사용자 반응에 따라 결정될 예정입니다.