제품 사진작가/리터처가 오픈 웨이트 비전-언어 모델을 활용해 광고용 캠페인 이미지를 생성하는 복잡한 파이프라인을 구축하는 과정에서 어려움을 겪고 있어요. 분석 단계별로 문제를 해결해도 새로운 문제가 계속 발생하며, 기술적으로는 정확해지지만 원하는 수준의 시각적 효과를 얻지 못하고 있어요. 여러 단계로 분석을 분할하는 방식이 오히려 성능을 저해하는지, 아니면 더 강력한 통합 모델을 사용하는 것이 더 나은 방법인지 고민 중이에요.