연구진이 이미지와 비디오 편집을 통합하는 새로운 모델 FlowMimic을 개발했어요. 기존 비디오 편집 데이터 수집 방식의 한계를 극복하기 위해 픽셀 쌍을 활용한 시간 왜곡 흐름장을 통해 실시간으로 비디오 편집 샘플을 생성해요. 이미지 모드를 비디오 모드의 특수한 형태로 보고, 두 모드 간의 능력과 출력 분포를 맞추기 위한 모달 미믹 손실 함수를 설계했어요.