연구진이 1단계 텍스트-이미지(T2I) 모델을 활용해 고품질 비디오 편집을 가능하게 하는 OSVE 프레임워크를 공개했어요. 기존 방식의 느린 반복적인 인버전 문제를 해결하기 위해 학습 가능한 인코더를 훈련해 각 프레임의 초기 노이즈를 단일 패스에서 예측합니다.
구조 인식 편집(SAE) 손실 함수를 활용해 원본 비디오의 구조를 보존하면서 편집을 수행하고, 통일된 프레임 편집(UFE) 기법으로 프레임 간 일관성을 확보했어요.
OSVE는 기존 다단계 방식보다 약 155~171배 빠른 속도로 편집 품질이 우수하며, 코드 GitHub에서 확인할 수 있습니다.