MTVDiff는 열-가시 얼굴 변환 시 발생하는 기하학적 불연속성, 의미적 속성 불일치, 신원 저하 문제를 해결하기 위해 깊이와 텍스트 정보를 통합하는 새로운 다중 모드 잠재 확산 프레임워크입니다.
DBCAF 모듈, Gated Text-to-Visual Feature Alignment 메커니즘, Spatial Feature Transformations (SFT) 등 세 가지 핵심 기술 기여를 통해 기존 GAN 기반 및 확산 기반 방식보다 성능이 우수합니다.
MCXFace 및 SpeakingFaces 데이터셋 실험 결과, FID가 최대 48.3% 감소하고 얼굴 검증 정확도가 최대 8.9% 향상되는 등 이미지 품질과 얼굴 검증 성능 모두에서 괄목할 만한 개선을 달성했습니다.