Pulse · AI 뉴스

MTVDiff: 열-가시 얼굴 변환 성능 향상을 위한 다중 모드 잠재 확산 모델

MTVDiff · 2026-07-22

MTVDiff는 열-가시 얼굴 변환 시 발생하는 기하학적 불연속성, 의미적 속성 불일치, 신원 저하 문제를 해결하기 위해 깊이와 텍스트 정보를 통합하는 새로운 다중 모드 잠재 확산 프레임워크입니다.

DBCAF 모듈, Gated Text-to-Visual Feature Alignment 메커니즘, Spatial Feature Transformations (SFT) 등 세 가지 핵심 기술 기여를 통해 기존 GAN 기반 및 확산 기반 방식보다 성능이 우수합니다.

MCXFace 및 SpeakingFaces 데이터셋 실험 결과, FID가 최대 48.3% 감소하고 얼굴 검증 정확도가 최대 8.9% 향상되는 등 이미지 품질과 얼굴 검증 성능 모두에서 괄목할 만한 개선을 달성했습니다.

##얼굴변환##다중모드##잠재확산##MTVDiff##얼굴인식
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기