DINOde는 DINOv3의 시각적 표현과 CLIP 텍스트 임베딩을 연속적으로 정렬하는 프레임워크입니다. Semantic Text Flow(STF)와 Global Context Flow(GCF)를 통해 텍스트 임베딩을 DINO 시각적 공간으로 이동시키고 이미지 표현을 개선합니다.
Velocity Tangent Projection을 도입하여 특징 공간의 기하학적 구조를 유지하며, 기존 방식의 manifold entanglement 문제를 해결합니다.
DINOde는 여러 OVSS 벤치마크에서 기존 방법보다 뛰어난 성능을 보이며, GitHub에서 코드를 확인할 수 있습니다.