연구진은 기초 모델 시대에 멀티 브랜치 아키텍처와 CNN-Transformer 융합의 효과를 재검토했습니다.
DINOv3로 사전 훈련된 단일 ConvNeXt 모델이 시각적 단서만으로 VeRi-Wild 데이터셋에서 강력한 성능을 달성했습니다.
연구 결과, 아키텍처 복잡성을 높이는 것보다 단일 강력한 기초 모델 백본을 개선하고 검색 단계 재정렬을 수행하는 것이 더 효과적입니다.
교차 백본 융합을 시도했지만, Vision Transformer 브랜치는 ConvNeXt 백본보다 성능이 낮았으며 융합으로 얻는 이점은 미미했습니다.