연구진이 3D 공간 이해 능력을 강화한 VLM-IE3D 프레임워크를 공개했어요. RGB 비디오에서 학습한 암시적 및 명시적 3D 기하학 정보를 활용해 3D 공간 추론 성능을 높였어요. 3D 비디오 감지, 시각적 기반 위치 찾기, 3D 캡셔닝 등 다양한 3D 작업에서 우수한 성능을 보여줬어요.
VLM-IE3D는 Implicit Geometry Tokens (IGTs)와 Explicit Geometry Tokens (EGTs)를 도입해 3D 공간 정보를 학습하고, 2D 시각 정보와 결합하는 3D-aware 어댑터를 사용해요. 별도의 3D 입력 없이도 3D 공간에 대한 이해도를 높일 수 있어요.
GitHub에서 코드와 모델을 공개했으며, 관련 연구는 RGB-only 방식으로 진행돼 3D 공간 추론에 필요한 정보들을 효과적으로 활용해요.