연구진은 텍스트와 이미지 정보를 통합하는 비전-언어 모델(VLM)을 활용해 다양한 모달리티의 속성 그래프를 학습하는 OMG-VLM 프레임워크를 공개했어요.
OMG-VLM은 사전 학습된 VLM을 기반으로 구조 정보를 반영하는 어댑터를 도입하여 텍스트/이미지 속성 그래프 학습을 하나의 모델로 가능하게 해요.
다양한 실험 결과, OMG-VLM은 기존 그래프 신경망(GNN) 및 LLM 기반 모델보다 뛰어난 성능을 보이며, 새로운 그래프와 모달리티에도 강한 일반화 능력을 입증했어요.