Pulse · AI 뉴스

Fusion Embedding: 텍스트·이미지·동영상·오디오 통합 임베딩 공개

Fusion Embedding · 2026-07-21

Fusion Embedding팀이 텍스트, 이미지, 동영상, 오디오를 통합하는 새로운 임베딩 모델 패밀리를 공개했어요. 1640만 파라미터의 connector만 학습하는 1세대 모델은 오디오 검색 성능을 확보했어요. 텍스트, 이미지, 동영상은 기존 모델을 그대로 활용하여 학습 비용을 절감했어요.

기존 모델과 달리 오디오와 이미지 검색 성능이 향상되었으며, 이는 paired 오디오-비디오 데이터 없이도 가능했어요. 학습 과정에서 다양한 실험을 통해 최적의 설계를 찾았으며, 단일 GPU에서 몇 시간 안에 학습이 완료돼요.

##임베딩##오디오##멀티모달##FusionEmbedding
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기