연구진이 긴 영상 이해를 위한 오픈 소스 오디오·비디오 LLM인 Audio-Visual Flamingo(AV-Flamingo)를 공개했어요.
AV-Flamingo는 기존 모델과 달리 700만 개의 캡션과 질문-답변 데이터로 구성된 Audio-Visual-Skills 데이터셋을 활용해 시간, 구성, 모달 간 추론 능력을 강화했어요.
AV-Flamingo는 15개 이상의 벤치마크에서 기존 오픈 모델을 능가하는 성능을 보여줬으며, 실제 사용 시에도 뛰어난 활용성과 일반화 능력을 입증했어요.