FLUX가 이미지·영상·음성을 통합 학습하는 새로운 멀티모달 모델 FLUX 3을 공개했어요. 모델은 다양한 센서에서 얻은 정보를 결합하여 현실 세계를 이해하는 것을 목표로 합니다.
FLUX 3은 Self-Flow 기술을 기반으로 개발되었으며, 텍스트 프롬프트 또는 이미지/영상 참조를 통해 이미지와 영상+음성을 함께 생성할 수 있어요. 초기 결과는 콘텐츠 제작과 물리적 AI 분야에서 긍정적입니다.
FLUX 3은 현재 Early Access 단계이며, Grok Imagine Video, Kling v3 Pro 등 기존 모델보다 성능이 우수하며, 특히 인간 표정 묘사, 음향과 물리적 이벤트 연관, 다국어 기능에서 강점을 보입니다.