FLUX 3 모델이 이미지·비디오·오디오를 통합 학습하는 멀티모달 기반으로 공개됐어요. 이 모델은 이미지 공간 구조, 비디오 시간 역학, 오디오 사건 관계를 상호 제약으로 학습해요. FLUX 3 Video부터 Early Access로 제공돼 사용 가능해요.