연구진이 가사, 텍스트 설명, 음악적 특징을 기반으로 고품질 풀 길이 음악을 생성하는 통합 프레임워크를 개발했어요. 이 프레임워크는 가사-음악 생성, 악기 연주 음악 생성, 커버곡 생성 3가지 작업을 지원해요. 핵심은 8-코드북 RVQ 토큰을 활용한 시맨틱 인식 토크나이저, 하이브리드 언어 모델, FullDiT, 2단계 멜로디 모듈을 결합한 구조예요.
FullDiT는 코덱 토큰, 가사, 텍스트 설명을 조건으로 연속 VAE 잠재 공간에서 풀 길이 플로우 매칭을 수행해 오디오 품질을 개선하고, 커버곡 생성 시 멜로디 모듈은 원곡 멜로디를 보존하면서 새로운 스타일을 적용해요. DPO, GRPO, OPD 등 보상 기반 후처리 전략을 적용해 하이브리드 언어 모델과 FullDiT의 성능을 향상시켰어요.
자동 멀티 언어 벤치마크 실험 결과, 개발된 프레임워크가 평가 환경에서 경쟁력 있는 성능을 달성했으며, Artificial Analysis Music with Vocals 리더보드에서도 좋은 결과를 보였어요.