Pulse · AI 뉴스

저자원 방언 음성 강제 정렬: 청두 만다린 모델 훈련 및 평가

arXiv cs.CL · 2026-07-23

연구진이 청두 만다린 음성 강제 정렬 모델을 개발했어요. 17시간 분량의 데이터셋과 맞춤형 G2P 사전을 활용해 음성 강제 정렬 시스템을 만들었어요. 전문가가 직접 표기한 테스트 결과, 기존 표준 중국어 모델보다 성능이 훨씬 뛰어났어요.

텍스트 의존형 GMM-HMM 모델(Chengdu-MFA)과 사전 훈련된 오디오 인코더를 활용해 음성 강제 정렬 모델(Chengdu-FC)을 만들었어요. Chengdu-MFA는 평균 음성 경계 차이를 31.8% 줄였고, Chengdu-FC는 61.2% 줄였어요.

##음성정렬##저자원##청두만다린##인공지능
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기