ai-sage가 GigaChat 3.1 Lightning 모델 기반의 음성 특화 LLM GigaChat Audio 10B를 공개했어요. 음성 이해 능력을 강화해 질문 답변, 분류, 시간 정보 기반 요약 등 다양한 작업 가능.
TimeGround-1M 데이터셋을 활용해 시간 정보 기반 음성 이해 능력을 훈련했어요. 긴 음성에서 특정 시점 파악, 시간 정보가 포함된 요약 생성 등이 가능.
GigaChat Audio 10B는 Conformer 음성 인코더와 MoE 디코더를 사용해 텍스트 품질 유지하면서 음성 이해 능력도 갖췄어요. 관련 논문, 데이터셋, 데모는 Hugging Face에서 확인할 수 있어요.