Anthropic이 대화형 음성 합성(CSS) 프레임워크 FacialTalker를 공개했어요. FacialTalker는 표정을 인식하여 더욱 자연스럽고 풍부한 표현을 생성하는 데 초점을 맞췄어요.
AUTokenizer를 통해 프레임별 표정을 압축된 토큰으로 변환하고, DualDPO 전략으로 시각 및 음성 토큰 시퀀스에 대한 선호도 제약을 동시에 적용하여 모델의 이해도를 높였어요.
VSDD-1K라는 대규모 멀티모달 대화 데이터셋을 구축하여 1,033시간 분량의 동기화된 화자 영상과 음성을 확보하고, 객관적·주관적 실험 결과 기존 모델 대비 자연스러움과 표현력에서 우수한 성능을 보였어요.