Pulse · AI 뉴스

표정 인식 CSS 프레임워크 FacialTalker 공개: 대화형 음성 합성의 공감 능력 향상

FacialTalker · 2026-07-27

Anthropic이 대화형 음성 합성(CSS) 프레임워크 FacialTalker를 공개했어요. FacialTalker는 표정을 인식하여 더욱 자연스럽고 풍부한 표현을 생성하는 데 초점을 맞췄어요.

AUTokenizer를 통해 프레임별 표정을 압축된 토큰으로 변환하고, DualDPO 전략으로 시각 및 음성 토큰 시퀀스에 대한 선호도 제약을 동시에 적용하여 모델의 이해도를 높였어요.

VSDD-1K라는 대규모 멀티모달 대화 데이터셋을 구축하여 1,033시간 분량의 동기화된 화자 영상과 음성을 확보하고, 객관적·주관적 실험 결과 기존 모델 대비 자연스러움과 표현력에서 우수한 성능을 보였어요.

##CSS##표정인식##음성합성##FacialTalker##VSDD-1K
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기