연구진이 텍스트 설명을 따르면서 특정 인물의 인물 정보(identity)를 유지하는 비디오 생성 기술을 개발했어요. 이 기술은 시간에 따라 달라지는 행동 순서를 정확하게 반영해야 하는 새로운 과제를 해결하기 위해 만들어졌어요. 핵심은 세 단계 파이프라인으로, 인물 정보 유지와 행동 순서 반영을 동시에 고려하는 방식이에요.
먼저 입력 텍스트를 이미지 생성 프롬프트로 변환하고, 이후 프레임을 생성할 때 인물 정보와 이전 프레임을 함께 고려해 시간 불변적인 외형과 시간 변동적인 자세를 분리해요. 마지막으로, 생성된 프레임을 다듬어 인물 정보 일관성을 강화해요.
이 기술은 IPVG26 챌린지에서 3위를 차지하며 뛰어난 성능을 입증했어요. 이 기술은 기존 방식의 한계를 극복하고, 다양한 상황에 적용될 수 있다는 장점이 있어요.