연구진은 오디오그래픽 비디오 확산 모델의 시간 오류 누적 문제를 해결하기 위해 TANGO(Terminal points Avoidance through Noise Guided Optimization) 기법을 제안했어요.
TANGO는 예측 노이즈 분포를 활용해 모델이 갇히는 종단점을 피하고, 더 자연스러운 비디오 트랙터리를 생성하는 방식이에요.
TANGO는 VBench에서 3.1% 성능 향상, Fréchet Video Distance는 평균 28.3% 감소를 달성했으며, 관련 코드는 GitHub에서 확인할 수 있어요.