연구진은 영상 생성 모델을 활용해 현실 세계의 역학을 시뮬레이션, 예측, 추론하는 '영상 속 사고'라는 새로운 패러다임을 제시했어요.
영상 생성기가 실제 인과 관계를 이해하는지 평가하기 위해 Causal-Generative Dual-Judge (CGDJ)를 도입해, 명시적 인과 인식과 예측-예측 간 격차를 측정했어요.
CGDJ 분석 결과, 오픈소스 모델은 낮은 인과 인식에도 불구하고 설득력 있는 역학을 생성하는 반면, 상용 모델은 제한적인 수준의 정합성을 보였고, 오디오-비디오 불일치 현상도 확인됐어요.