연구진이 WorldDiT라는 새로운 디퓨전 트랜스포머 아키텍처를 공개했어요. 이 아키텍처는 로봇 행동 생성과 시각적 세계 모델링을 결합합니다. WorldDiT는 기존의 대규모 사전 학습된 비전-언어 모델(VLM) 없이도 강력한 성능을 보여줘요. 네 가지 LIBERO 시뮬레이션 환경에서 WorldDiT는 모델 파라미터 수와 성공률 간 균형을 이루며, 향후 연구의 기준점이 될 것으로 기대됩니다.