연구진은 확산 언어 모델(DLM)이 문맥 내 학습을 위해 어떻게 유도라는 기제를 사용하는지 분석했어요. DLM은 이전 토큰과 다음 토큰 헤드가 잔차 흐름에 지역 문맥을 쓰고, 이후 유도 헤드가 이를 활용하여 일치하는 위치에서 답을 찾고 복사하는 양방향 유도 회로를 학습하는 것을 발견했어요.
DLM이 왼쪽 문맥만 볼 때 AR 모델보다 성능이 뛰지 않지만, 마스크된 토큰 양쪽을 볼 수 있을 때는 더 강력한 유도를 보이며 양방향 문맥 접근성이 중요함을 시사해요.
연구진은 DLM이 명시적인 타임스텝 임베딩 없이도 마스크된 토큰의 비율을 전역적으로 계산하고 이를 암시적 타임스텝으로 사용한다는 사실을 밝혀냈어요.