연구진은 autoregressive decoding의 한계를 극복하기 위해 T^2MLR이라는 새로운 Transformer 기반 잠재적 추론 아키텍처를 제안했어요. T^2MLR은 이전 토큰의 cached middle layer representation을 현재 토큰 위치의 이전 레이어에 직접 통합하여 추론 상태를 유지합니다. 자연어 사전 훈련 및 다중 홉 추론 미세 조정에서 기존 Transformer보다 성능이 뛰어났어요.
전체 레이어가 아닌 국소적인 middle-layer block에만 순환을 적용하는 것이 더 효과적이라는 점이 확인됐어요. 기존 사전 훈련된 1.7B Transformer에 순환 경로를 retrofitting하고 짧게 미세 조정하는 것만으로도 수학 추론 능력이 크게 향상됐어요.
T^2MLR은 모든 레이어를 반복할 필요 없이, targeted middle-layer recurrence를 통해 효과적인 잠재적 추론이 나타날 수 있음을 보여줍니다.