AI 연구자들은 최첨단 모델을 동일하게 연결된 트랜스포머로 묘사하며, 텍스트, 픽셀 또는 음성에 사용됩니다.
신경과학자들은 피질을 다양한 작업에 대한 다양한 구조로 구성된 모자이크로 묘사합니다. 예를 들어 시각 피질의 밀집된 4층은 공간 인코딩, 운동 피질의 두꺼운 5/6층은 시간 통합을 담당합니다.
본 논문은 이러한 간극이 스타일적 오류가 아닌 구조적 오류이며 측정 가능하다는 점을 주장하며, 트랜스포머는 최소한의 노력으로 구현될 수 있는 경로일 뿐이며, 종종 다양성을 나타내는 Mixture-of-Experts는 동일한 전문가들 사이에서 매개변수를 분할합니다.
연구진은 AI 아키텍트에게 구조적 증거를 설계 입력으로 활용하여 모듈화를 먼저 지정하는 설계 규율을 제시하며, 이는 훈련 후 아키텍처를 역설계하는 것이 아닙니다.