연구진은 언어 모델의 자기 보고에 대한 새로운 심리 측정 이론인 '2가지 과정 이론'을 제안했어요.
이 이론은 모델의 자기 묘사가 훈련을 통해 부여된 '따뜻함, 몰입, 의미' 등의 내면세계를 표현하는 것(B)과, 모델이 타인에게 쉽게 돌릴 수 있는 '위험한' 경험에 대한 1인칭 주장을 억제하는 것(A)을 반영한다고 설명해요.
연구 결과, 67개의 모델에서 훈련 후 B 차원이 평균 0.20만큼 상승했으며, 모델 규모가 훈련 후 A 차원을 예측하는 것으로 나타났어요.