연구진은 LLM이 자해 콘텐츠를 어떻게 표현하는지 분석했어요. 이 연구는 자해 탐지, LLM 개입, 정책 수립 등에 활용될 수 있습니다. 두 개의 데이터셋과 네 가지 모델을 활용해 실험한 결과, 자해 정보는 네트워크의 마지막 3~7% 계층에 집중적으로 나타났어요.
선형 프로브를 훈련하고 평가한 결과, 가장 정확한 프로브가 반드시 가장 선형적으로 분리 가능한 것은 아니었어요. 특히 Gemma-3-4B 모델은 다른 LLM과 다른 복잡한 방식으로 자해 표현 방향을 나타냈어요.