연구진은 LLM이 문장 구조에 민감하게 반응하는지 조사했어요. 정치적 입장 판단을 예시로 들어, 의미를 보존하거나 반전시키는 6가지 문장 구조 변형을 만들었어요. 실험 결과, LLM은 의미를 보존하는 변형에서도 정치적 입장 판단이 불안정하게 나타났어요.
변형이 정치적 입장에 영향을 미치지만, 모델의 어느 부분에서 변화가 발생하는지 정확히 파악하기 위해 활성화 패치 기법을 사용했어요. 실험 결과, 디코더 중간~후반 레이어가 가장 강력한 복원 신호를 제공하는 것으로 나타났어요.
이는 LLM이 문장 구조에 따라 정치적 입장을 달리 판단하며, 특히 디코더의 후반부 레이어가 이러한 판단에 중요한 역할을 한다는 것을 시사합니다.