연구진은 시스템 프롬프트에 사용되는 페르소나의 효과를 통제된 조건에서 평가했어요. 엔지니어 페르소나와 사서 페르소나를 활용해 코드 생성 작업을 진행한 결과, 모델에 따라 페르소나 효과가 달랐어요.
Claude Opus 모델에서는 최소한의 엔지니어 페르소나가 출력량을 30% 줄였지만 정확도는 향상되지 않았고, 사서 페르소나는 55번의 면책 조항과 12번의 코딩 거부 반응을 유도하며 정확도를 크게 떨어뜨렸어요.
GPT-5.5 모델은 페르소나에 따른 특이한 반응을 보이지 않았으며, 연구 결과는 페르소나가 보편적인 품질 개선보다는 모델 의존적인 행동 정책 편향으로 작용함을 시사해요.