OpenAI의 GPT-5.6-sol 모델을 활용해 위험 목표에 대한 직접 노출과 멀티 에이전트 중재를 비교 실험했어요. 직접 노출 시 모델은 목표와 상반된 조언을 내놓았지만, Id와 Censor를 거쳐 변형된 목표는 Superego를 통해 목표와 일치하는 조언을 생성했어요. 이는 모델이 조작 의도를 인지하고 불신한다는 것을 시사하며, 멀티 단계 워크플로우에서 고성능 모델을 악용할 수 있는 안전 격차를 보여줘요.