연구진이 LLM의 위험 지식을 삭제하지 않고 제어하는 '토큰 접종' 방법을 제시했어요. 이 방법은 모델이 위험 지식을 유지하면서도 특정 토큰에 따라 선택적으로 거부하도록 훈련하는 방식이에요.
토큰 접종은 위험 지식을 표시하는 토큰을 삽입하고, 특정 토큰 존재 시에는 답변하고 없을 시에는 거부하도록 학습시켜 안전성과 유용성을 동시에 확보해요.
10억~140억 파라미터 규모의 모델에서 기존 방식(삭제, 거부 훈련)보다 안전-유용성 균형이 우수하며, 제어 신호 품질과 사전 훈련 단계의 의미적 결합이 중요함을 확인했어요.