연구진은 LLM의 교차 언어 사실 불일치 문제를 해결하기 위해 추론 시간 제어 전략을 연구했어요.
제로샷 컨텍스트 스티어링(페르소나 프롬프팅), 내부 표현 조작(CAA), DPO 기반 가중치 수정 등 4가지 방법론을 실험했어요.
페르소나 프롬프팅이 효과, 안전성, 일반화 성능을 모두 고려했을 때 가장 강력한 방법으로 나타났어요.
연구 결과, 교차 언어 불일치는 선택 문제이며, 간단한 컨텍스트 개입이 더 강력하고 전이 가능한 정렬을 달성할 수 있음을 시사해요.