연구진은 자연어 오토인코더가 숨겨진 활성화의 설명을 평가하는 방식을 분석했어요. 설명이 충실한지 확인하기 위해 활성화를 설명에서 재생성하는 방법을 사용하는데, 이 테스트는 구조적으로 개별적인 잘못된 주장에 민감하지 않다고 해요.
Qwen-2.5-7B verbalizer에서 설명은 우연보다 훨씬 잘 재구성되지만, 특정 주장의 약 2%가 재구성에 의존하는 것을 발견했는데, 이는 점수가 구체적인 사실이 아닌 요점을 추적한다는 것을 의미해요.
RECAP(Readable Encodings via Co-trained Auxiliary Predictors)이라는 새로운 방법을 통해 모델이 게임할 수 있는 문장을 회피하고, 독립적인 프로브를 통해 지정된 내부 콘텐츠를 확인할 수 있도록 만들었어요.
RECAP 훈련 모델에서 새로운 verbalizer는 지정된 콘텐츠를 진실하게 진술하고 코드가 사라지며, 자연 로그 비용이 +0.001 증가했어요.