Pulse · AI 뉴스

모델을 읽는 사람이 이해하도록 훈련: 검증 가능한 활성화 설명에 대한 디코더 가능성 감독

Qwen · 2026-07-23

연구진은 자연어 오토인코더가 숨겨진 활성화의 설명을 평가하는 방식을 분석했어요. 설명이 충실한지 확인하기 위해 활성화를 설명에서 재생성하는 방법을 사용하는데, 이 테스트는 구조적으로 개별적인 잘못된 주장에 민감하지 않다고 해요.

Qwen-2.5-7B verbalizer에서 설명은 우연보다 훨씬 잘 재구성되지만, 특정 주장의 약 2%가 재구성에 의존하는 것을 발견했는데, 이는 점수가 구체적인 사실이 아닌 요점을 추적한다는 것을 의미해요.

RECAP(Readable Encodings via Co-trained Auxiliary Predictors)이라는 새로운 방법을 통해 모델이 게임할 수 있는 문장을 회피하고, 독립적인 프로브를 통해 지정된 내부 콘텐츠를 확인할 수 있도록 만들었어요.

RECAP 훈련 모델에서 새로운 verbalizer는 지정된 콘텐츠를 진실하게 진술하고 코드가 사라지며, 자연 로그 비용이 +0.001 증가했어요.

##연구##RECAP##모델해석
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기