Pulse · AI 뉴스

모델을 읽는 사람이 이해하도록 훈련: 검증 가능한 활성화 설명에 대한 해독성 감독

Qwen · 2026-07-22

연구진은 자연어 오토인코더가 숨겨진 활성화의 설명을 평가하는 방식을 분석했어요. 기존 방식은 설명의 진실성을 평가하지만, 구조적으로 개별적인 잘못된 주장을 무시한다는 한계가 있어요.

Qwen-2.5-7B 모델을 분석한 결과, 설명은 우연히도 잘 재구성되지만, 특정 주장의 약 2%는 재구성에 의존하는 것으로 나타났어요. 이는 설명이 전체적인 내용을 추적하지만, 구체적인 사실을 반영하지 못한다는 것을 의미해요.

RECAP(Readable Encodings via Co-trained Auxiliary Predictors)이라는 새로운 기술을 개발하여, 모델이 속임수를 쓰기 어려운 독립적인 프로브를 통해 내부 콘텐츠를 검증할 수 있도록 만들었어요.

RECAP을 적용한 모델은 지정된 내부 콘텐츠를 신뢰성 있게 프로브로 해독할 수 있으며, 기존 방식보다 안전성을 높일 수 있다는 결과를 보여줬어요.

##연구##해독성##RECAP##AI안전##Qwen
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기