Pulse · AI 뉴스

Abliteration은 정교한 수술이 아니다: 모델 패밀리별 거부 제거의 부작용

Gemma · 2026-07-20

연구진은 모델의 거부 방향을 삭제하는 Abliteration이 깨끗한 수술이 아니라고 밝혔어요.

바르샤바 증권 거래소 주식의 주간 변동 예측을 통해 Abliteration의 부작용을 분석한 결과, 모델은 체계적으로 낙관적인 결정을 내리고, 더 긴 설명을 제공하며, 불확실성을 덜 언급하는 경향을 보였어요.

Gemma 모델은 Abliteration 후 자신감 수준이 낮아지고, Qwen 모델은 자신감이 높아지는 상반된 결과가 나타났으며, 이는 경제적 기술 향상이 아닌 시장 베타에 기인하는 것으로 확인됐어요.

연구진은 Abliteration 과정에서 발생할 수 있는 도구 체인 오류 가능성을 강조하며, '검열 해제' 모델을 배포하는 것은 단순히 거부 제거가 아닌, 측정 가능한 다른 의사 결정자를 배포하는 것임을 경고했어요.

##LLM##Abliteration##거부제거
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기