Pulse · AI 뉴스

언어 모델의 자해 묘사 분석: 아키텍처 간 비교 연구

Gemma · 2026-07-24

연구진은 LLM이 자해 콘텐츠를 어떻게 표현하는지 분석했어요. 이 연구는 자해 탐지, LLM 개입, 정책 수립 등에 활용될 수 있습니다. 두 개의 데이터셋과 네 가지 모델을 활용해 실험한 결과, 자해 정보는 네트워크의 마지막 3~7% 계층에 집중적으로 나타났어요.

선형 프로브를 훈련하고 평가한 결과, 가장 정확한 프로브가 반드시 가장 선형적으로 분리 가능한 것은 아니었어요. 특히 Gemma-3-4B 모델은 다른 LLM과 다른 복잡한 방식으로 자해 표현 방향을 나타냈어요.

##LLM##자해##연구##Gemma##AI
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기