Pulse · AI 뉴스

LLM 프롬프트 주입 탐지기 오픈소스: 실제 공격 데이터 활용

Bordair · 2026-07-20

Josh-blythe가 LLM 입력 프롬프트 주입 탐지기 코드를 오픈소스로 공개했어요. 이 탐지기는 정규식 레이어와 양자화된 DeBERTa-v3 모델의 2단계 구조를 사용해요.

정규식 레이어는 간단한 공격을 빠르게 처리하고, DeBERTa-v3 모델은 더 복잡한 공격을 분석하며, 4가지 클래스(benign, direct, jailbreak, indirect)로 분류해요.

평가 데이터에 실제 공격 시도를 포함했는데, 게임을 통해 수집된 13,230건의 익명화된 공격 데이터를 활용하여 모델의 성능을 높였어요.

##LLM##보안##프롬프트주입##오픈소스
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기