Pulse · AI 뉴스

멀티홉 RAG 에이전트의 Salience 유도 공격: 위협과 방어

Qwen · 2026-07-20

연구진은 멀티홉 RAG 에이전트의 새로운 공격 벡터인 Salience 유도를 발견했어요. Salience 유도는 사실 정보가 진실임에도 불구하고, 위치, 강조, 프레임, 의미적 근접성을 조작하여 추론 방향을 바꾸는 공격 방식이에요.

GPT, Claude, Gemini, DeepSeek, Qwen 등 5개 주요 모델 패밀리와 ReAct, Reflexion, tool-calling 등 3가지 에이전트 아키텍처를 대상으로 실험한 결과, 30% 편집 예산으로 83.3%의 공격 성공률을 기록했어요.

Salience Normalization이라는 가벼운 입력 측면 방어 기법을 통해 공격 성공률을 15.3%로 낮췄으며, 적응형 공격에 대해서도 23.6%로 감소시켰어요. 이는 진실성 검증과 지시 필터링만으로는 충분하지 않다는 것을 보여줘요.

##RAG##에이전트##보안##Salience##공격
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기