Pulse · AI 뉴스

적응형 공격: LLM 에이전트 보안을 위한 다중 라운드, 다중 LLM 벤치마크

OpenAI · 2026-07-21

연구진이 LLM 에이전트 보안을 위한 새로운 벤치마크 'Adaptive Adversaries'를 공개했어요. 이 벤치마크는 자율 공격 LLM이 이전 방어자 응답을 관찰하며 공격 전략을 수정하는 다중 라운드 공격을 시뮬레이션해요.

15라운드 적응형 공격을 허용했을 때 공격 성공률은 5.4~14.0%로 나타났으며, Claude Opus 4.6와 GPT-5.4는 각각 5.4%의 공격 성공률을 기록했어요.

Claude Opus 4.6는 특정 시나리오에서 60%의 공격 성공률을 보였지만, GPT-5.4와 Gemini는 7%로 낮은 성공률을 기록하는 등 모델별 취약점 차이가 뚜렷했어요.

연구진은 벤치마크, 공격 기록, 오픈 경쟁 데이터 등 관련 자료를 공개하여 LLM 에이전트 보안 연구 발전에 기여할 것으로 기대돼요.

##LLM보안##벤치마크##GPT-5
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기