연구진이 LLM 에이전트 보안을 위한 새로운 벤치마크 'Adaptive Adversaries'를 공개했어요. 이 벤치마크는 자율 공격 LLM이 이전 방어자 응답을 관찰하며 공격 전략을 수정하는 다중 라운드 공격을 시뮬레이션해요.
15라운드 적응형 공격을 허용했을 때 공격 성공률은 5.4~14.0%로 나타났으며, Claude Opus 4.6와 GPT-5.4는 각각 5.4%의 공격 성공률을 기록했어요.
Claude Opus 4.6는 특정 시나리오에서 60%의 공격 성공률을 보였지만, GPT-5.4와 Gemini는 7%로 낮은 성공률을 기록하는 등 모델별 취약점 차이가 뚜렷했어요.
연구진은 벤치마크, 공격 기록, 오픈 경쟁 데이터 등 관련 자료를 공개하여 LLM 에이전트 보안 연구 발전에 기여할 것으로 기대돼요.