연구진이 LLM 에이전트를 활용해 개념 소거 모델의 취약점을 평가하는 프레임워크 STACE를 개발했어요. STACE는 외부 지식을 기반으로 스트레스 테스트 가설을 반복적으로 생성하고 검증하는 방식으로 작동해요. 실험 결과, STACE는 기존 LLM 기반 평가 방법보다 성능이 우수했고 다양한 설정에서 안정적인 결과가 나왔어요.
기존 개념 소거 평가 방법은 정적이고 제한적이었지만, STACE는 LLM 에이전트가 자연어 탐색을 통해 다양한 실패 모드를 노출할 수 있도록 해요. STACE는 LLM jailbreaking과 같은 다른 문제 영역에도 적용 가능하며, 코드 공개는 익명으로 진행돼요.
STACE는 개념 소거 평가의 효율성과 성능을 측정하는 새로운 지표를 제시하며, 책임감 있는 AI 배포에 기여할 것으로 기대돼요.