연구진은 시각-언어 AI 어시스턴트의 안전 관제에 있어 추론 기반 방식의 비효율성을 지적했어요. ResponseGuard는 추론 없이 단일 패스 방식으로 위험 판단을 내리는 새로운 안전장치로, 기존 방식보다 훨씬 빠르고 효율적이에요.
ResponseGuard는 2B 파라미터로 구성되어 있으며, 기존 3B 추론 기반 안전장치보다 위험성 탐지 성능이 우수하고 처리 속도는 150배 빠르다는 결과가 나왔어요. 다만, 요청 자체의 위험성 판단에서는 기존 방식이 여전히 우위를 점하고 있어요.
연구진은 이미지 인식 성능의 한계가 안전장치의 성능 차이에 영향을 미칠 수 있다고 분석하고, 이미지에 대한 집중 부족이 기존 방식의 문제점이라고 파악했어요. ResponseGuard는 실시간 스트리밍 답변을 문장 단위로 검열하여 유해 답변을 조기에 차단할 수 있어요.
연구진은 ResponseGuard의 소스 코드, 학습 모델, 데이터셋을 GitHub에 공개하여 연구의 재현성과 투명성을 높였어요.