Cactus가 젬마 4 E2B 모델을 자체 학습시켜 응답의 신뢰도를 평가하는 기능을 추가했어요. 이 모델은 응답 시 0~1 사이의 신뢰도 점수를 제공하며, 점수가 높으면 온디바이스에서, 낮으면 더 큰 클라우드 모델로 연동돼요.
ChartQA는 15~20%, LibriSpeech는 25~30%의 성능 향상을 보였으며, MMLU-Pro는 45~55%의 성능을 기록했어요.
Cactus는 이 기술을 오픈소스로 공개했으며, Transformers, MLX, Llama.cpp 등 다양한 환경에서 사용할 수 있도록 코드를 제공하고 있어요.