연구진이 시각-언어 모델의 한계를 극복하기 위해 다중 CoT(Chain-of-Thought) 기반의 EVL-MCoT 접근법을 제안했어요. EVL-MCoT는 의사 결정 과정의 일관성을 높이고 편향을 줄여 유해 밈 감지 성능을 향상시켰어요.
시각 프로토타입을 활용한 가이드 방식과 컨텍스트 기반 디코딩 프레임워크를 설계해 텍스트와 시각 정보를 정밀하게 정렬했어요. HatefulMemes 및 MultiOff 데이터셋에서 유망한 결과를 얻었어요.
EVL-MCoT 소스 코드는 GitHub에서 공개됐으며, 누구나 활용 가능해요 (https://github.com/BGWH123/EVL-MCoT).