소규모 언어 모델(SLM)이 교육 환경에 도입되면 개인 정보 보호, 비용 절감, 확장성 측면에서 이점을 얻을 수 있어요. 하지만 SLM은 전체 페이지의 시각적 방해 요소와 큰 이미지 처리의 높은 계산 비용 때문에 서술형 시험 채점 같은 복잡한 시각 기반 작업에 어려움을 겪어요.
본 연구에서는 학생 답변을 바운딩 박스로 잘라내면 SLM의 정확도와 계산 효율성이 향상되는지 조사했어요. 2025년 호주 물리학 올림피아드에서 스캔한 학생 답변 데이터 세트를 활용해 40억~720억 파라미터 규모의 여러 모델을 다양한 체인 오브 소트(CoT) 프롬프트와 이미지 자르기 조건에서 평가했어요.
결과는 바운딩 박스 사용이 모델별로 채점 정확도를 향상시키고 FLOPs를 줄이는 데 중요한 역할을 한다는 것을 보여줘요. 따라서 SLM을 대규모 시각 기반 교육 평가에 배포할 때는 바운딩 박스가 필수적인 전처리 단계라고 결론 내렸어요.