Pulse · AI 뉴스

희소 프레임 환경에서 MLLM의 시각적 병목 현상 연구

Qwen · 2026-07-28

연구진은 대규모 비디오 플랫폼의 정책 위반 검열을 위해 MLLM(Multimodal Large Language Model)을 활용할 때 발생하는 시각적 병목 현상을 분석했어요. Qwen3-VL 8B 모델은 프레임 수를 줄이면 성능이 크게 저하되는 것을 확인했어요. 연구 결과, ViT 레이어만 조정하는 것이 효과적이며, 2B 모델이 8B 모델보다 더 나은 성능을 낼 수 있음을 밝혔어요.

연구진은 시각적 특징 추출이 성능 저하의 주요 원인임을 밝혀냈고, 전체 파라미터의 4%에 해당하는 ViT 레이어만 조정하여 성능을 향상시켰어요. 언어 모델 미세 조정은 효과가 미미하거나 오히려 성능을 저하시키는 것으로 나타났어요. 또한, 경계 정보를 활용한 Hybrid16 샘플링 전략이 성능을 더욱 향상시켰어요.

연구 결과, 희소 프레임 비디오 검열에서는 모델 크기보다 훈련 전략이 더 중요하다는 것을 보여줬어요. 2B 모델이 8B 모델보다 일관되게 더 나은 성능을 보였으며, 이는 대규모 모델을 활용할 때 훈련 전략의 중요성을 강조해요.

##MLLM##비디오검열##ViT##Qwen3
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기