Pulse · AI 뉴스

VLMs의 실패 원인 분석: 시각-작업 불일치

arXiv cs.CV · 2026-07-18

연구진은 시각-언어 모델(VLM)이 복합적인 시각 질의 응답(VQA)에서 실패하는 원인을 분석했어요. VLM의 실패가 특정 추론 작업과 내부 연산 경로에 어떻게 연관되는지 살펴봤습니다.

분석 결과, VLM은 '객체 지칭 실패', '추론 실패', '속성 추출 실패', '언어 사전 지식 우위 실패' 등 4가지 주요 실패 모드를 보입니다. 각 실패 모드는 시각적 지칭 강도와 답변 정확성 간의 고유한 관계를 가집니다.

연구진은 트랜스포머 레이어에 대한 세 가지 개입을 통해 '지칭 실패'는 피드포워드 네트워크, '추론 실패'는 후반 레이어 어텐션, '속성 추출 실패'는 답변 위치 피드포워드 연산에 집중된다는 사실을 밝혀냈습니다.

이러한 결과는 VLM의 신뢰성을 높이기 위한 맞춤형 개선 전략 수립에 기여하며, 다양한 실패 유형에 대한 근본적으로 다른 수정 전략이 필요함을 시사합니다.

##VLM##VQA##시각질의응답##인공지능##연구
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기