연구진이 전 슬라이드 병리 이미지에서 증거를 탐색하는 비전-언어 모델(VLM)을 평가하는 벤치마크 PathAgentBench를 공개했어요.
PathAgentBench는 이미지-텍스트 매칭, 텍스트-이미지 검색, 진단 영역 위치 찾기, 다중 스케일 추론 등 4가지 핵심 역량을 평가하며, 1,822개의 TCGA WSI와 17,135개의 진단 경로를 포함해요.
현재 모델들은 다중 스케일 추론에서 93% 이상의 정확도를 보이지만, 진단 영역 위치 찾기는 여전히 어려움을 겪고 있으며, 자율적 탐색 과정에서 성능 저하가 관찰돼요.