연구진이 장문 생성의 사실적 완전성을 평가하는 새로운 벤치마크 GAMUT(Grounded Assessment of Multimodal Factuality)을 공개했어요.
GAMUT은 기존의 정밀도 측정 방식의 한계를 극복하고, 답변이 포함해야 할 모든 정보를 담고 있는지 평가하는 데 초점을 맞추고 있어요.
2단계 루브릭 프레임워크를 기반으로 10개 분야의 1,813개 질문과 증거 기반 루브릭을 제공하며, 현재 최고 성능 모델은 Gemini 3.1 Pro로 58.7%를 기록했어요.