연구팀은 LLM이 퀴즈 형식의 질문에 얼마나 잘 답하는지 평가하기 위해 TriviaRoomQA 벤치마크를 만들었어요. 30개의 오픈 웨이트 LLM을 테스트한 결과, 역사나 지리 같은 지식 집약적인 분야는 잘하지만, 연예인이나 음악, 영화 같은 일상 대중문화 분야는 약점을 보였어요. 또한 언어별로 성능이 달라 일상적인 지식 접근성이 언어에 독립적이지 않다는 점을 확인했어요.
TriviaRoomQA는 6개 유럽 언어로 3,300개의 질문, 프랑스어만으로 된 5,340개의 질문을 포함하며, 288개의 주제를 다루고 있어요. 70억 파라미터 규모의 모델까지 테스트했는데, 기존 벤치마크로는 파악하기 어려운 지식 격차가 존재한다는 것을 보여줬어요.
연구 결과, LLM은 지식 집약적인 분야에서는 강점을 보이지만, 일상적인 대중문화 지식은 부족하며, 언어에 따라 성능 편차가 나타나는 것으로 확인돼요.