연구진은 LLM과 AI 에이전트가 검색 결과의 주요 소비자로서 문서 집합 품질이 생성 성능의 상한선을 결정한다는 점에 주목했어요. 기존 평가 시스템은 문서 간 상호작용을 고려하지 못하고 문서 집합의 질을 평가하는 데 한계가 있었어요.
SetwiseEvalKit이라는 3단계 9차원 문서 집합 평가 벤치마크를 설계하여 단답형 및 장문 시나리오를 모두 다루고 약 28,000개의 고품질 평가 척도를 포함했어요.
Rubric4Setwise라는 새로운 방법을 제안하여 평가 척도를 문서 집합 선택 신호로 변환하여 더 적은 문서와 검색 라운드로 최상의 다운스트림 생성 성능을 달성했으며, 두 시나리오 모두에서 최첨단 결과를 유지했어요.