연구진은 LLM 추론 개선에 기여하는 테스트 시간 협업의 효과가 불균등하고 때로는 부정적이라고 분석했어요. 고정된 후보 풀에서 선택기나 검증기의 순수 이득을 회수 가능한 질량, 검증 신호 커버리지, 조건부 선택 품질, 이미 올바른 출력에 대한 피해로 분해했어요. 이를 통해 협업을 다중 에이전트 토폴로지가 아닌 후보 선택 문제로 재정의했어요.
LiveCodeBench, MATH Level-5, GPQA-Diamond에서 이득은 Oracle 격차와 신호 충실도에 의해 제한되는 것으로 나타났어요. 신호 충실도는 검증 판결과 공식 레이블 간의 후보 수준 합의로 측정돼요.
공개 테스트 검증기는 첫 번째 샘플 기준보다 +8.14% 성능 향상을 보였고, 생성 테스트 검증기는 +2.70% 향상되었지만 LLM 선택기와 통계적으로 구별되지 않았어요. 또한 기존 선택기의 4.69% 피해율에 비해 거의 피해가 없었어요.
연구 결과는 Oracle 격차를 추정하고, 커버리지, 신호 충실도, 피해를 측정하여 협업에 투자하기 전에 실용적인 사전 배포 진단을 제공합니다.