연구진은 기존 자연어 추론(NLI) 연구에서 사용된 재라벨링 자원이 불일치 수준에 따라 항목을 선택한다는 점을 지적했어요.
ChaosNLI 데이터셋에서 단조성 연산자가 없는 가설이 낮은 라벨 일치도를 보인다는 이전 연구를 재현하기 위해 SNLI 및 MultiNLI 개발 데이터셋을 사용했는데, 등록된 예측은 실패했어요.
연구 결과, 단조성 연산자가 없는 항목이 오히려 약간 더 높은 라벨 일치도를 보였고, 모든 효과가 관심 효과 크기(0.10)보다 훨씬 작았으며, 이는 선택 편향에 의한 결과일 가능성이 높아요.