챗봇 정확도 평가를 위한 데이터셋/벤치마크를 찾는 사용자가 Reddit에 문의했어요. LongBench, NIAH, RULER 같은 기존 벤치마크 외에 현재 SOTA에 해당하는 데이터셋을 찾고 있어요. 멀티턴 정확도와 메모리 관리를 측정할 수 있는 데이터셋 정보를 공유해 주세요.
사용자는 자신의 작업에서 약점을 파악하기 위해 챗봇 평가 데이터셋을 활용하고 싶어하며, 현재는 에이전트 기능이 적용되지 않은 긴 대화 흐름을 평가하는 데 관심이 있어요.