퍼플렉시티가 AI 연구 에이전트의 실제 지식 노동 수행 능력을 평가하는 오픈 벤치마크 'WANDR'을 공개했어요. WANDR은 기업 실사, 시장조사 등 실제 업무 수행을 위한 에이전트 성능을 측정합니다. 현재 최고 성능의 AI 시스템조차도 방대한 정보를 빠짐없이 수집하고 신뢰성을 입증하는 데 한계가 있는 것으로 나타났어요. WANDR을 통해 AI 에이전트의 실무 적용 가능성을 진단할 수 있습니다.