Anthropic의 Claude Opus 4.8과 OpenAI의 GPT-5.5가 BioSecBench-Surveillance 벤치마크에서 각각 50.2%의 정확도를 기록했어요.
BioSecBench-Surveillance는 AI 에이전트가 원시 시퀀싱 데이터와 감시 맥락에서 올바른 분석 파이프라인을 추론하는지 평가하는 벤치마크예요.
AI 에이전트가 올바른 워크플로우를 실행하더라도, 참조, 임계값, 필터, 정규화 선택과 같은 결정에서 실수를 하는 경향이 있어요.