Pulse · AI 뉴스

BioSecBench-Surveillance: AI 에이전트의 병원체 유전체 감시 벤치마크

Claude · 2026-07-22

Anthropic의 Claude Opus 4.8과 OpenAI의 GPT-5.5가 BioSecBench-Surveillance 벤치마크에서 각각 50.2%의 정확도를 기록했어요.

BioSecBench-Surveillance는 AI 에이전트가 원시 시퀀싱 데이터와 감시 맥락에서 올바른 분석 파이프라인을 추론하는지 평가하는 벤치마크예요.

AI 에이전트가 올바른 워크플로우를 실행하더라도, 참조, 임계값, 필터, 정규화 선택과 같은 결정에서 실수를 하는 경향이 있어요.

##AI##유전체##감시##벤치마크##Anthropic
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기