Pulse · AI 뉴스

DBA-Bench: LLM 기반 데이터베이스 에이전트 평가를 위한 실제 환경 기반 벤치마크

DBA-Bench · 2026-07-24

DBA-Bench는 LLM 기반 데이터베이스 에이전트 평가의 현실성 부족 문제를 해결하기 위해 개발된 벤치마크입니다. 실제 PostgreSQL 환경에서 데이터베이스 운영 시나리오를 재현하고, 안전 제약 하에서 복구 또는 오류 제거를 통해 성공을 측정합니다. 106개의 시나리오를 포함하며, GPT-5.5 기반 에이전트와 인간 DBA를 비교한 결과, 자동화된 에이전트의 Safe Pass율은 12.4%에 불과했습니다.

DBA-Bench는 다중 턴 읽기/쓰기 상호 작용, 복잡한 관측 공간, 다양한 해결책, 복잡한 시나리오를 포함하여 기존 평가 방법의 4가지 단점을 보완합니다. 848회 자동 실행 결과, 진단, 결과, 안전 통과율은 각각 32.7%, 19.6%, 12.4%를 기록했습니다.

쉬운 시나리오에서는 19.6%의 안전 통과율을 기록했지만, 어려운 시나리오에서는 7.6%로 급감하여 안전한 엔드투엔드 복구의 어려움을 보여줍니다. DBA-Bench는 데이터베이스 운영 환경의 복잡성을 고려한 실제 환경 기반 평가의 중요성을 강조합니다.

DBA-Bench는 PostgreSQL 환경을 사용하며, 각 실행 전에 스냅샷을 복원하고 시나리오별 검사를 수행하여 재현성을 보장합니다.

##LLM##데이터베이스##에이전트##벤치마크##GPT-5.5
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기