기업은 환각 문제 해결이 가능해야 AI 에이전트를 도입할 수 있습니다. 환각은 사실과 다른 내용을 확신에 찬 어조로 생성하는 현상입니다. 연구진은 모델 자체의 환각 제거가 어렵다고 보고, 환각을 제어 가능한 오류 모드로 관리하는 아키텍처 HALO를 제안합니다. HALO는 6가지 방어 계층으로 구성되어 있으며, 특히 증거 기반 신뢰도를 통해 모델의 자체적인 확신 정도를 검증합니다.
HALO는 검색된 콘텐츠 기반의 제한적인 생성, 총체적인 추적 기능, 지속적인 감시 기능을 제공합니다. 또한, 근거가 부족할 경우 추론을 거부하는 '가중 추방' 기능을 통해 환각 가능성을 낮춥니다. 이 아키텍처는 규제된 보험 청구 추출 업무에 적용되었습니다.
연구진은 환각을 모델의 고유한 특성이 아닌 시스템이 강제하는 특성으로 재정의했습니다. HALO는 LLM 판사와 증거 기반 검사를 결합하여 출력물의 신뢰도를 평가하고, 지속적인 감시를 통해 성능 저하를 감지하고 개선합니다. 기업 AI 신뢰 구축을 위한 새로운 접근 방식입니다.