자동 오디오 캡션(AAC)이 단일 문장 생성에서 구조화된 형식으로 전환됨에 따라, 멀티 축 평가 프레임워크가 필요해요. AudioCards 데이터셋 기반으로 태그 세트, 설명, 논리적 추론, 수치 측정, 스펙트럼 프로필 등 5가지 축으로 평가하며 LLM과 계산적 지표를 결합했어요. 제어된 교란 테스트를 통해 프레임워크가 의미 보존 패러프레이즈와 실제 의미/음향 손상을 구별하는 것을 입증했어요.