연구진이 LLM 답변의 추론 과정을 검증하는 새로운 프레임워크를 제안했어요. 이 프레임워크는 자연어 추론(NLI)을 활용해 추론 과정을 세분화하고, 하이퍼그래프를 통해 관계를 분석해요. 수학적 추론과 의료 분야의 실제 사례를 바탕으로 평가한 결과, 기존 LLM 검증 방식보다 더 신뢰성 있는 평가 신호를 제공하는 것으로 나타났어요. 연구진은 의료 분야 추론 벤치마크 'UroReason' API와 오픈 소스 코드를 공개할 예정이에요.