연구진은 LLM의 명확화 정책을 평가하는 새로운 벤치마크 RegretBench를 공개했어요. RegretBench는 모호한 사용자 요청에 대한 LLM의 순차적 의사 결정 과정을 평가하며, 숨겨진 의도를 활용하고 의미 기반 상태 추적을 지원해요.
기존 벤치마크는 최종 성공 여부만 평가했지만, RegretBench는 효율성, 사용자 행동에 대한 강건성, 중단 결정 등 다양한 측면을 측정해요.
연구 결과, 효과적인 명확화는 적절한 질문을 적절한 시점에 하는 것과 함께, 사용자의 의도가 명확해지면 중단하는 능력을 포함하는 것으로 나타났어요.