LLM이 사용자 의도 변화를 제대로 추적하지 못한다는 연구 결과가 나왔어요. 기존 LLM은 단일 턴으로 평가되지만, 실제 대화는 사용자 의도가 변화하는 다중 턴으로 진행돼요. 연구팀은 기존 벤치마크를 활용해 사용자 의도가 변화하는 대화 환경을 만들고 실험했어요.
다양한 작업에서 LLM의 성능이 기존 평가 환경과 다중 턴 환경에서 큰 차이를 보였어요. 이는 LLM이 정적인 평가 환경에서는 잘 작동하지만, 변화하는 의도를 파악하는 데 어려움이 있음을 보여줘요.