연구진은 LLM이 환경 변화에 적응하고 장기적인 목표를 달성할 수 있도록 믿음을 업데이트하는 새로운 방법을 제시했어요. 기존 LLM은 새로운 정보가 주어질 때마다 모든 것을 다시 학습하는 경향이 있어 비효율적이었어요.
새로운 방법은 LLM이 과거 경험을 바탕으로 현재 상황을 평가하고, 불확실성을 줄이기 위해 믿음을 점진적으로 업데이트하도록 설계돼요. 이를 통해 LLM은 더 적은 계산량으로도 복잡한 환경에 적응할 수 있어요.
연구 결과, 새로운 방법은 기존 방식보다 훨씬 효율적으로 장기적인 상호작용을 수행하며, 특히 불확실성이 높은 환경에서 성능이 크게 향상되는 것을 확인했어요. 이는 LLM의 실용성을 높이는 데 기여할 것으로 기대돼요.