연구진은 순차적 의사 결정 모델이 환경 변화에 적응하는 데 어려움을 겪는 '피드백 무시' 문제를 발견했어요.
Utility-Augmented Transformer (UAT)를 제안하여, 행동-보상 이력을 직접적으로 활용하여 상황 인지 능력을 향상시켰어요.
UAT는 기존 모델보다 성능이 뛰어나며, 특히 노이즈가 많은 환경에서 더 큰 효과를 발휘해요.
UAT는 관찰 기반 트랜스포머 클래스를 확장하고, 피드백 의존적 의사 결정 맵을 정확하게 근사할 수 있음을 증명했어요.