PATS는 장기적인 LLM 에이전트 강화 학습에서 반복적인 실패를 줄이기 위해 정책 중심의 훈련 패러다임을 제안합니다. 정책이 약할 때 발생하는 비효율적인 rollout을 개선하는 데 초점을 맞춥니다.
rollout 그룹을 증거 카드 형태로 변환하고, 작업별 평가를 통해 다음 rollout의 컨텍스트를 조정하여 정책에 구체적인 지침을 제공합니다.
PATS는 ALFWorld와 WebShop에서 기존 방식보다 최대 18.6% 성능을 향상시켰으며, QA 벤치마크에서 더 적은 토큰을 사용하며 경쟁력 있는 결과를 냈습니다.