연구진이 오류 위치를 추적하여 불필요한 연산을 줄이는 테스트 시간 스케일링 알고리즘 TTEL을 개발했어요. TTEL은 환경 피드백을 활용해 토큰 수준의 오류 위치를 찾아내고, 유효한 부분을 재사용하여 연산 비용을 절감해요.
Qwen3-8B 모델로 LiveCodeBench를 평가한 결과, TTEL은 독립 샘플링 대비 토큰 생성량을 약 절반으로 줄이고 pass@64를 71.0% 달성했어요.
AIME-2025 및 HMMT-2025 수학 벤치마크에서 TTEL은 Qwen3-8B 및 Qwen3-4B-Thinking-2507 모델 모두에서 기존 테스트 시간 기반 모델을 능가하는 성능을 보여줬어요.