Li, Li, Zhou 연구팀이 LLM 추론 과정에서 계산량을 조절하여 성능을 향상시키는 '프로그램 오브 레이어(PoLar)' 기술을 제안했어요. PoLar는 Llama 3.2, Qwen 1.5, Qwen 2.5, Qwen 3 모델에 적용 가능하며, 레이어를 건너뛰거나 반복하여 입력에 최적화된 추론 프로그램을 생성해요. 연구 결과, PoLar는 기존 방식보다 정확도를 높이면서도 레이어 실행 횟수를 줄일 수 있으며, 오답 수정에도 효과적이었어요.
PoLar 예측 네트워크는 사전 학습된 레이어를 모듈로 묶어 동적으로 레이어를 건너뛰거나 반복하는 방식으로 작동하며, 수학적 추론 벤치마크에서 기존 방식 대비 정확도 향상을 보였어요. 이는 LLM의 잠재적인 추론 능력이 고정된 깊이의 실행만으로는 제한될 수 있음을 시사해요.
이 연구는 로컬 LLM 커뮤니티에 영향을 미쳐, 추론 스택 소프트웨어를 수정하여 로컬 모델의 성능과 정확성 간 균형을 맞출 수 있게 할 수 있다는 점이 중요해요. 사용자는 필요에 따라 더 빠른 추론 또는 더 높은 품질의 추론을 선택할 수 있게 될 거예요.