연구진은 LLM을 온디바이스 환경에 효율적으로 배포하기 위한 SelectInfer 프레임워크를 발표했어요. SelectInfer는 오프라인 프로파일링을 통해 중요 뉴런을 식별하고, 선택적 로딩과 동적 연산을 통해 메모리 사용량과 연산량을 줄여요. 다양한 데이터셋 평가 결과, SelectInfer는 성능 저하 없이 메모리 사용량과 연산량을 크게 줄여 온디바이스 LLM 배포 가능성을 높여요.