사용자들이 통합 메모리 덕분에 거대 LLM 모델을 로드할 수 있다고 이야기하는 것을 볼 수 있어요. DS4 등의 프로젝트는 매우 큰 LLM을 실행한다고 주장하지만, 실제 실험 결과 전체 RAM 모델을 로드하면 맥북 프로의 온도가 쉽게 100도에 도달해요. 사람들은 이러한 모델을 항상 실행하는지, 아니면 단순히 벤치마크 점수를 올리는 것인지 궁금해요.
항상 실행할 수 있는 가장 작은 모델을 찾고 있어요. 이 모델은 Hermes Agent와 같은 도구의 두뇌 역할을 하여 할 일 목록이나 캘린더 관리와 같은 간단한 작업을 처리할 수 있기를 바라요.