llama.cpp 프로젝트가 Mamba-2 프리필 가속을 위한 chunked SSD matmul, Metal 백엔드 FWHT 커널 등 다양한 업데이트를 공개했어요. RTX 6000 Pro MaxQ에서 테스트 결과, ub base (scan) branch (SSD)에서 2K 기준 21% 속도 향상을 확인했어요.
DeepSeek-V4-Flash-UD-IQ2_XXS 모델을 M4 Max에서 llama-bench로 테스트한 결과, f16 tg16에서 1.16% 속도 향상을 보였으며, q4_0 tg16에서는 1.25% 향상을 기록했어요.
Eagle3 모델을 ggml-org/gpt-oss-20b-GGUF 및 ggml-org/gpt-oss-120b-GGUF에 추가했으며, sycl 및 vulkan 관련 버그 수정도 포함됐어요.