lordhiggsboson 사용자가 LFM 2.5 230M 모델을 WebGPU 기반으로 최적화했어요. Nvidia GPU에서는 멀티패스 아키텍처, Apple Silicon에서는 융합된 메가 커널을 사용해 성능을 높였어요. 데모는 warp.sipp.sh에서 확인할 수 있어요.
RTX 3090에서 초당 1400~1500 토큰 처리 속도를 보여줬으며, Apple Silicon에서는 400~500 토큰 처리 속도를 기록했어요. Sipp 라이브러리에 통합될 예정이에요.
현재 개발 중이며, WebGPU 기반으로 Nvidia 및 Apple Silicon 모두 지원하며, 하드웨어에 맞춰 커널을 최적화했어요.