Pulse · AI 뉴스

V100 사용자용 SGLang: Qwen+Dflash 및 Laguna 지원

SGLang · 2026-07-27

SGLang을 포크하여 V100에 최적화된 TeilLang FlashAttention을 개발하고, marlin-v100과 ungated flashinfer를 활용했어요.

Qwen3.5/3.6 모델과 Laguna S2.1 지원을 추가했으며, Laguna Dflash 적용은 아직 실패했어요.

4000~6000pp, 100tks/tg(Qwen) 성능을 보이며, GitHub 저장소에서 관련 코드를 확인할 수 있어요.

##V100##SGLang##FlashAttention
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기