Pulse · AI 뉴스

Hy3 295B 모델 1비트 양자화, 클라우드 API 대비 2.2배 빠른 속도

Hy3 · 2026-07-20

Tencent의 Hy3 295B 모델을 1비트 양자화하여 92GB GGUF 모델을 만들었어요. 4개의 RTX 5090 GPU로 구동했을 때 클라우드 API 대비 2.2배 빠른 속도를 보였으며, 품질 손실은 없었어요.

모델은 295B MoE 구조로, 192개의 전문가와 80개의 레이어를 포함하고 있으며, MTP 레이어를 유지하여 llama.cpp에서 자체 예측 디코딩을 사용해요.

Flappy Bird, Arkanoid, Snake 게임을 만들며 테스트한 결과, 두 버전 모두 동일한 수준의 결과물을 생성했지만, 뱀 게임이 무한 루프에 빠지는 오류가 발견되었어요.

##모델양자화##Hy3##llama.cpp
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기