Pulse · AI 뉴스

Looped Latent Attention: 루프 KV 압축을 통한 루프 트랜스포머 효율화

Hugging Face · 2026-07-17

연구진은 루프 트랜스포머의 K/V 캐시 구조가 반복적인 패턴을 따른다는 점에 주목했어요. 이를 활용해 Looped Latent Attention (LLA)이라는 새로운 캐시 코덱을 개발하여 K/V 벡터를 압축하고 필요할 때만 복원하는 방식을 제안했어요. LLA는 기존 방식 대비 성능을 향상시키고, Hugging Face 모델에서도 유사한 효과를 보였어요.

LLA는 SVD를 통해 초기화하고, KL 및 어텐션 출력 증류를 통해 성능을 개선했어요. 이를 통해 K/V 캐시를 최대 21.3배까지 압축하면서도 성능 손실을 최소화했어요. 특히, 긴 수학 문제 풀이에서 학생 모델이 생성한 접두사를 활용한 추가 학습을 통해 성능을 향상시켰어요.

H200 GPU에서 LLA를 적용했을 때, 4k 컨텍스트 환경에서 배치 크기를 32에서 768로 늘리는 데 성공했어요. 이는 기존 방식 대비 21.3배의 압축 효과를 의미하며, 루프 트랜스포머의 효율성을 크게 향상시키는 결과를 보여줬어요.

##트랜스포머##압축##캐시##HuggingFace
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기