Pulse · AI 뉴스

[논문] ATSInfer: 개인용 기기에서 하이브리드 CPU-GPU LLM 추론을 위한 자동 텐서 스케줄링

ATSInfer · 2026-07-20

이 논문은 개인용 기기에서 대규모 언어 모델(LLM) 추론 성능을 향상시키는 ATSInfer 시스템을 소개합니다. 기존 오프로딩 방식의 한계를 극복하기 위해 텐서 단위로 스케줄링을 수행하며, 정적 텐서 배치와 동적 데이터 전송을 결합합니다. ATSInfer는 프리필 처리량 최대 1.94배, 디코딩 처리량 최대 3.29배 향상시키고 GPU 활용률을 높입니다.

ATSInfer는 CPU-GPU 간 비동기 조율을 통해 하드웨어 저장 공간, 데이터 이동, 연산을 효율적으로 관리합니다. 이는 기존 시스템 대비 PCIe 대역폭 활용도를 높이는 데 기여합니다.

연구진은 다양한 소비자 플랫폼에서 덴스 모델과 MoE 모델을 사용하여 ATSInfer를 평가했습니다. 그 결과, 개인용 기기에서 LLM을 로컬에서 실행하는 사용자 경험을 크게 개선할 수 있음을 확인했습니다.

논문은 arXiv에 공개되었으며, GitHub 저장소는 아직 공개되지 않았습니다 (추후 공개될 예정).

##LLM##추론##CPU##GPU##ATSInfer
매일 핵심 AI 소식을 한국어로, 빠르게
App Store 에서 Pulse 받기 앱에서 열기