FlashRT는 코딩 에이전트를 활용하여 실시간 멀티모달 애플리케이션의 성능을 최적화하는 시스템입니다. 기존 시스템의 한계를 극복하고 개발자가 작성한 레퍼런스 구현을 최적화된 멀티 GPU 배포로 전환합니다.
FlashRT는 새로운 체인 오브 프로그램 패러다임을 통해 에이전트가 레퍼런스를 중간 표현(IR)로 변환하고, 순차적 인터프리터를 통해 검증하며, 정적 분석을 수행하여 후보 변환을 식별합니다.
측정 기반 최적화 루프를 통해 에이전트는 후보 변환을 반복적으로 구현, 검증, 벤치마킹하여 다양한 하드웨어 환경에서 높은 성능을 달성합니다.
FlashRT는 Qwen3-Omni 텍스트-오디오 추론에서 전문가 vLLM-Omni 구현 대비 65% 응답 지연 감소를 보여주며, AMD MI355X GPU에서 더 높은 확장성을 제공합니다.