연구진이 실시간 멀티모달 앱 최적화를 위한 에이전트 하니스 FlashRT를 개발했어요. FlashRT는 코딩 에이전트를 활용해 개발자가 작성한 초기 구현체를 최적화된 멀티 GPU 배포로 전환합니다. 새로운 chain-of-program 패러다임을 통해 에이전트는 중간 표현(IR)을 생성하고, 검증하며, 정적 분석을 수행합니다.
FlashRT는 측정 기반 최적화 루프를 통해 후보 변환을 반복적으로 구현, 검증, 벤치마킹하여 지연 시간과 처리량 간 균형을 맞춘 효율적인 배포를 생성합니다. Qwen3-Omni 텍스트-오디오 추론에서 전문가 vLLM-Omni 구현 대비 65% 응답 지연 시간 감소 효과를 보였어요.
NVIDIA B200 GPU에서 최대 70배 지연 시간 감소, 2.8배 처리량 향상, AMD MI355X GPU에서는 최대 3.6배 처리량 향상 효과를 확인했어요. FlashRT는 에이전트 기반 최적화가 플랫폼에 따라 더 확장 가능함을 보여줍니다.