사용자가 Jarvis 시스템의 주요 구성 요소를 공유했어요. ASR은 Whisper, TTS는 Qwen, 비전은 Qwen3-VL을 사용하며, 이미지 생성은 Z-Image-Turbo와 Krea2를 활용해요. 이미지 편집은 Flux-Klein, 음악은 AceStep, 영상은 Bernini를 사용하고, LLM과 AI 에이전트는 최고 등급으로 평가했어요.
다양한 diffusion 모델, VAE, text encoder, LoRA를 필요에 따라 사용하며, 주로 위 구성 요소를 지속적으로 활용하고 있어요. Reddit 사용자가 자신의 Jarvis 시스템 구성을 공유하며, 다른 사용자들의 의견을 구하고 있어요.