Qwen Image를 로컬에서 실행할 때 가장 헷갈리는 부분은 “16GB VRAM에서도 돌아간다”는 말이다. 실제로 실행 자체는 가능할 수 있지만, 이것이 20GB가 넘는 모델 전체가 16GB VRAM 안에 들어간다는 뜻은 아니다.
기본 Qwen-Image FP8 diffusion model만 약 20.4GB이고 여기에 Qwen2.5-VL text encoder와 VAE도 함께 사용한다. 따라서 16GB급 GPU에서는 ComfyUI의 memory management와 system RAM으로 일부 데이터를 이동하는 과정이 실제 생성 속도에 큰 영향을 준다.
qwen image 로컬에서 가장 먼저 볼 변화
Qwen Image FP8도 16GB VRAM보다 크다
Qwen-Image의 BF16 diffusion model은 약 40.9GB이고 FP8 버전도 약 20.4GB다. FP8이 BF16보다 훨씬 작기는 하지만 16GB VRAM 한도보다 여전히 크다.
그래서 16GB GPU에서 FP8 Qwen Image를 실행할 때는 “FP8이므로 VRAM에 다 들어간다”고 생각하면 안 된다. 필요한 구성요소를 상황에 따라 GPU와 system memory 사이에서 이동시키는 과정이 발생할 수 있다.
text encoder도 별도로 메모리를 사용한다
Qwen Image에는 diffusion model만 있는 것이 아니다. Qwen-Image-2512 원본 배포본의 text encoder 디렉터리만 약 16.6GB에 이르고, ComfyUI에서는 이를 줄인 FP8 Qwen2.5-VL text encoder를 별도로 사용한다.
즉 로컬 환경에서 봐야 하는 것은 diffusion model 파일 하나의 크기가 아니다. diffusion model, text encoder, VAE와 생성 과정에서 필요한 메모리를 함께 고려해야 한다.

이 때문에 VRAM이 부족한 환경에서도 생성은 시작될 수 있지만 모델이 GPU에 계속 고정돼 있는 것은 아니다. 필요한 순간마다 다른 메모리 영역에서 불러오는 시간이 추가될 수 있다.
VRAM이 부족하면 RAM으로 offload될 수 있다
qwen image 로컬가 ComfyUI 워크플로우에 미치는 영향
ComfyUI는 큰 모델을 제한된 VRAM에서 다루기 위한 memory management를 제공한다. 모든 구성요소를 동시에 GPU에 올릴 수 없다면 일부 모델을 system RAM 쪽으로 옮겼다가 필요한 시점에 다시 GPU로 불러오는 방식이 사용될 수 있다.
기존 방식과 비교해야 할 부분
이 과정 덕분에 모델 파일 크기가 GPU VRAM보다 크다고 해서 곧바로 실행 불가능한 것은 아니다. 실제 커뮤니티에서도 12GB 또는 16GB VRAM 환경에서 Qwen Image FP8을 실행했다는 사례를 확인할 수 있다.
실행 가능과 빠른 실행은 다른 문제다
문제는 이동 비용이다. GPU에서 계산하는 시간 외에 CPU RAM과 VRAM 사이에서 모델 데이터를 옮기는 시간이 추가되기 때문이다.
그래서 같은 Qwen Image라도 24GB GPU와 16GB GPU의 차이가 단순히 OOM 발생 여부로만 나타나지 않는다. 생성은 되지만 첫 step에 들어가기까지 오래 기다리거나 모델이 교체될 때마다 시간이 크게 늘어나는 형태로 나타날 수도 있다.

Qwen Image 로컬 환경에서는 “에러 없이 Queue가 끝났으니 하드웨어가 충분하다”라고 판단하기보다 한 장을 반복 생성했을 때 시간이 어느 정도 유지되는지를 확인하는 것이 중요하다.
system RAM까지 부족하면 paging이 시작될 수 있다
VRAM에서 내려온 모델 데이터를 받아줄 system RAM에도 여유가 없다면 상황이 더 나빠질 수 있다.
성능과 결과 품질에서 확인할 차이
Windows에서는 메모리가 부족할 때 저장장치의 page file까지 사용될 수 있다. RAM보다 훨씬 느린 SSD나 다른 저장장치까지 데이터 이동 경로에 들어오면 GPU가 계산할 데이터를 기다리는 시간이 길어진다.
워크플로우 구성에서 놓치기 쉬운 부분
실제로 16GB VRAM과 16GB system RAM을 사용하는 Qwen 사용자 사례에서는 생성 중 RAM이 가득 차고 GPU 사용량은 낮은 상태에서 한 번의 생성에 매우 긴 시간이 걸리는 현상이 보고됐다.

이런 상황에서는 GPU 성능이 부족해서 느린 것처럼 보이지만 실제 병목은 GPU 계산이 아닐 수 있다. GPU가 데이터를 기다리는 동안 사용률이 낮게 나타날 수 있기 때문이다.
Task Manager에서 VRAM과 RAM을 같이 확인한다
Qwen Image 생성이 지나치게 느리다면 ComfyUI 설정을 무작정 바꾸기 전에 메모리 사용 상태를 확인하는 편이 빠르다.
Windows라면 Task Manager에서 GPU dedicated memory와 system memory를 동시에 확인할 수 있다. VRAM이 거의 가득 찬 상태에서 RAM까지 한계에 접근한다면 offloading 이후의 메모리 여유가 부족한 상황을 의심할 수 있다.
디스크 사용량까지 올라가면 paging을 확인한다
RAM이 거의 가득 찬 상태에서 page file이 위치한 디스크의 활동까지 크게 증가한다면 paging이 개입했는지도 확인할 필요가 있다.
실제로 적용할 때 체크할 점
이때는 sampler를 바꾸거나 프롬프트를 수정한다고 근본적인 메모리 병목이 사라지는 것은 아니다. 먼저 현재 모델 구성 전체가 시스템 메모리에 어느 정도 부담을 주고 있는지를 보는 편이 맞다.
반대로 VRAM과 RAM에 충분한 여유가 있는데 GPU 사용률만 비정상적으로 낮다면 workflow나 드라이버, 다른 설정을 별도로 점검해야 한다.
24GB에서도 Qwen Image는 가벼운 모델이 아니다
ComfyUI의 기본 Qwen-Image 테스트는 RTX 4090D 24GB를 기준으로 진행됐다. FP8 기본 모델의 VRAM 사용량은 해당 테스트에서 약 86%로 기록됐다.
첫 생성 시간은 약 94초, 두 번째 생성은 약 71초였다. 8-step acceleration LoRA를 사용했을 때도 VRAM 사용량은 약 86%였지만 생성 시간은 각각 약 55초와 34초로 줄었다.
이 수치는 24GB GPU에서도 Qwen Image가 메모리와 연산량 모두 가벼운 모델이 아니라는 점을 보여준다. 따라서 16GB 이하에서 실행할 때는 모델이 뜨는지만 볼 것이 아니라 offload가 실제 작업 속도에 어느 정도 영향을 주는지를 확인해야 한다.
Qwen Image를 16GB VRAM에서 로컬로 실행할 수 있느냐는 질문에는 단순한 가능·불가능으로 답하기 어렵다. FP8 diffusion model 자체가 약 20.4GB이므로 제한된 VRAM에서는 system RAM을 이용한 memory management가 실제 사용성에 중요해진다.
생성이 비정상적으로 느리다면 먼저 VRAM, system RAM, page file 사용량을 동시에 확인하는 것이 좋다. RAM까지 꽉 차면서 디스크 paging이 발생한다면 GPU를 바꾸기 전에 메모리 이동이 병목인지부터 구분해야 한다.