Terug naar de blog

Kan vLLM GGUF draaien? Ja — alleen op GPU

23 september 2026

Vorige week vroeg een lezer waarom zijn GGUF-bestand faalt in vLLM op een machine zonder GPU, terwijl hetzelfde bestand in Ollama probleemloos draait. Kort antwoord, vóór alles anders: ja, vLLM kan GGUF draaien — via een officiële plugin, alleen op GPU. De plugin heet vllm-gguf-plugin, de syntax is repo:quant_type, en zodra je het op CPU probeert ben je buiten de tabel met ondersteunde hardware. Alles hieronder komt uit de vLLM-documentatie en de historie van de vllm-project/vllm-repo (92.000+ sterren sinds februari 2023) — uit de docs, niet van mijn testbank.

Hoe serveer je een GGUF-model met vLLM?

Twee stappen: installeer de plugin, en wijs vLLM naar het model. GGUF-ondersteuning woont niet meer in de kern van vLLM — de documentatie meldt dat het „is gemigreerd naar vllm-gguf-plugin”, dus een kale pip install vllm is niet genoeg:

uv pip install vllm-gguf-plugin

# Rechtstreeks van Hugging Face, in repo_id:quant_type-formaat:
vllm serve unsloth/Qwen3-0.6B-GGUF:Q4_K_M 
  --tokenizer Qwen/Qwen3-0.6B

# Of een al gedownload lokaal bestand:
vllm serve ./Qwen3-0.6B-Q4_K_M.gguf 
  --tokenizer Qwen/Qwen3-0.6B

De vlag --tokenizer is geen versiering. De officiële documentatie raadt de tokenizer van het basismodel aan, want de tokenizer-conversie vanuit GGUF is „tijdrovend en instabiel, vooral bij modellen met een groot vocabulaire”. Het overslaan is een vlag van één regel ruilen voor een lange, wispelturige start.

Twee gpu’s, één model: voeg --tensor-parallel-size 2 toe om hetzelfde GGUF over beide kaarten te verdelen — tensor-parallelisme werkt met GGUF net als met elk ander formaat.

Waarom weigert vLLM GGUF op CPU?

Dit is het deel dat verrast. De reputatie van GGUF is eerst CPU — het is het formaat waarop llama.cpp zijn naam bouwde, op laptops en Raspberry Pi’s. Binnen vLLM draait de situatie om. De officiële hardware-compatibiliteitstabel markeert GGUF zo:

HardwareGGUF in vLLM
NVIDIA Volta / Turing / Ampere / Ada / Hopperondersteund
AMD-gpuondersteund
Intel-gpuniet ondersteund
x86-cpuniet ondersteund
Arm-cpuniet ondersteund

Bron: vLLM-quantisatiedocs. De reden is architecturaal: de GGUF-route van vLLM dequantiseert blokken naar gpu-kernels die gebouwd zijn voor batchgewijs serveren. Er zit geen cpu-kernel achter — want vLLM is een serveringsengine, geen laptop-speeltje. Zonder gpu in de machine redt geen enkele vlag het — neem llama.cpp.

Wat breekt: de eerlijke lijst met grenzen

Dezelfde documentatiepagina draagt een waarschuwing die het waard is letterlijk te citeren: “GGUF-ondersteuning in vLLM is hoogst experimenteel en onder-geoptimaliseerd.” Concreet:

  • De quant-dekking is smaller dan bij llama.cpp. De K-quants die iedereen downloadt (Q4_K_M en vrienden) werken; exotische schema’s niet altijd. llama.cpp blijft de referentie-implementatie van het formaat.
  • De architectuurondersteuning loopt achteraan. Nieuwe modelfamilies landen eerst in llama.cpp; de plugin volgt later.
  • Geen lazy loading via mmap. llama.cpp mapt het bestand in het geheugen; vLLM laadt het als elke andere checkpoint.
  • Het is in de eerste plaats een geheugenvoetafdruk-functie. De docs kaderen GGUF als een manier om het VRAM-verbruik te drukken, niet als een throughput-gok.

Niets daarvan is verstopt. Alles staat in de eerste alinea van de officiële GGUF-pagina — eerlijker dan de meeste experimentele functies krijgen.

GGUF via vLLM of llama.cpp: wie wint?

Verschillende gereedschappen die hetzelfde bestand lezen:

vLLM + GGUFllama.cpp
CPU-inferentieneeja, eerste klas
Gelijktijdige gebruikerscontinuous batching, daarvoor gebouwdbeperkt
Quant-dekkingdeelverzameling, experimenteelde referentie
InstallatievLLM + pluginéén binary
Ideaal vooréén gpu, veel gebruikerséén gebruiker, elke hardware

Als je een model vanaf één gpu aan een team serveert, laat vLLM + GGUF je dezelfde Q4_K_M-bestanden hergebruiken die de rest van de local-LLM-wereld deelt — met meer keuze in onze GGUF-quantisatiegids. Voor de volledige enginevergelijking: llama.cpp vs Ollama en GGUF-modellen lokaal draaien.

De regel in één regel: hetzelfde bestand, tegengestelde instincten — llama.cpp behandelt GGUF als dé formaat, vLLM als een optie.

FAQ

Kan vLLM GGUF-modellen draaien?

Ja. Installeer vllm-gguf-plugin en serve met de repo:quant_type-syntax — maar alleen op GPU. De CPU-route van vLLM dekt GGUF niet.

Draait vLLM GGUF op CPU?

Nee. De officiële hardware-compatibiliteitstabel markeert GGUF als niet-ondersteund op x86- en Arm-cpu's — de CPU-route blijft bij llama.cpp of Ollama.

GGUF serveren met vLLM of llama.cpp?

vLLM als één GPU veel gelijktijdige gebruikers moet bedienen; llama.cpp als de machine geen GPU heeft of je de breedste quant-dekking wilt.

— mrsaynothing

— mrsaynothing

Veldnotities over AI, Linux en self-hosting.

De volgende how-to per e-mail

Eén e-mail per post. Fix het en ga door.

self-hosted · geen derden · uitschrijven met één klik

wat is dit?

128k context op desktop is gelogen. De KV-cache at het op.

Schrijf je dit met plezier? Dit bouw ik professioneel. huur me in