Eine .gguf-Datei heruntergeladen und du fragst dich, wie man sie tatsächlich ausführt? Der schnellste Weg: ollama run hf.co/<repo>:Q4_K_M — Ollama zieht das GGUF direkt von Hugging Face und serviert es. GGUF ist das Einzeldatei-Modellformat, das llama.cpp eingeführt hat und das heute jedes Local-LLM-Tool spricht — dieselbe Datei läuft in Ollama, llama.cpp, LM Studio, Jan und (mit Vorbehalten) vLLM. Dieser Guide deckt jeden Runner mit Copy-Paste-Befehlen ab, dazu, wie du die richtige Quantisierung für deinen VRAM wählst, und die Ladefehler, auf die du wirklich stoßen wirst.
Was ist eine GGUF-Datei?
GGUF (GGML Universal File) ist ein Containerformat für quantisierte Sprachmodelle. Eine Datei enthält die Gewichte, den Tokenizer und die Metadaten des Modells — nichts weiter herunterzuladen, keine Config-Suppe. Die Gewichte darin sind quantisiert: von 16-Bit-Floats auf 4-Bit-Integer (oder darunter) gepresst. Deshalb passt ein 9B-Modell, das in voller Präzision ~18 GB braucht, als Q4-Datei in ~5,5 GB und läuft auf einer Gaming-GPU oder sogar einer CPU.
An GGUF-Dateinamen zählen zwei Dinge:
- Das Basismodell —
gemma-3-4b-it-GGUFist ein feingetunter Gemma 3 4B, exportiert nach GGUF. - Das Quant-Tag —
Q4_K_M,Q8_0,IQ4_XSund Kollegen sagen, wie aggressiv die Gewichte gepresst wurden. Wie man eines wählt, steht unten.
Kann Ollama GGUF-Modelle ausführen?
Ja — GGUF ist Ollamas natives Format, und seit 2024 kann es eines direkt von Hugging Face ziehen, ohne dass du je eine Datei anfasst:
# GGUF-Quant direkt von Hugging Face ziehen und loschatten
ollama run hf.co/bartowski/gemma-2-9b-it-GGUF:Q4_K_M
# Das Quant-Tag nach dem Doppelpunkt wählt die Datei im Repo
ollama run hf.co/ggml-org/gemma-3-4b-it-GGUF:Q8_0 Schon selbst eine .gguf-Datei heruntergeladen? Richte ein Modelfile darauf:
# Modelfile — eine Zeile reicht
FROM ./gemma-2-9b-it-Q4_K_M.gguf ollama create gemma9b -f Modelfile
ollama run gemma9b Ollama entscheidet den GPU-Offload automatisch und stellt eine OpenAI-kompatible API auf Port 11434 bereit — alles, was diese API spricht, kann das Modell nutzen. Der Nachteil ist Kontrolle: Du wählst nicht, wie viele Layer auf die GPU gehen.
Wie führt man eine GGUF-Datei in llama.cpp aus?
llama.cpp ist der Ursprung von GGUF — das Format existiert dafür — also ist die Unterstützung am tiefsten und frischesten. Das Binary llama-server gibt dir beides: eine Chat-UI und einen OpenAI-kompatiblen Endpunkt:
# Direkt von Hugging Face laden (wählt ein passendes GGUF für deine Maschine)
llama-server -hf ggml-org/gemma-3-4b-it-GGUF --port 8080
# Oder eine vorhandene Datei ausführen, mit vollem GPU-Offload
llama-server -m ./gemma-2-9b-it-Q4_K_M.gguf -ngl 99 --port 8080 -ngl 99 schiebt 99 Layer auf die GPU; setzt du ihn niedriger, als dein VRAM erlaubt, bleibt der Rest auf der CPU. Dieser Partial-Offload-Regler ist llama.cpp’ Superkraft — ein 9B-Modell läuft auch auf einer 6-GB-Karte mit 20 von 48 Layern offloadet, nur eben langsamer. Für einmaliges Prompten statt eines Servers tausch llama-server gegen llama-cli bei gleichem -m-Flag.
LM Studio ist dieselbe Engine hinter einem Desktop-GUI: .gguf-Datei in den Models-Ordner werfen (oder Hugging Face in der App durchsuchen) und auf Laden klicken. Um die Werkzeugwahl selbst geht es im Ollama-vs-LM-Studio-Vergleich — welches Tool unter deine Modelle gehört.
Welche GGUF-Quantisierung solltest du herunterladen?
Die Standardantwort: Q4_K_M. Es ist der Community-Sweet-Spot — innerhalb von ein bis zwei Prozent der Volllastqualität bei rund einem Viertel der Größe. Die Leiter, von groß nach klein:
- Q8_0 — nahezu verlustfrei; nimm es, wenn dein VRAM 8,5 Bit pro Gewicht schluckt, ohne es zu merken.
- Q6_K / Q5_K_M — eine Stufe kleiner, für 30B+-Modelle weiterhin exzellent.
- Q4_K_M — der Standard. Bei 7–14B-Modellen liegt hier das Qualitätsmaximum pro GB.
- IQ4_XS / Q3_K_M — um ein großes Modell auf eine kleine Karte zu quetschen; der Qualitätsverlust wird spürbar.
- Q2_K und darunter — letzte Rettung; das Modell zerfällt irgendwann mitten im Satz in Unsinn.
Die Faustregel zum Reinfitten: Dateigröße in GB plus ~1–2 GB Kontext-Overhead sollte in deinen VRAM passen. Ein 4,7-GB-Q4_K_M eines 9B-Modells ist auf einer 8-GB-Karte bequem. Lieber ein kleineres Modell mit höherem Quant als ein größeres Modell mit katastrophalem Quant — ein Q8 4B schlägt meistens ein Q2 9B.
GGUF vs. Safetensors: Welches Format brauchst du?
Safetensors ist das unkuantisierte Archivformat — Volllast-Gewichte für Training, Fine-Tuning und Tools wie transformers und ComfyUI. GGUF ist das quantisierte, lauffähige Format für Inferenz auf deiner eigenen Hardware. Ein GGUF kannst du nicht feintunen, und eine Safetensors-Datei läuft in Ollama oder llama.cpp nicht ohne vorherige Konvertierung (dafür ist das Skript convert_hf_to_gguf.py in llama.cpp da). Faustregel: Training oder Bild-Pipelines → safetensors; lokaler Chat und Serving → GGUF. Lautete deine Suche „gguf vs safetensors”, ist diese Aufteilung die ganze Antwort.
Welchen GGUF-Runner solltest du nehmen?
| Runner | Am besten für | Installation | GPU-Offload | OpenAI-kompatible API |
|---|---|---|---|---|
| Ollama | Einrichten und vergessen | curl-Einzeiler | Automatisch | Ja (:11434/v1) |
| llama.cpp | Maximale Kontrolle, neueste Features | Selbst bauen oder Paketmanager | Manueller -ngl-Regler | Ja (llama-server) |
| LM Studio | Desktop-GUI, Modell-Browsing | App-Download | Automatisch | Ja (lokaler Server) |
| vLLM | Gebatchtes Multi-User-Serving | pip install vllm | Automatisch | Ja (nativ) |
Nimm Ollama, wenn es beim Boot laufen und aus dem Blick verschwinden soll — so nutze ich es auf meinem Homelab, um Modelle für alles im Netzwerk bereitzustellen. Nimm llama.cpp, wenn du ein Feature am Tag des Erscheinens brauchst (neue Architekturen landen dort zuerst) oder Speicher auf Layer-Ebene kontrollieren willst. Nimm LM Studio für ein GUI. Nimm vLLM nur, wenn ein Modell viele gleichzeitige Nutzer bedienen muss — sein GGUF-Support funktioniert, bleibt aber Zweite Klasse neben seinen nativen Formaten.
Warum lädt mein GGUF-Modell nicht?
Die vier Fehler, die die meisten Fälle abdecken:
unknown model architecture— das GGUF nutzt eine Architektur, die älter ist als deine Runtime (neue MoE- und Vision-Modelle kommen ständig dazu). Aktualisiere Ollama oder baue llama.cpp neu; einen anderen Fix gibt es nicht.- Out of memory beim Laden — der Quant ist zu groß für deinen VRAM plus Kontext. Geh eine Sprosse runter (
Q4_K_M→Q3_K_M), senk-ngloder schrumpf den Kontext mit-c 4096. - Download abgeschnitten / korrupt — das GGUF-Laden scheitert mit einem Magic-Number- oder Metadaten-Fehler. Lade neu und vergleiche den SHA256 von der Hugging-Face-Seite.
ollama run ./model.ggufweigert sich — zu erwarten: Ollamasrunnimmt Modellnamen, keine Dateipfade. Nutze den Modelfile-Weg von oben.
Ein letzter Blickwinkel, der sich lohnt: Ein lokaler GGUF-Endpunkt passt gut zu agentic Coding-Tools — richtest du einen OpenAI-kompatiblen Client darauf, kosten Completions nur Strom. Welche Modelle den Slot verdienen, sobald die Verkabelung aus diesem Guide steht, hat der Post Beste lokale LLMs zum Coden getestet.
— mrsaynothing
Get the next one by email
One email per post. No spam, no algorithms.
what is this?Git-Fork mit Upstream syncen: 3 sichere Methoden
Sie mögen die Artikel? Genau so baue ich beruflich. anheuern