Bir .gguf dosyası indirdiniz de nasıl çalıştıracağınızı mı düşünüyorsunuz? En hızlı yol: ollama run hf.co/<repo>:Q4_K_M — Ollama GGUF’u doğrudan Hugging Face’ten çeker ve servis eder. GGUF, llama.cpp’nin ortaya çıkardığı ve artık her yerel LLM aracının konuştuğu tek dosyalık model formatıdır; aynı dosya Ollama, llama.cpp, LM Studio, Jan ve (istisnalarıyla) vLLM’de çalışır. Bu rehber her runner’ı kopyala-yapıştır komutlarla, VRAM’inize göre doğru kuantizasyonu seçmeyi ve gerçekten karşılaşacağınız yükleme hatalarını ele alır.
GGUF dosyası nedir?
GGUF (GGML Universal File), kuantize dil modelleri için bir kap formatıdır. Tek dosya ağırlıkları, tokenizer’ı ve model metadata’sını tutar — indirilecek başka bir şey yok, config çorbası yok. İçindeki ağırlıklar kuantizedir: 16-bit float’tan 4-bit (ya da altına) tam sayılara sıkıştırılmıştır; tam hassasiyette ~18 GB isteyen 9B’lik bir model bu sayede Q4 dosyası olarak ~5.5 GB’a sığar ve oyun GPU’sunda hatta CPU’da çalışır.
Bir GGUF dosyasının adında iki şey önemlidir:
- Temel model —
gemma-3-4b-it-GGUF, GGUF’a aktarılmış ince ayarlı bir Gemma 3 4B’dir. - Quant etiketi —
Q4_K_M,Q8_0,IQ4_XSve arkadaşları, ağırlıkların ne kadar agresif sıkıştırıldığını söyler. Seçim aşağıda.
Ollama GGUF modellerini çalıştırır mı?
Evet — GGUF, Ollama’nın doğal formatıdır ve 2024’ten beri dosyayla hiç uğraşmadan doğrudan Hugging Face’ten çekebilir:
# Bir GGUF quant'ı doğrudan Hugging Face'ten çekin ve sohbet edin
ollama run hf.co/bartowski/gemma-2-9b-it-GGUF:Q4_K_M
# İki noktanın ardından gelen quant etiketi, repo içindeki dosyayı seçer
ollama run hf.co/ggml-org/gemma-3-4b-it-GGUF:Q8_0 .gguf dosyasını kendiniz mi indirdiniz? Bir Modelfile ile ona işaret edin:
# Modelfile — tek satır yeter
FROM ./gemma-2-9b-it-Q4_K_M.gguf ollama create gemma9b -f Modelfile
ollama run gemma9b Ollama, GPU offload’a otomatik karar verir ve 11434 portunda OpenAI uyumlu bir API açar; o API’yi konuşan her şey modeli kullanabilir. Bedeli kontrol: kaç katmanın GPU’ya gideceğine siz karar vermezsiniz.
GGUF dosyasını llama.cpp’de nasıl çalıştırırsınız?
GGUF zaten llama.cpp’den çıktı — format onun için var — destek en derin ve en taze burada. llama-server ikili dosyası hem sohbet arayüzü hem OpenAI uyumlu endpoint verir:
# Hugging Face'ten doğrudan indirin (makinenize uyan GGUF'u seçer)
llama-server -hf ggml-org/gemma-3-4b-it-GGUF --port 8080
# Ya da elinizdeki dosyayı tam GPU offload ile çalıştırın
llama-server -m ./gemma-2-9b-it-Q4_K_M.gguf -ngl 99 --port 8080 -ngl 99, 99 katmanı GPU’ya iter; VRAM’inizin izin verdiğinden düşük ayarlarsanız kalan CPU’da kalır. O kısmi offload ayarı llama.cpp’nin kozudur — 9B’lik model, 48 katmanın 20’si offload’lı bir 6 GB kartta sorunsuz çalışır, sadece yavaş. Sunucu yerine tek seferlik prompt için llama-server yerine aynı -m flag’iyle llama-cli kullanın.
LM Studio, aynı motorun masaüstü GUI arkasıdır: .gguf dosyasını modeller klasörüne bırakın (ya da uygulama içinden Hugging Face’te arayın) ve yükle’ye tıklayın. Araç seçiminin kendisi için Ollama vs LM Studio karşılaştırması, modellerinizin altına hangisinin geleceğini kapsıyor.
Hangi GGUF kuantizasyonunu indirmelisiniz?
Varsayılan cevap: Q4_K_M. Topluluğun tatlı noktası — tam hassasiyetin bir iki yüzde kadar yakınında, kabaca dörtte bir boyutta. Merdiven, büyükten küçüğe:
- Q8_0 — kayıpsıza yakın; VRAM’iniz ağırlık başına 8.5 biti fark etmeden yutuyorsa kullanın.
- Q6_K / Q5_K_M — boyutta bir kademe aşağı, 30B+ modeller için hâlâ mükemmel.
- Q4_K_M — varsayılan. 7–14B modellerde kalite/GB zirvesi buradadır.
- IQ4_XS / Q3_K_M — büyük modeli küçük karta sıkıştırmak için; kalite kaybı hissedilir.
- Q2_K ve altı — son çare; model cümlenin ortasında saçmalamaya başlar.
Sığdırma kuralı: GB cinsinden dosya boyutu artı ~1–2 GB context üstü, VRAM’inize sığmalı. 9B’lik bir modelin 4.7 GB’lık Q4_K_M’si 8 GB’lık kartta rahattır. Korkunç bir quant’taki büyük model yerine yüksek quant’ta küçük modeli tercih edin — Q8 4B genelde Q2 9B’yi yener.
GGUF vs Safetensors: hangi formata ihtiyacınız var?
Safetensors, kuantize edilmemiş arşiv formatıdır — eğitim, ince ayar ve transformers, ComfyUI gibi araçlar için tam hassasiyetli ağırlıklar. GGUF, kendi donanımınızda çıkarım için kuantize ve çalıştırılabilir formattır. Bir GGUF’u ince ayarlayamazsınız; safetensors dosyasını da önce dönüştürmeden Ollama’da ya da llama.cpp’de çalıştıramazsınız (llama.cpp’deki convert_hf_to_gguf.py betiği tam bunun içindir). Kural: eğitim ya da görüntü hatları → safetensors; yerel sohbet ve servis → GGUF. Aramanız “gguf vs safetensors” olarak başladıysa, bu ayrım cevabın tamamıdır.
Hangi GGUF runner’ını kullanmalısınız?
| Runner | En iyi olduğu iş | Kurulum | GPU offload | OpenAI uyumlu API |
|---|---|---|---|---|
| Ollama | Kur ve unut servisi | curl tek satır | Otomatik | Var (:11434/v1) |
| llama.cpp | Maksimum kontrol, en yeni özellikler | Derleme ya da paket yöneticisi | Manuel -ngl ayarı | Var (llama-server) |
| LM Studio | Masaüstü GUI, model gezme | Uygulama indirme | Otomatik | Var (yerel sunucu) |
| vLLM | Toplu, çok kullanıcılı servis | pip install vllm | Otomatik | Var (doğal) |
Boot’ta çalışsın, göz önunda olmasın istiyorsanız Ollama — homelab‘ımda ağdaki her şeye model servis eden de bu. Özelliği çıktığı gün istiyorsanız (yeni mimariler önce oraya düşer) ya da katman düzeyinde bellek kontrolü istiyorsanız llama.cpp. GUI için LM Studio. vLLM yalnızca tek modelin çok sayıda eşzamanlı kullanıcıya servis etmesi gerekiyorsa — GGUF desteği çalışır ama doğal formatlarının yanında ikinci sınıftır.
GGUF modelim neden yüklenmiyor?
Çoğu durumu kapatan dört hata:
unknown model architecture— GGUF, runtime’ınızdan daha yeni bir mimari kullanıyor (yeni MoE ve vision modelleri sürekli düşüyor). Ollama’yı güncelleyin ya da llama.cpp’yi yeniden derleyin; başka çare yok.- Yüklemede bellek yetmedi — quant, VRAM’iniz artı context için fazla büyük. Bir kademe inin (
Q4_K_M→Q3_K_M),-ngl‘yi düşürün ya da context’i-c 4096ile küçültün. - İndirme yarıda kaldı / bozuk — GGUF yüklemesi magic-number ya da metadata hatası verir. Yeniden indirin ve Hugging Face sayfasında gösterilen SHA256 ile karşılaştırın.
ollama run ./model.ggufreddediyor — normaldir: Ollama’nınrun‘ı dosya yolu değil, model adı alır. Yukarıda gösterilen Modelfile yolunu kullanın.
Bilmeye değer son bir açı: yerel GGUF endpoint’i ajantik kodlama araçlarıyla iyi anlaşır — OpenAI uyumlu bir istemciyi çevirin, tamamlamaların bedeli elektriktir. Bu rehberdeki tesisat çalıştıktan sonra o yuvaya hangi modellerin layık olduğunu kodlama için en iyi yerel LLM’ler yazısı test etti.
— mrsaynothing
Get the next one by email
One email per post. No spam, no algorithms.
what is this?Git'te Fork'u Upstream ile Senkronize Etme: 3 Güvenli Yöntem
Yazıları beğendiniz mi? Ben geçim için böyle inşa ederim. beni işe al