ब्लॉग पर वापस

GGUF मॉडल्स लोकली कैसे चलाएँ: Ollama, llama.cpp और vLLM

7 सितंबर 2026

.gguf फ़ाइल डाउनलोड की और सोच रहे हैं कि चलाएँ कैसे? सबसे तेज़ रास्ता: ollama run hf.co/<repo>:Q4_K_M — Ollama GGUF सीधे Hugging Face से खींचकर सर्व कर देता है। GGUF वह सिंगल-फ़ाइल मॉडल फ़ॉर्मैट है जिसे llama.cpp ने बनाया और जिसे अब हर लोकल-LLM टूल बोलता है — वही फ़ाइल Ollama, llama.cpp, LM Studio, Jan और (कुछ शर्तों पर) vLLM में चलती है। यह गाइड हर रनर को कॉपी-पेस्ट कमांड्स के साथ देखती है, आपकी VRAM के लिए सही क्वांटाइज़ेशन चुनने का तरीक़ा बताती है, और वे लोड एरर भी जो आपको सच में आएँगे।

GGUF फ़ाइल क्या होती है?

GGUF (GGML Universal File) क्वांटाइज़्ड भाषा मॉडलों का कंटेनर फ़ॉर्मैट है। एक फ़ाइल में weights, tokenizer और मॉडल मेटाडेटा — और डाउनलोड करने को कुछ नहीं, कोई कॉन्फ़िग का कीचड़ नहीं। अंदर के weights क्वांटाइज़्ड होते हैं: 16-बिट फ़्लोट से 4-बिट (या उससे भी कम) इंटीजर तक सिमटे हुए — इसीलिए फ़ुल प्रिसिज़न में ~18 GB चाहने वाला 9B मॉडल Q4 फ़ाइल की तरह ~5.5 GB में समट कर गेमिंग GPU पर, यहाँ तक कि CPU पर भी चल जाता है।

GGUF फ़ाइल के नाम में दो चीज़ें मायने रखती हैं:

  1. बेस मॉडलgemma-3-4b-it-GGUF मतलब Gemma 3 4B का फ़ाइन-ट्यून्ड रूप, GGUF में एक्सपोर्ट किया हुआ।
  2. quant टैगQ4_K_M, Q8_0, IQ4_XS और साथी बताते हैं कि weights को कितनी ज़ोर से सिमटाया गया। चुनने का तरीक़ा नीचे।

क्या Ollama GGUF मॉडल्स चला सकता है?

हाँ — GGUF Ollama का नेटिव फ़ॉर्मैट है, और 2024 से वह Hugging Face से सीधा pull कर सकता है, बिना आपने फ़ाइल को छुए:

# Hugging Face से सीधा GGUF quant खींचें और उससे चैट करें
ollama run hf.co/bartowski/gemma-2-9b-it-GGUF:Q4_K_M

# कोलन के बाद वाला quant tag रिपो के अंदर फ़ाइल चुनता है
ollama run hf.co/ggml-org/gemma-3-4b-it-GGUF:Q8_0

.gguf फ़ाइल ख़ुद डाउनलोड की हुई है? एक Modelfile उसकी तरफ़ मोड़ दीजिए:

# Modelfile — एक लाइन काफ़ी है
FROM ./gemma-2-9b-it-Q4_K_M.gguf
ollama create gemma9b -f Modelfile
ollama run gemma9b

Ollama GPU ऑफलोड ख़ुद तय करता है और पोर्ट 11434 पर OpenAI-compatible API देता है, तो वह API बोलने वाली हर चीज़ मॉडल का इस्तेमाल कर सकती है। सौदे की क़ीमत कंट्रोल है: आप नहीं चुनते कि कितनी लेयर्स GPU पर जाएँगी।

llama.cpp में GGUF फ़ाइल कैसे चलाएँ?

GGUF निकला ही llama.cpp से है — फ़ॉर्मैट उसी के लिए बना — तो सपोर्ट सबसे गहरा और सबसे ताज़ा यहीं है। llama-server बाइनरी एक साथ चैट UI और OpenAI-compatible endpoint दोनों देता है:

# Hugging Face से सीधा डाउनलोड (आपकी मशीन के लिए मिलता-जुलता GGUF चुन लेता है)
llama-server -hf ggml-org/gemma-3-4b-it-GGUF --port 8080

# या जो फ़ाइल पास है वही चलाएँ, पूरे GPU ऑफलोड के साथ
llama-server -m ./gemma-2-9b-it-Q4_K_M.gguf -ngl 99 --port 8080

-ngl 99 का मतलब है 99 लेयर्स GPU पर धकेलना; अपनी VRAM से ज़्यादा मत रखिए, बाक़ी CPU पर रह जाएगी। यही आंशिक-ऑफलोड का घुमाव llama.cpp की असली ताक़त है — 9B मॉडल 6 GB कार्ड पर ठीक चलता है जब 48 में से 20 लेयर्स ऑफलोड हों, बस थोड़ा धीमा। सर्वर की जगह एक बार का प्रॉम्प्ट चाहिए तो llama-server की जगह llama-cli लीजिए, -m फ़्लैग वही।

LM Studio उसी इंजन के पीछे डेस्कटॉप GUI है: .gguf फ़ाइल उसके models फ़ोल्डर में डालिए (या ऐप के अंदर Hugging Face खोजिए) और load दबाइए। टूलिंग के चुनाव के लिए Ollama vs LM Studio comparison बताती है कि मॉडल्स के नीचे कौन रखना है।

कौन-सी GGUF क्वांटाइज़ेशन डाउनलोड करें?

डिफ़ॉल्ट जवाब: Q4_K_M। यही कम्युनिटी का स्वीट स्पॉट है — फ़ुल-प्रिसिज़न क्वालिटी के एक-दो प्रतिशत के भीतर, साइज़ करीब एक चौथाई। सीढ़ी, सबसे बड़े से सबसे छोटे तक:

  • Q8_0 — लगभग बेनुक़सान; आपकी VRAM हर weight पर 8.5 बिट खा जाए और पता भी न चले, तो यही लीजिए।
  • Q6_K / Q5_K_M — साइज़ में एक सीढ़ी नीचे, 30B+ मॉडल्स के लिए अब भी शानदार।
  • Q4_K_M — डिफ़ॉल्ट। 7–14B मॉडल्स में quality-per-GB की चोटी यहीं है।
  • IQ4_XS / Q3_K_M — बड़े मॉडल को छोटे कार्ड पर ठूँसने के लिए; क्वालिटी का नुक़सान अब दिखने लगता है।
  • Q2_K और उससे नीचे — आख़िरी ज़रूरत पर; मॉडल वाक्य के बीच में बकवास में ढलने लगता है।

समटने का दस्तूर: फ़ाइल साइज़ GB में जमा करीब 1–2 GB context की ओवरहेड आपकी VRAM में समा जानी चाहिए। 9B मॉडल की 4.7 GB Q4_K_M 8 GB कार्ड पर आराम से बैठती है। बुरी quant वाला बड़ा मॉडल की जगह ऊँची quant वाला छोटा मॉडल चुनिए — Q8 का 4B आम तौर पर Q2 के 9B को हरा देता है।

GGUF vs Safetensors: आपको कौन-सा फ़ॉर्मैट चाहिए?

Safetensors अनक्वांटाइज़्ड आर्काइव फ़ॉर्मैट है — ट्रेनिंग, फ़ाइन-ट्यूनिंग और transformers, ComfyUI जैसे टूल्स के लिए फ़ुल-प्रिसिज़न weights। GGUF अपने हार्डवेयर पर इंफ़ेरेंस का क्वांटाइज़्ड, चलने लायक फ़ॉर्मैट है। GGUF को फ़ाइन-ट्यून नहीं कर सकते, और safetensors फ़ाइल Ollama या llama.cpp में बिना कन्वर्ट किए नहीं चलती (llama.cpp का convert_hf_to_gguf.py स्क्रिप्ट यही काम करता है)। नियम: ट्रेनिंग या इमेज पाइपलाइन → safetensors; लोकल चैट और सर्विंग → GGUF। अगर आपकी खोज “gguf vs safetensors” से शुरू हुई थी, तो यही बँटवारा पूरा जवाब है।

कौन-सा GGUF रनर इस्तेमाल करें?

रनरकिसके लिए बेस्टइंस्टॉलGPU ऑफलोडOpenAI-compatible API
Ollamaसेट करो और भूल जाओ वाली सर्विसcurl वन-लाइनरअपने-आपहाँ (:11434/v1)
llama.cppअधिकतम कंट्रोल, नए फ़ीचरबिल्ड या पैकेज मैनेजरमैन्युअल -ngl डायलहाँ (llama-server)
LM Studioडेस्कटॉप GUI, मॉडल ब्राउज़िंगऐप डाउनलोडअपने-आपहाँ (लोकल सर्वर)
vLLMबैच्ड मल्टी-यूज़र सर्विंगpip install vllmअपने-आपहाँ (नेटिव)

Ollama चुनिए अगर वह बूट पर चले और नज़र से ओझल रहे — मेरे homelab पर मॉडल्स नेटवर्क की हर चीज़ को यही सर्व करता है। llama.cpp चुनिए जब कोई फ़ीचर शिप होते ही दिन चाहिए (नए आर्किटेक्चर सबसे पहले यहीं आते हैं) या लेयर-स्तर की मेमोरी काबू चाहिए। GUI के लिए LM Studio। vLLM तभी जब एक मॉडल को कई सारे साथ-साथ यूज़र सर्व करने हों — उसका GGUF सपोर्ट चलता है पर नेटिव फ़ॉर्मैट के आगे दूसरे दर्जे का है।

मेरा GGUF मॉडल लोड क्यों नहीं हो रहा?

चार एरर जो ज़्यादातर मामलों को ढक लेते हैं:

  1. unknown model architecture — GGUF में ऐसी आर्किटेक्चर है जो आपके रनटाइम से नई है (नए MoE और विज़न मॉडल रोज़ आते हैं)। Ollama अपडेट कीजिए या llama.cpp दोबारा बिल्ड कीजिए; इलाज और कोई नहीं।
  2. लोड पर out of memory — quant आपकी VRAM जमा context के लिए बड़ा है। एक सीढ़ी नीचे उतरिए (Q4_K_MQ3_K_M), -ngl घटाइए, या context को -c 4096 से छोटा कीजिए।
  3. डाउनलोड अधूरा / ख़राब — GGUF लोड magic-number या मेटाडेटा एरर से फेल होता है। दोबारा डाउनलोड कीजिए और Hugging Face पेज पर दिखे SHA256 से मिलाइए।
  4. ollama run ./model.gguf इनकार करता है — उम्मीद के मुताबिक़: Ollama का run मॉडल नाम लेता है, फ़ाइल पाथ नहीं। ऊपर दिखाया गया Modelfile वाला रास्ता लीजिए।

आख़िरी नुक़ता जानने लायक: लोकल GGUF endpoint agentic कोडिंग टूल्स के साथ अच्छा जुड़ता है — OpenAI-compatible क्लाइंट उस पर मोड़ दीजिए और कंप्लीशन्स की क़ीमत सिर्फ़ बिजली है। इस गाइड की प्लंबिंग चल पड़ने के बाद कौन-से मॉडल्स उस सीट के लायक हैं, यह कोडिंग के लिए बेस्ट लोकल LLM ने टेस्ट किया है।

— mrsaynothing

Get the next one by email

One email per post. No spam, no algorithms.

self-hosted · no third parties · one-click unsubscribe

what is this?

Git fork को upstream से sync करें: 3 सुरक्षित तरीक़े

लेख पसंद आए? मैं पेशेवर रूप से ऐसे ही काम करता हूँ। मुझे हायर करें