.gguf फ़ाइल डाउनलोड की और सोच रहे हैं कि चलाएँ कैसे? सबसे तेज़ रास्ता: ollama run hf.co/<repo>:Q4_K_M — Ollama GGUF सीधे Hugging Face से खींचकर सर्व कर देता है। GGUF वह सिंगल-फ़ाइल मॉडल फ़ॉर्मैट है जिसे llama.cpp ने बनाया और जिसे अब हर लोकल-LLM टूल बोलता है — वही फ़ाइल Ollama, llama.cpp, LM Studio, Jan और (कुछ शर्तों पर) vLLM में चलती है। यह गाइड हर रनर को कॉपी-पेस्ट कमांड्स के साथ देखती है, आपकी VRAM के लिए सही क्वांटाइज़ेशन चुनने का तरीक़ा बताती है, और वे लोड एरर भी जो आपको सच में आएँगे।
GGUF फ़ाइल क्या होती है?
GGUF (GGML Universal File) क्वांटाइज़्ड भाषा मॉडलों का कंटेनर फ़ॉर्मैट है। एक फ़ाइल में weights, tokenizer और मॉडल मेटाडेटा — और डाउनलोड करने को कुछ नहीं, कोई कॉन्फ़िग का कीचड़ नहीं। अंदर के weights क्वांटाइज़्ड होते हैं: 16-बिट फ़्लोट से 4-बिट (या उससे भी कम) इंटीजर तक सिमटे हुए — इसीलिए फ़ुल प्रिसिज़न में ~18 GB चाहने वाला 9B मॉडल Q4 फ़ाइल की तरह ~5.5 GB में समट कर गेमिंग GPU पर, यहाँ तक कि CPU पर भी चल जाता है।
GGUF फ़ाइल के नाम में दो चीज़ें मायने रखती हैं:
- बेस मॉडल —
gemma-3-4b-it-GGUFमतलब Gemma 3 4B का फ़ाइन-ट्यून्ड रूप, GGUF में एक्सपोर्ट किया हुआ। - quant टैग —
Q4_K_M,Q8_0,IQ4_XSऔर साथी बताते हैं कि weights को कितनी ज़ोर से सिमटाया गया। चुनने का तरीक़ा नीचे।
क्या Ollama GGUF मॉडल्स चला सकता है?
हाँ — GGUF Ollama का नेटिव फ़ॉर्मैट है, और 2024 से वह Hugging Face से सीधा pull कर सकता है, बिना आपने फ़ाइल को छुए:
# Hugging Face से सीधा GGUF quant खींचें और उससे चैट करें
ollama run hf.co/bartowski/gemma-2-9b-it-GGUF:Q4_K_M
# कोलन के बाद वाला quant tag रिपो के अंदर फ़ाइल चुनता है
ollama run hf.co/ggml-org/gemma-3-4b-it-GGUF:Q8_0 .gguf फ़ाइल ख़ुद डाउनलोड की हुई है? एक Modelfile उसकी तरफ़ मोड़ दीजिए:
# Modelfile — एक लाइन काफ़ी है
FROM ./gemma-2-9b-it-Q4_K_M.gguf ollama create gemma9b -f Modelfile
ollama run gemma9b Ollama GPU ऑफलोड ख़ुद तय करता है और पोर्ट 11434 पर OpenAI-compatible API देता है, तो वह API बोलने वाली हर चीज़ मॉडल का इस्तेमाल कर सकती है। सौदे की क़ीमत कंट्रोल है: आप नहीं चुनते कि कितनी लेयर्स GPU पर जाएँगी।
llama.cpp में GGUF फ़ाइल कैसे चलाएँ?
GGUF निकला ही llama.cpp से है — फ़ॉर्मैट उसी के लिए बना — तो सपोर्ट सबसे गहरा और सबसे ताज़ा यहीं है। llama-server बाइनरी एक साथ चैट UI और OpenAI-compatible endpoint दोनों देता है:
# Hugging Face से सीधा डाउनलोड (आपकी मशीन के लिए मिलता-जुलता GGUF चुन लेता है)
llama-server -hf ggml-org/gemma-3-4b-it-GGUF --port 8080
# या जो फ़ाइल पास है वही चलाएँ, पूरे GPU ऑफलोड के साथ
llama-server -m ./gemma-2-9b-it-Q4_K_M.gguf -ngl 99 --port 8080 -ngl 99 का मतलब है 99 लेयर्स GPU पर धकेलना; अपनी VRAM से ज़्यादा मत रखिए, बाक़ी CPU पर रह जाएगी। यही आंशिक-ऑफलोड का घुमाव llama.cpp की असली ताक़त है — 9B मॉडल 6 GB कार्ड पर ठीक चलता है जब 48 में से 20 लेयर्स ऑफलोड हों, बस थोड़ा धीमा। सर्वर की जगह एक बार का प्रॉम्प्ट चाहिए तो llama-server की जगह llama-cli लीजिए, -m फ़्लैग वही।
LM Studio उसी इंजन के पीछे डेस्कटॉप GUI है: .gguf फ़ाइल उसके models फ़ोल्डर में डालिए (या ऐप के अंदर Hugging Face खोजिए) और load दबाइए। टूलिंग के चुनाव के लिए Ollama vs LM Studio comparison बताती है कि मॉडल्स के नीचे कौन रखना है।
कौन-सी GGUF क्वांटाइज़ेशन डाउनलोड करें?
डिफ़ॉल्ट जवाब: Q4_K_M। यही कम्युनिटी का स्वीट स्पॉट है — फ़ुल-प्रिसिज़न क्वालिटी के एक-दो प्रतिशत के भीतर, साइज़ करीब एक चौथाई। सीढ़ी, सबसे बड़े से सबसे छोटे तक:
- Q8_0 — लगभग बेनुक़सान; आपकी VRAM हर weight पर 8.5 बिट खा जाए और पता भी न चले, तो यही लीजिए।
- Q6_K / Q5_K_M — साइज़ में एक सीढ़ी नीचे, 30B+ मॉडल्स के लिए अब भी शानदार।
- Q4_K_M — डिफ़ॉल्ट। 7–14B मॉडल्स में quality-per-GB की चोटी यहीं है।
- IQ4_XS / Q3_K_M — बड़े मॉडल को छोटे कार्ड पर ठूँसने के लिए; क्वालिटी का नुक़सान अब दिखने लगता है।
- Q2_K और उससे नीचे — आख़िरी ज़रूरत पर; मॉडल वाक्य के बीच में बकवास में ढलने लगता है।
समटने का दस्तूर: फ़ाइल साइज़ GB में जमा करीब 1–2 GB context की ओवरहेड आपकी VRAM में समा जानी चाहिए। 9B मॉडल की 4.7 GB Q4_K_M 8 GB कार्ड पर आराम से बैठती है। बुरी quant वाला बड़ा मॉडल की जगह ऊँची quant वाला छोटा मॉडल चुनिए — Q8 का 4B आम तौर पर Q2 के 9B को हरा देता है।
GGUF vs Safetensors: आपको कौन-सा फ़ॉर्मैट चाहिए?
Safetensors अनक्वांटाइज़्ड आर्काइव फ़ॉर्मैट है — ट्रेनिंग, फ़ाइन-ट्यूनिंग और transformers, ComfyUI जैसे टूल्स के लिए फ़ुल-प्रिसिज़न weights। GGUF अपने हार्डवेयर पर इंफ़ेरेंस का क्वांटाइज़्ड, चलने लायक फ़ॉर्मैट है। GGUF को फ़ाइन-ट्यून नहीं कर सकते, और safetensors फ़ाइल Ollama या llama.cpp में बिना कन्वर्ट किए नहीं चलती (llama.cpp का convert_hf_to_gguf.py स्क्रिप्ट यही काम करता है)। नियम: ट्रेनिंग या इमेज पाइपलाइन → safetensors; लोकल चैट और सर्विंग → GGUF। अगर आपकी खोज “gguf vs safetensors” से शुरू हुई थी, तो यही बँटवारा पूरा जवाब है।
कौन-सा GGUF रनर इस्तेमाल करें?
| रनर | किसके लिए बेस्ट | इंस्टॉल | GPU ऑफलोड | OpenAI-compatible API |
|---|---|---|---|---|
| Ollama | सेट करो और भूल जाओ वाली सर्विस | curl वन-लाइनर | अपने-आप | हाँ (:11434/v1) |
| llama.cpp | अधिकतम कंट्रोल, नए फ़ीचर | बिल्ड या पैकेज मैनेजर | मैन्युअल -ngl डायल | हाँ (llama-server) |
| LM Studio | डेस्कटॉप GUI, मॉडल ब्राउज़िंग | ऐप डाउनलोड | अपने-आप | हाँ (लोकल सर्वर) |
| vLLM | बैच्ड मल्टी-यूज़र सर्विंग | pip install vllm | अपने-आप | हाँ (नेटिव) |
Ollama चुनिए अगर वह बूट पर चले और नज़र से ओझल रहे — मेरे homelab पर मॉडल्स नेटवर्क की हर चीज़ को यही सर्व करता है। llama.cpp चुनिए जब कोई फ़ीचर शिप होते ही दिन चाहिए (नए आर्किटेक्चर सबसे पहले यहीं आते हैं) या लेयर-स्तर की मेमोरी काबू चाहिए। GUI के लिए LM Studio। vLLM तभी जब एक मॉडल को कई सारे साथ-साथ यूज़र सर्व करने हों — उसका GGUF सपोर्ट चलता है पर नेटिव फ़ॉर्मैट के आगे दूसरे दर्जे का है।
मेरा GGUF मॉडल लोड क्यों नहीं हो रहा?
चार एरर जो ज़्यादातर मामलों को ढक लेते हैं:
unknown model architecture— GGUF में ऐसी आर्किटेक्चर है जो आपके रनटाइम से नई है (नए MoE और विज़न मॉडल रोज़ आते हैं)। Ollama अपडेट कीजिए या llama.cpp दोबारा बिल्ड कीजिए; इलाज और कोई नहीं।- लोड पर out of memory — quant आपकी VRAM जमा context के लिए बड़ा है। एक सीढ़ी नीचे उतरिए (
Q4_K_M→Q3_K_M),-nglघटाइए, या context को-c 4096से छोटा कीजिए। - डाउनलोड अधूरा / ख़राब — GGUF लोड magic-number या मेटाडेटा एरर से फेल होता है। दोबारा डाउनलोड कीजिए और Hugging Face पेज पर दिखे SHA256 से मिलाइए।
ollama run ./model.ggufइनकार करता है — उम्मीद के मुताबिक़: Ollama काrunमॉडल नाम लेता है, फ़ाइल पाथ नहीं। ऊपर दिखाया गया Modelfile वाला रास्ता लीजिए।
आख़िरी नुक़ता जानने लायक: लोकल GGUF endpoint agentic कोडिंग टूल्स के साथ अच्छा जुड़ता है — OpenAI-compatible क्लाइंट उस पर मोड़ दीजिए और कंप्लीशन्स की क़ीमत सिर्फ़ बिजली है। इस गाइड की प्लंबिंग चल पड़ने के बाद कौन-से मॉडल्स उस सीट के लायक हैं, यह कोडिंग के लिए बेस्ट लोकल LLM ने टेस्ट किया है।
— mrsaynothing
Get the next one by email
One email per post. No spam, no algorithms.
what is this?Git fork को upstream से sync करें: 3 सुरक्षित तरीक़े
लेख पसंद आए? मैं पेशेवर रूप से ऐसे ही काम करता हूँ। मुझे हायर करें