ब्लॉग पर वापस

कोडिंग के लिए बेस्ट लोकल LLM: 8GB–24GB VRAM के हिसाब से चुनाव

4 सितंबर 2026

अभी कोडिंग के लिए बेस्ट लोकल LLM: 24 GB कार्ड पर Qwen3 Coder 30B A3B, 12–16 GB पर Q4 में Qwen2.5 Coder 14B, और 8 GB पर Q4 में Qwen2.5 Coder 7B। ये सब पूरी तरह ऑफ़लाइन चलते हैं, असली कोड का ऑटोकंप्लीट और रिफ़ैक्टर करते हैं, और per-token कुछ ख़र्च नहीं करते। अगर आपके GPU में मॉडल की ज़रूरत से कम VRAM है, तो मॉडल छोटा करने से पहले एक नोच quant घटा लीजिए। यह गाइड मॉडल्स को VRAM ब्रैकेट से मिलाती है, उन दो कोडिंग फ़ैमिलीज़ की तुलना करती है जिन पर लोग सच में बहस करते हैं, और चलाने लायक कमांड्स पर ख़त्म होती है — ताकि करीब पाँच मिनट में आप लोकली कोड जनरेट करने लगें।

आपके GPU पर कोडिंग के लिए कौन-सा लोकल LLM इस्तेमाल करें?

पहले VRAM से चुनिए, फिर मॉडल से — मॉडल तभी समटा है जब weights जमा context भी मेमोरी में समा जाएँ। 2026 के कम्युनिटी बेंचमार्क और रोज़मर्रा के इस्तेमाल में यही शॉर्टलिस्ट बार-बार ऊपर आती है:

VRAMमॉडलQuantडिस्क पर weightsयह इस ब्रैकेट में क्यों जीतता है
8 GBQwen2.5 Coder 7B InstructQ4_K_M~4.7 GBऑटोकंप्लीट और छोटे रिफ़ैक्टर के लिए tokens-per-second-से-क्वालिटी का सबसे अच्छा अनुपात
12 GBQwen2.5 Coder 14B InstructQ4_K_M~9.0 GBपूरी-फ़ाइल एडिट context में समा जाते हैं; 3060-क्लास कार्ड पर फिर भी 30+ tok/s
16 GBQwen3 14B या gpt-oss-20bQ4_K_M~9–12 GBअस्पष्ट स्पेक्स पर बेहतर reasoning; 4090-क्लास कार्ड्स इसे तेज़ भी रखते हैं
24 GBQwen3 Coder 30B A3BQ4_K_M~18.6 GBMoE: हर टोकन पर सिर्फ़ ~3B पैरामीटर एक्टिव, इसलिए स्पीड इस्तेमाल लायक रहती है

दो नियम इस टेबल को अमल में काम करने देते हैं:

  1. KV cache के लिए 1–2 GB VRAM हेडरूम छोड़िए। Q4 में 14B मॉडल जमा 8K-टोकन context 10 GB के बजट में नहीं समटा — context भी कुल हिसाब में गिनता है।
  2. मॉडल साइज़ घटाने से पहले एक quant नीचे जाइए। Q5/Q4 क्वांट क्वालिटी का कुछ प्रतिशत ही खाते हैं; 14B की जगह 7B इससे कहीं ज़्यादा खाता है।

लोकल कोडिंग LLM के लिए कितनी VRAM चाहिए?

ईमानदार अनुमान: चाहिए लगभग = क्वांटाइज़्ड weights + 8-bit KV cache पर हर 1K टोकन context के लिए 0.125 GB। सीधे नंबरों में:

  • 8 GB — Q4 में 7B–8B मॉडल आराम से चलते हैं। ऑटोकंप्लीट-लंबाई के जवाब और 4K–8K context की उम्मीद रखिए।
  • 12 GB — Q4 में 14B के लिए स्वीट स्पॉट — मॉडल जमा एक ठीक-ठाक 8K–16K कोडिंग context के लिए काफ़ी जगह।
  • 16 GB — 20B-क्लास डेंस मॉडल्स और Qwen3 14B लंबे context के साथ खुलते हैं।
  • 24 GB — Q4 में Qwen3 Coder 30B A3B MoE चलता है, जो ख़ुद होस्ट किए जा सकने वाले सबसे क्लाउड-क्वालिटी कोडिंग मॉडल के क़रीब है।

सिर्फ़ CPU? चलता है — llama.cpp लैपटॉप CPU पर 7B Q4 को 5–10 tok/s पर ख़ुशी-ख़ुशी चला देता है — पर उसे रोज़ का ड्राइवर नहीं, सब्र की कसरत समझिए। रनटाइम इंस्टॉल करने के टूलिंग पक्ष के लिए Ollama vs LM Studio comparison बताती है कि मॉडल्स के नीचे कौन-सा लोकल LLM टूल रखें।

Qwen3 Coder vs DeepSeek: कोडिंग के लिए कौन बेहतर?

यही मुक़ाबला ऑटोकंप्लीट बार्स सच में पूछते हैं, और जवाब साफ़ दो हिस्सों में बँटता है:

  • Qwen3 Coder (30B A3B) एडिट लूप के लिए बना है: टूल कॉलिंग के लिए इंस्ट्रक्शन-फ़ॉर्मैट कन्वेंशन मानता है, एक जैसे डिफ़ बनाता है, और — तय करने वाली बात — MoE डिज़ाइन की वजह से हर टोकन पर सिर्फ़ ~3B पैरामीटर एक्टिव होते हैं, तो एक 24 GB कार्ड 40–60 tok/s देता है। IDE-स्टाइल इस्तेमाल में जवाबदेही ही क्वालिटी है।
  • DeepSeek V3/R1 लाइन ऊँचे दर्ज़े पर बहस करती है: आर्किटेक्चर फ़ैसले, उलझे एल्गोरिद्म, बहु-चरण reasoning। पर फ़्लैगशिप 600B+ पैरामीटर का है; लोकली आप उसे सिर्फ़ भारी क्वांटाइज़्ड रूप में, multi-GPU या Mac यूनिफ़ाइड-मेमोरी सेटअप पर चला पाते हैं, और वह कोड से ज़्यादा तेज़ कोड के बारे में गद्य लिखता है।

लोकल चुनाव: रोज़ के काम के लिए Qwen3 Coder, DeepSeek तभी जब आपके पास उसे लगभग-फ़ुल-प्रिसिज़न होस्ट करने वाला हार्डवेयर हो। 8–16 GB पर यह बहस ही बेमानी है — Qwen2.5/3 Coder मॉडल्स ही सबसे ताक़तवर चीज़ हैं जो समा जाती है।

Ollama के साथ कोडिंग का बेस्ट लोकल LLM कैसे चलाएँ?

पाँच कमांड्स — शून्य से वह OpenAI-compatible API तक जिसे आपका एडिटर इस्तेमाल कर सके:

# 1. Ollama इंस्टॉल करें (Linux)
curl -fsSL https://ollama.com/install.sh | sh

# 2. अपनी VRAM वाले ब्रैकेट का मॉडल पुल करें (यहाँ 8 GB कार्ड दिखाया गया है)
ollama pull qwen2.5-coder:7b

# 3. इंटरैक्टिव तरीक़े से चैट करें
ollama run qwen2.5-coder:7b

# 4. किसी भी टूल से इसे OpenAI-compatible API की तरह इस्तेमाल करें
curl http://localhost:11434/v1/chat/completions 
  -d '{
    "model": "qwen2.5-coder:7b",
    "messages": [{"role": "user", "content": "Refactor this fn to be async: add(a,b){return a+b}"}]
  }'

# 5. OPENAI_BASE_URL चाहने वाले टूल्स को इसकी तरफ़ मोड़ें
export OPENAI_BASE_URL=http://localhost:11434/v1

कोई API key नहीं, कोई rate limit नहीं, कोई per-token बिल नहीं। Linux पर इंस्टॉलर एक systemd यूनिट रजिस्टर करता है, तो सर्वर कभी बिगड़े तो journalctl बता देगा क्यों — सर्विस डिबगिंग के सटीक फ़िल्टर journalctl cheat sheet में हैं।

क्या लोकल LLM असली कोडिंग काम के लिए काफ़ी अच्छा है?

एडिट लूप के लिए हाँ, कठिन मसलों के लिए नहीं — और यही बँटवारा इसके इस्तेमाल का सही तरीक़ा है। 14B–30B का लोकल मॉडल रिफ़ैक्टर, बॉयलरप्लेट, टेस्ट स्कैफ़ोल्डिंग, regex और “यह लेगेसी फ़ंक्शन समझाइए” जैसे काम ज़्यादातर क्लाउड API के राउंड-ट्रिप से ज़्यादा तेज़ निपटा देता है। जहाँ वह बड़े होस्टेड मॉडल्स से हारता है वह है लंबी बहु-फ़ाइल reasoning और दुर्लभ फ़्रेमवर्क बातें — 30B मॉडल frontier मॉडल से सचमुच कम जानता है।

चलने वाला वर्कफ़्लो: अपनी 90% कीस्ट्रोक्स के लिए एक लोकल मॉडल चालू रखिए, और उखड़े हुए डिज़ाइन सवालों के लिए ही होस्टेड frontier मॉडल तक हाथ बढ़ाइए। रोज़ के काम के लिए आपका कोड मशीन छोड़ता ही नहीं — क्लाइंट कोड के लिए यह बात मायने रखती है — और जिस VRAM की आप पहले से मालकिन हैं, वह चुपचाप एक सब्सक्रिप्शन की जगह ले लेती है।

— mrsaynothing

Get the next one by email

One email per post. No spam, no algorithms.

self-hosted · no third parties · one-click unsubscribe

what is this?

Git undo last commit: बदलाव सुरक्षित रखने का सही तरीका

लेख पसंद आए? मैं पेशेवर रूप से ऐसे ही काम करता हूँ। मुझे हायर करें