العودة إلى المدونة

أفضل LLM محلي للبرمجة: خيارات من 8 إلى 24 جيجابايت VRAM

4 سبتمبر 2026

أفضل LLM محلي للبرمجة اليوم هو Qwen3 Coder 30B A3B على بطاقة 24 جيجابايت، وQwen2.5 Coder 14B بضغط Q4 على 12–16 جيجابايت، وQwen2.5 Coder 7B بضغط Q4 على 8 جيجابايت. كلها تعمل دون اتصال كاملًا، وتُكمل الكود وتعيد هيكلته فعلًا، ولا تكلف شيئًا لكل token. إذا كانت VRAM بطاقتك أقل من حاجة النموذج، فأنزل درجة الضغط درجة قبل أن تنزل في حجم النموذج. هذا الدليل يطابق النماذج بفئات VRAM، ويقارن عائلتي البرمجة التي يجادل فيها الناس فعلًا، وينتهي بأوامر جاهزة لتوليد الكود محليًا خلال نحو خمس دقائق.

أي LLM محلي تستخدمه للبرمجة على GPU لديك؟

اختر بـ VRAM أولًا ثم النموذج — فالنموذج لا يتسع إلا إذا احتلت الأوزان والسياق معًا الذاكرة. هذه هي القائمة التي تتصدر مقاييس المجتمع عام 2026 والاستخدام اليومي:

VRAMالنموذجالضغطالأوزان على القرصلماذا يفوز في هذه الفئة
8 GBQwen2.5 Coder 7B InstructQ4_K_M~4.7 GBأفضل نسبة tokens/ثانية إلى جودة للإكمال التلقائي وإعادة الهيكلة الصغيرة
12 GBQwen2.5 Coder 14B InstructQ4_K_M~9.0 GBتعديل الملفات كاملة يتسع في السياق؛ و30+ token/ثانية على بطاقة من فئة 3060
16 GBQwen3 14B أو gpt-oss-20bQ4_K_M~9–12 GBاستدلال أفضل مع المواصفات الملتبسة؛ بطاقات فئة 4090 تبقيه سريعًا
24 GBQwen3 Coder 30B A3BQ4_K_M~18.6 GBMoE: نحو 3B بارامترات نشطة فقط لكل token، فتبقى السرعة قابلة للاستخدام

قاعدتان تجعلان الجدول يعمل عمليًا:

  1. اترك هامش 1–2 جيجابايت من VRAM لـ KV cache. نموذج 14B بضغط Q4 مع سياق 8K token لن يتسع في ميزانية 10 جيجابايت — السياق يُحسب ضمن المجموع.
  2. انزل درجة ضغط قبل أن تنزل حجم نموذج. ضغط Q5/Q4 يكلف نسبة قليلة من الجودة؛ أما 7B بدل 14B فيكلف أكثر من ذلك بكثير.

كم جيجابايت VRAM تحتاج لـ LLM برمجة محلي؟

القاعدة الصادقة: VRAM المطلوبة ≈ الأوزان المضغوطة + 0.125 جيجابايت لكل 1K token من السياق عند KV cache بـ 8 بت. بأرقام مكشوفة:

  • 8 GB تشغّل نماذج 7B–8B بضغط Q4 براحة. توقّع إجابات بطول الإكمال التلقائي، وسياق 4K–8K.
  • 12 GB هي البقعة الحلوة لـ 14B بضغط Q4 — مساحة للنموذج مع سياق برمجة واقعي 8K–16K.
  • 16 GB تفتح نماذج مكثفة من فئة 20B وQwen3 14B بسياق أطول.
  • 24 GB تشغّل Qwen3 Coder 30B A3B من نوع MoE بضغط Q4، وهي أقرب شيء لنموذج برمجة بجودة السحابة يمكنك استضافته بنفسك.

بلا GPU؟ يعمل — llama.cpp يشغّل 7B بضغط Q4 على معالج حاسوب محمول بسرعة 5–10 token/ثانية — لكن اعتبره تمرين صبر لا أداة يومية. ولجانب الأدوات، تغطي مقارنة Ollama مع LM Studio أي أداة محلية تضع تحت نماذجك.

Qwen3 Coder مقابل DeepSeek: أيهما أفضل للبرمجة؟

هذه هي المواجهة التي تسأل عنها أشرطة الإكمال التلقائي فعلًا، والإجابة تنقسم بوضوح:

  • Qwen3 Coder (30B A3B) مبني لحلقة التعديل: يلتزم اصطلاحات صيغة التعليمات لاستدعاء الأدوات، وينتج فروقات متسقة، والجزء الحاسم أن تصميم MoE يعني نحو 3B بارامترات تنشط فقط لكل token، فتحصل بطاقة 24 جيجابايت واحدة على 40–60 token/ثانية. وللاستخدام بأسلوب IDE، سرعة الاستجابة هي الجودة.
  • سلالة DeepSeek V3/R1 تجادل في مستوى أعلى: قرارات معمارية، وخوارزميات عصيبة، واستدلال متعدد الخطوات. لكن النموذج الرائد يتجاوز 600B بارامتر؛ ومحليًا لا تشغّله إلا بضغط ثقيل على عدة بطاقات أو أنظمة Mac ذات الذاكرة الموحدة، وهو يكتب نثرًا عن الكود أسرع مما يكتب الكود.

الاختيار المحلي: Qwen3 Coder للعمل اليومي، وDeepSeek فقط إن كانت عتادك يقدر على استضافته قرب الدقة الكاملة. عند 8–16 جيجابايت فالجدل بلا موضوع — نماذج Qwen2.5/3 Coder هي الأقوى التي تتسع.

كيف تشغّل أفضل LLM محلي للبرمجة عبر Ollama؟

خمسة أوامر، من الصفر إلى API متوافق مع OpenAI يستخدمه محررك:

# 1. ثبّت Ollama (لينكس)
curl -fsSL https://ollama.com/install.sh | sh

# 2. اسحب النموذج الملائم لفئة VRAM لديك (بطاقة 8 GB في المثال)
ollama pull qwen2.5-coder:7b

# 3. تحدث معه تفاعليًا
ollama run qwen2.5-coder:7b

# 4. استخدمه كـ API متوافق مع OpenAI من أي أداة
curl http://localhost:11434/v1/chat/completions 
  -d '{
    "model": "qwen2.5-coder:7b",
    "messages": [{"role": "user", "content": "Refactor this fn to be async: add(a,b){return a+b}"}]
  }'

# 5. وجّه إليه الأدوات التي تتوقع OPENAI_BASE_URL
export OPENAI_BASE_URL=http://localhost:11434/v1

لا مفتاح API، ولا سقف للطلبات، ولا فاتورة لكل token. على لينكس يسجّل المثبّت وحدة systemd، فإذا أساء الخادم السلوك يومًا يخبرك journalctl بالسبب — وورقة أوامر journalctl فيها الفلاتر الدقيقة لتصحيح الخدمات.

هل يكفي LLM محلي لعمل برمجي حقيقي؟

نعم لحلقة التعديل، لا للمشاكل الصعبة — وهذا الانقسام نفسه هو طريقة الاستخدام الصحيحة. نموذج محلي 14B–30B يتعامل مع إعادة الهيكلة والكود النموذجي وهياكل الاختبارات والتعبيرات النمطية و”اشرح لي هذه الدالة القديمة” أسرع من أن تُكمل معظم واجهات السحابة رحلة الذهاب والإياب. أما حيث يخسر أمام النماذج المستضافة الكبرى فهو الاستدلال الطويل متعدد الملفات وتفاصيل الأطر النادرة — نموذج 30B يعرف ببساطة أقل من النموذج الرائد.

سير العمل الذي ينجح: أبقِ نموذجًا محليًا يعمل لـ 90% من ضغطات مفاتيحك، وامتد إلى نموذج رائد مستضاف فقط لأسئلة التصميم العصيبة. كودك لا يغادر الجهاز في العمل الروتيني — وهذا مهم لكود العملاء — وVRAM التي تملكها أصلًا تستبدل بصمت اشتراكًا كاملًا.

— mrsaynothing

— mrsaynothing

ملاحظات ميدانية في الذكاء الاصطناعي وLinux والاستضافة الذاتية.

ناقش هذا المقال على dev.to dev.to ↗

احصل على الشرح التطبيقي التالي بالبريد

رسالة واحدة لكل مقال. أصلح المشكلة وامضِ.

self-hosted · بلا أطراف ثالثة · إلغاء الاشتراك بنقرة واحدة

ما هذا؟

التراجع عن آخر commit في Git مع الاحتفاظ بالتغييرات

أعجبتك هذه الكتابات؟ بناء مثل هذا هو عملي. وظّفني