العودة إلى المدونة

لا أحد يتحدث عن RAM. كل خيبة أمل مع LLM محلي هي مشكلة ذاكرة.

19 سبتمبر 2026

ادخل أي نقاش حول نماذج LLM المحلية، ستجد المعركة تدور حول بطاقات الرسوميات. قياسات VRAM، بطاقات 24 جيجابايت، CUDA في مواجهة ROCm، وهل ما زالت RTX 3060 «بطاقة الشعب». في المقابل، الرقم الذي يقرر فعلاً إن كان نموذجك سيعمل أم لا يجلس في الفتحة الأخرى — بلا قياسات ولا تسويق: كم من الذاكرة RAM تملك الآلة.

شريحة VRAM تبيع الحلم. الذاكرة RAM تقرر إن كان النموذج سيعمل من الأساس — وكم سياقاً سينجو حين يعمل.

اختبرت هذا على الجهاز أمامي أثناء كتابة التدوينة: حاسوب Ryzen بذاكرة 32 جيجابايت وبطاقة GeForce RTX 3060 بذاكرة رسوميات 12 جيجابايت. جلبت llama3.1:8b — صفحة التنزيل تقول 4.9 جيجابايت. انظر ما احجزه فعلاً:

لقطة طرفية من جهاز الاختبار: يعرض ollama ps أن llama3.1:8b حجز 7.0 جيجابايت على 100% من بطاقة الرسوميات بسياق 32000 توكن، ويعرض nvidia-smi استهلاك 7963 من أصل 12288 ميجابايت، ويعرض free -h ذاكرة 31 جيجابايت

الحجة كلها في هذه الشاشة الواحدة. «نموذج بحجم 4.9 جيجابايت» حجز 7.0 جيجابايت قبل أن يجيب عن أول طلب — ضريبة سياق بنسبة 43% — واحتفظ بـ 7963 من أصل 12288 ميجابايت من ذاكرة الرسوميات. الأوزان لم تكن يوماً الميزانية. الميزانية كانت السياق.

من أين تأتي الجيجابايتات الإضافية

ملاحظات الذاكرة في llama.cpp تشرح الحساب الذي تتجاهله صفحات التنزيل: الذاكرة الكلية = أوزان النموذج + ذاكرة KV المؤقتة + buffer الحساب. الحد الأول وحده ثابت. ذاكرة KV تنمو خطياً مع طول السياق، وbuffer الحساب ينمو مع حجم الدفعة. وأداة Ollama تغلف llama.cpp، فالقانون نفسه يسري — ولهذا أظهر ollama ps حجم 7.0 جيجابايت لعلامة حجمها 4.9 جيجابايت عند نافذة سياق 32000 توكن، وكلها مقيمة على بطاقة الرسوميات.

النموذج المكمم ليس تنازلاً. إنه اعتراف بأن الذاكرة كانت دائماً هي الميزانية الحقيقية.

لهذا السبب أصلاً توجد سلّم التكميم GGUF. صيغة Q4 ليست عقيدة؛ هي ما يجعل معادلة الذاكرة تهبط داخل العتاد الذي يملكه الناس فعلاً. ولهذا لا تتشابه بيئتا 8B «متطابقتان» أبداً: النموذج نفسه، لكن طول السياق مختلف، والآلات مختلفة.

الجدول الذي لا يملؤه أحد قبل الشراء

ثلاث فئات من النماذج، نوعا الذاكرة معاً، بطاقة 12 جيجابايت وذاكرة 32 جيجابايت — التكوين الذي يملكه آلاف المطورين حقاً:

فئة النموذج (Q4)التنزيلبعد التحميل + سياق 32kعلى 12 جيجابايت VRAMعلى 32 جيجابايت RAM
7–8B (llama3.1:8b)4.9 جيجابايت7.0 جيجابايت (مُقاس)100% على البطاقة، استهلاك ~8 GiBبالكاد يُلاحظ
13–14B (qwen2.5:14b)9.0 جيجابايت~12 جيجابايتيبدأ التفريغمريح
27–32B (gemma3:27b)17 جيجابايت~20 جيجابايت فأكثرالمعالج يحمل الأوزانالسبب الوحيد لأنه يعمل

أعد قراءة الصفين الأخيرين. بذاكرة الرسوميات وحدها، نموذج 14B بسياق حقيقي هو أصلاً عمل تفريغ مقسّم، ونموذج 27B مستحيل. وعلى ذاكرة 32 جيجابايت، كلاهما مجرد بطيء. هذا الفرق — بين المستحيل والبطيء — هو كل الفرق العملي بين VRAM وRAM. ما اتسع في VRAM فهو سريع. ما اتسع في RAM فهو يعمل. وما لم يتسع في أي منهما فأنت تقوم بتبديل إلى NVMe والزمن يفقد معناه.

التفريغ يمر عبر PCIe، والأسئلة الشائعة في Ollama صريحة بشأن الكلفة: الطبقات التي لا تتسع في بطاقة الرسوميات تعمل على المعالج، والإنتاجية تنهار كلما تقلص حصة البطاقة. لا أحد يختار هذه المقايضة بوعي. تحدث بصمت، طبقة تلو الأخرى، والعَرَض هو مجرد عبارة «النماذج المحلية مبالغ في تقييمها».

السجلّ الصادق

ما انكسر أو فاجأني أثناء الكتابة، بالترتيب:

  1. رقم الـ43% نفسه. توقعت أن يشغل نموذج 8B «حوالي حجم ملفه». احجز 7.0 جيجابايت مقابل 4.9 جيجابايت منزّلة. إن كان ذلك فاجأني، فسيفاجئ كل من يقرأ أوراق المواصفات بدلاً من ps.
  2. جلسة لقطات الشاشة. المحاولة الأولى التقطت النافذة الخطأ. الثانية نجحت، وهي المعروضة أعلاه. الأدلة سير عمل، لا مزاج — ودورة pull ← لقطة ← ollama rm تحافظ على صدق القرص.
  3. ما لم ينكسر: بطاقة الرسوميات لم تفيض أبداً. نموذج 8B بسياق 32k على 12 جيجابايت مريح فعلاً. البطاقة بخير. ما هو سيئ المعايرة هو الخطاب حول البطاقة.

لا شيء من هذا يعني أن بطاقات الرسوميات بلا أهمية — سطر الـ100% في اللقطة هو سبب شعورنا أن التوليد لحظي. المعنى أن بطاقة الرسوميات هي السؤال الثاني. اختيار بين Ollama وllama.cpp يأتي بعد أن تعرف ما الذي يتسع، لا قبله.

القاعدة الجديرة بالحفظ

الذاكرة المطلوبة = ملف النموذج + ذاكرة KV للسياق الحقيقي لديك + 4 جيجابايت كي تبقى حاسوباً. لنماذج 7–8B بصيغة Q4، ذاكرة 16 جيجابايت مريحة. ولنماذج 14B–32B، تصبح 32 جيجابايت ليست رفاهية بل جوهر الموضوع. اشترِ VRAM مقابل السرعة التي تريدها عند السياق الذي تستخدمه؛ واشترِ RAM مقابل كل ما ستقوم بتحميله يوماً ما.

نظرة واحدة إلى ollama ps، وتنتهي ديانة أوراق المواصفات بصمت.

إذن، سؤالان. عند تجميع جهازك القادم، هل تشتري VRAM من أجل القياسات التي ستنشرها — أم تشتري RAM من أجل النماذج التي ستشغلها فعلاً؟ وبصراحة: كم نموذجاً جلبته في الثانية صباحاً ثم حذفته قبل الفطور؟ أنا حذفت اليوم، في منتصف التدوينة. أخبرني في التعليقات أنني لست الوحيد — وأخبرني على أي جانب من خط RAM/VRAM يقف جهازك.

FAQ

كم من الذاكرة RAM تحتاج لتشغيل نموذج LLM محلي؟

حجم ملف النموذج، زائد السياق (context)، زائد حصة سطح المكتب لديك. ذاكرة 16 جيجابايت مريحة لنماذج 7–8B بصيغة Q4؛ أما 32 جيجابايت فهي ما يحوّل نموذج 14–32B من عرض تجريبي إلى أداة يومية.

أيهما أهم لنماذج LLM المحلية: VRAM أم RAM؟

شريحة VRAM تحدد السرعة حين يتسع كل شيء داخلها. الذاكرة RAM تحدد إن كان النموذج سيعمل أصلاً وكم سياق سيبقى. التفريغ عبر PCIe بين الاثنين هو المنطقة الوسطى البطيئة التي لا يحبها أحد.

لماذا يستهلك النموذج بعد تحميله ذاكرة أكبر من حجم التنزيل؟

ذاكرة KV المؤقتة وbuffers الحساب تنمو مع طول السياق. توثيق llama.cpp للذاكرة يشرح المعادلة: الأوزان + ذاكرة KV المؤقتة + buffer الحساب — وصفحة التنزيل لا تعرض سوى الرقم الأول.

— mrsaynothing

— mrsaynothing

آراء تُختبر تحت الحمل قبل النشر. غالبًا.

ناقش هذا المقال على dev.to dev.to ↗

احصل على الطرح التالي بالبريد

رسالة واحدة لكل مقال. وافق أو حطّمها.

self-hosted · بلا أطراف ثالثة · إلغاء الاشتراك بنقرة واحدة

ما هذا؟

SSH Permission Denied (publickey): الإصلاح الحقيقي

أعجبتك هذه الكتابات؟ بناء مثل هذا هو عملي. وظّفني