mrsaynothing.dev

> grep -r "local LLM"▋

8 مقالات

2026-10-06

llama.cpp مقابل Ollama — أيهما تشغّل؟

قراءة السجل العام لا تشغيله: Ollama تثبّت محرّك llama.cpp عند b11351 بينما المسار العلوي أطلق b11443. أحدهما جهاز منزلي والآخر غرفة المحرك.

2026-10-02

حاسبة VRAM لملفات GGUF: تحقّق قبل التنزيل

حجم النموذج والكمّي وطول السياق مدخلات، والأوزان وذاكرة KV وحكم لكل بطاقة مخرجات — حاسبة VRAM تجيب قبل أن يبدأ التنزيل.

2026-09-23

هل يشغّل vLLM صيغة GGUF؟ نعم — على GPU فقط

هل يشغّل vLLM صيغة GGUF؟ نعم — عبر الإضافة الرسمية، وعلى GPU فقط. صيغة serve، فخ الـtokenizer، حدود العتاد، ومتى يتفوق llama.cpp.

2026-09-13

مستويات ضغط GGUF: Q4_K_M مقابل Q8_0، الحجم والذاكرة

مقارنة مستويات ضغط GGUF: Q4_K_M مقابل Q8_0 في الحجم والذاكرة والجودة، وقاعدة واحدة — Q4_K_M افتراضيًا، والارتقاء فقط للكود والرياضيات.

2026-09-10

llama.cpp مقابل Ollama: أيهما تشغّل في 2026؟

llama.cpp مقابل Ollama: الأداة Ollama تغلّف llama.cpp من أجل الراحة، وllama.cpp الخام يفوز في السرعة والتحكم. مقاييس، خيارات تحويل GPU، ومتى يفوز كل طرف.

2026-09-07

كيف تشغّل نماذج GGUF محليًا: Ollama وllama.cpp وvLLM

كيفية تشغيل نماذج GGUF محليًا: سحب من Ollama بسطر واحد، llama.cpp مباشرة من رابط Hugging Face، وكيفية اختيار الضغط المناسب لسعة VRAM لديك.

2026-09-04

أفضل LLM محلي للبرمجة: خيارات من 8 إلى 24 جيجابايت VRAM

أفضل LLM محلي للبرمجة حسب فئة VRAM: Qwen3 Coder مقابل DeepSeek عند 8 و12 و16 و24 جيجابايت، درجة الضغط المناسبة لكل بطاقة، وإعداد Ollama جاهز للتنفيذ.

2026-09-01

Ollama مقابل LM Studio: أي أداة LLM محلي تختار؟

مقارنة Ollama وLM Studio للعمل الحقيقي: التثبيت، استخدام GPU، السرعة، وتقديم API — مع أوامر جاهزة للتنفيذ لتختار الأداة الصحيحة اليوم.