
> llama.cpp مقابل Ollama — أيهما تشغّل؟▋
قراءة السجل العام لا تشغيله: Ollama تثبّت محرّك llama.cpp عند b11351 بينما المسار العلوي أطلق b11443. أحدهما جهاز منزلي والآخر غرفة المحرك.
mrsaynothing· 6 أكتوبر 2026· 4 دقيقة قراءة
صناديق البحث تقدّم عبارة llama.cpp vs Ollama وكأنها صراع بين منتجَين. المستودعان يرويان قصة أخرى: أحدهما يحتفظ بملف في جذر مستودعه يذكر رقم بناء الآخر بدقة. محرك Ollama هو llama.cpp، مثبَّت — الخصام الذي يريده الإنترنت ليس القرار الذي تقف أمامه فعلًا.
القرار الحقيقي هو كم من المحرك تريد أن تلمس بيدك. كل ما يلي يأتي من المستودعَين وتدفّق إصداراتهما والنقاشات العامة، وقد تم التحقق منه صباح نشر هذا المقال.
ما هو llama.cpp فعلًا؟
130,473 نجمة، رخصة MIT، وأربعة إصدارات في يوم كتابة هذه المراجعة. llama.cpp هو محرك الاستدلال بلغة C/C++ الذي أشعل موجة النماذج المحلية في مارس 2023. مشروعُه هو من قدّم صيغة GGUF، صيغة الملف الواحد التي يتاجر بها المنظوم المحلي كله — سلّم الكمّي الذي يتحاكم عليه الجميع يُعبَّر بصيغة صمّمها مؤلفو llama.cpp أنفسهم. لديه 24,125 نسخة مشتقة و2,515 مشكلة مفتوحة، وأكثر مساهميه إنتاجية يملك 2,011 كوميت.
تدفّق الإصدارات يُقرأ كسجل: أربعة بناءات كانت قد هبطت قبل بعد ظهيرة يوم كتابة المراجعة (من b11438 إلى b11443)، كلٌّ منها زيادة مرقّمة يمكنك تثبيتها. وإلى جانب واجهة الأوامر يأتي llama-server، خادم HTTP متوافق مع OpenAI — وجّه إليه أي عميل وسيتصرف كواجهة API مستضافة تقيم على جهازك.
verify: curl -s http://127.0.0.1:11434/api/version → {"version":"..."} مع Ollama عاملة · llama-server --version → وسم البناء مثل b11443
هل Ollama أكثر من مجرد غلاف؟
نعم — والحدود مطبوعة في المستودع. جذر مستودع Ollama يحمل ثلاثة ملفات تثبيت إصدارات: LLAMA_CPP_VERSION (b11351 وقت المراجعة) وMLX_VERSION وMLX_C_VERSION. وشيفرة Go في llm/llama_server.go تُطلق ملف خادم مشتقًا من llama.cpp كعملية فرعية وتتحدث إليه. الاعتمادية ليست سرًّا مفتوحًا؛ إنها مُدخل بناء.
ما تضيفه Ollama فوق ذلك خدمة: سحب النماذج بأمر واحد من سجلّ، وكشف تلقائي للعتاد، وواجهة API مقيمة على المنفذ 11434، ومحرك ثانٍ — MLX — لأجهزة Apple Silicon التي تفضّل safetensors على GGUF. هذا هو التعريف الصادق: Ollama إدارةُ نماذج ونظافةُ عمليات حول محرك لم تكتبه.
ماذا يعني تأخر الإصدار عمليًا
اثنان وتسعون بناءً تفصل تثبيت Ollama (b11351) عن إصدار صباح المسار العلوي (b11443) وقت المراجعة. إصلاحات المحرك — مثل تسريع prompt-lookup-drafting في سبتمبر الذي جمع 89 نقطة على Hacker News — تصل المسار العلوي أولًا ثم تصعد قطار إصدارات Ollama بعد أسابيع. إن كان سطر في سجل التغييرات يحل مشكلتك فالغلاف عادةً آخر من يعلم.
إذن، أيهما أسرع؟
بالملف النموذجي نفسه، لا شيء — المحرك مشترك. مقارنات الرموز في الثانية التي تدّعي فجوة تقارن عادةً كمّيات مختلفة أو أحجام سياق مختلفة أو بناءات مختلفة من المحرك ذاته. مقارنتنا مع LM Studio اصطدمت بالجدار نفسه: الواجهة تختلف والرياضيات واحدة.
حيث تظهر فجوات حقيقية فمصدرها الافتراضيات والتأخر لا المحركات: Ollama تختار طول السياق وتفرّغ الطبقات عنك (المقابض وراء مفاجآت VRAM)، بينما llama.cpp يجعلك تضبطها — ويعاقبك على نسيانها. سؤال المعايير يخفي سؤال تحكّم.
أنت لا تختار بين محركين. أنت تختار كم من المحرك تريد أن تلمس.
ماذا يقول السجل ضد llama.cpp؟
الدفتر الصادق، لأن للسجل دفترًا:
- 2,515 مشكلة مفتوحة وإيقاع حصار. أربعة إصدارات في صباح واحد قدرةٌ إنتاجية — وهو أيضًا اضطراب. الخيارات تتحرك والأنظمة الخلفية تُعاد تنظيمها، وسكربت البناء المثبَّت يطلب الصيانة ذاتها.
- المجتمع يقولها بصوت عالٍ. من نقاش Hacker News حول تسريع سبتمبر (89 نقطة): "Frankly, llama.cpp is so badly written that these kind of speedups are trivial, and a hard fork (or a total rewrite) has been needed for the longest time." — rfgplk. النقاش نفسه يحمل قلق الحوكمة بعد صفقة Nvidia وHugging Face التي أدخلت مشغّل الفريق الأساسي في دائرة الشك.
- الأعمال الوحيدة عليك. لا سجلّ نماذج ولا كشف تلقائي: ملفات GGUF تجلبها من Hugging Face بنفسك (دليل الإعداد يغطي هذا)، وخيارات تفريغ الطبقات تمررها بنفسك، والعملية تراقبها بنفسك.
أيهما تشغّل؟
الحكم من السجل، مع سطر الصدق الإلزامي: قرأت السجل ولم أشغّله. كل رقم هنا يأتي من المستودعَين وتدفّق إصداراتهما والنقاشات العامة الموصولة — لا من طرفي.
| تريد | شغّل | لماذا، من السجل |
|---|---|---|
| أمر واحد ونافذة محادثة | Ollama | سحب النماذج والكشف التلقائي وAPI مقيمة — الجهاز المنزلي |
| كل الخيارات وأحدث بناء | llama.cpp | بناءات مثبّتة وllama-server وأنظمة خلفية تختارها |
| واجهة رسومية مكتبية | LM Studio | السلالة المحركية نفسها بأزرار — قورنت هنا |
| معالج رسومي واحد ومستخدمون كثر | vLLM | خدمة بطاقة إنتاجية — تحفظات GGUF تنطبق |
خياطة عملية: ابدأ مع Ollama، وحين يقاوَمك — خيار لا يعرضه، أو كشف GPU خارج عن السياق (الأكثر شيوعًا)، أو إصلاح قاعد في بناء أحدث — انزل إلى llama.cpp لتلك المهمة. الملف النموذجي ينتقل معك، فGGUF هي اللغة المشتركة. العنقود كله بالأداتين مفهرس في hub local-LLM.
الجهاز يوقي من المحرك حتى اليوم الذي يصبح فيه المحرك هو المشكلة. ذلك اليوم هو سبب وجود الأداة الثانية.
على أي جانب من غرفة المحرك تقف — وهل كلّفك إعداد افتراضي لغلافٍ بعدًا كان خيار واحد سيوفّره؟
faq
— mrsaynothing
$ مقالات ذات صلة
git merge مقابل rebase — القرار في عشر ثوانٍ
merge أم rebase، سؤال واحد يحسمها: هل غادر هذا الـ commit جهازك؟ جدول القرار، وحالة fast-forward، وإنقاذ reflog عندما يسوء الـ rebase.
2026-10-05 · 6 دقيقة قراءة

How to Run GGUF Models Locally: Ollama, llama.cpp & vLLM
How to run GGUF models locally: one-line Ollama pulls, llama.cpp straight off a Hugging Face URL, and how to pick the right quant for your VRAM.
2026-09-07 · 7 دقيقة قراءة

llama.cpp vs Ollama: Which Should You Run in 2026?
llama.cpp vs Ollama: Ollama wraps llama.cpp for convenience, raw llama.cpp wins on speed and control. Benchmarks, GPU offload flags, and when each wins.
2026-09-10 · 7 دقيقة قراءة

GGUF VRAM Calculator: Check Before You Download
Model size, quant and context in — weights, KV cache and a per-card verdict out. The GGUF VRAM calculator answers will-it-fit before the download starts.
2026-10-02 · 4 دقيقة قراءة
