mrsaynothing.dev

> grep -r "Ollama"▋

8 articles

2026-10-06

llama.cpp vs Ollama — lequel devriez-vous lancer ?

Le dossier public, lu pas exécuté : Ollama fige son moteur llama.cpp en b11351 quand l'amont livre b11443. L'un est un appareil, l'autre la salle moteur.

2026-09-30

Ollama connection refused ? Le triage en 60 secondes

Connection refused signifie qu'aucun processus n'écoute sur le port 11434. Les six vraies causes, classées, plus la commande curl qui dit laquelle tu as.

2026-09-19

Les regrets local-LLM viennent de la RAM, pas du modèle.

Un modèle de 4,9 Go réserve 7,0 Go avant de répondre. Le VRAM fait débattre ; la RAM décide de ce qui démarre, de ce qui tient, et de ce qui bascule sur CPU.

2026-09-16

Ollama n'utilise pas le GPU ? Le fix Linux, Windows et WSL

Ollama ignore ton GPU et retombe sur le CPU ? Les cinq vraies causes — pilotes, VRAM, backend épinglé, ROCm, flags Docker — et la commande qui règle chacune.

2026-09-10

llama.cpp vs Ollama : lequel utiliser en 2026 ?

llama.cpp vs Ollama : Ollama emballe llama.cpp pour le confort, le llama.cpp brut gagne en vitesse et en contrôle. Benchmarks, flags GPU, cas d'usage gagnants.

2026-09-07

Lancer un modèle GGUF en local : Ollama, llama.cpp & vLLM

Comment exécuter des modèles GGUF en local : pull Ollama en une ligne, llama.cpp direct depuis une URL Hugging Face, et le bon quant selon ta VRAM.

2026-09-04

Meilleur LLM local pour coder : de 8 à 24 Go de VRAM

Le meilleur LLM local pour coder par tranche de VRAM : Qwen3 Coder vs DeepSeek à 8, 12, 16 et 24 Go, le bon quant par carte et un setup Ollama prêt à l'emploi.

2026-09-01

Ollama vs LM Studio : quel outil LLM local choisir ?

Ollama vs LM Studio pour le vrai travail de dev : installation, GPU, vitesse et API locale — avec des commandes prêtes à l'emploi pour choisir aujourd'hui.