> grep -r "GGUF"▋
5 articles
2026-10-06
llama.cpp vs Ollama — lequel devriez-vous lancer ?
Le dossier public, lu pas exécuté : Ollama fige son moteur llama.cpp en b11351 quand l'amont livre b11443. L'un est un appareil, l'autre la salle moteur.
2026-10-02
Calculatrice VRAM GGUF : vérifiez avant de télécharger
Taille du modèle, quant et contexte en entrée — poids, cache KV et verdict par carte en sortie. La calculatrice VRAM GGUF répond avant le téléchargement.
2026-09-23
vLLM peut-il lire du GGUF ? Oui — GPU uniquement
vLLM peut-il exécuter du GGUF ? Oui — via le plugin officiel, sur GPU uniquement. La syntaxe serve, le piège du tokenizer, les limites matérielles, et quand llama.cpp gagne.
2026-09-13
Quantification GGUF : Q4_K_M vs Q8_0, taille et VRAM
Niveaux de quantification GGUF comparés : Q4_K_M vs Q8_0 en taille, VRAM et qualité, et la règle — Q4_K_M par défaut, on monte seulement pour le code.
2026-09-07
Lancer un modèle GGUF en local : Ollama, llama.cpp & vLLM
Comment exécuter des modèles GGUF en local : pull Ollama en une ligne, llama.cpp direct depuis une URL Hugging Face, et le bon quant selon ta VRAM.