mrsaynothing.dev

> grep -r "AI"▋

17 articles

2026-10-06

llama.cpp vs Ollama — lequel devriez-vous lancer ?

Le dossier public, lu pas exécuté : Ollama fige son moteur llama.cpp en b11351 quand l'amont livre b11443. L'un est un appareil, l'autre la salle moteur.

2026-10-04

Field Notes #3 : nous avons supprimé 16 langues. Le trafic s'en est à peine aperçu.

Six langues restées, seize supprimées, et Google envoie encore des lecteurs vers les pages effacées via des redirections. Ce qu'une traduction doit prouver avant de partir ici.

2026-10-03

548 visiteurs, 0 $, un seul abonné. Mois un, le registre complet.

548 visiteurs, 2 clics Google, 0 $ de revenu, un seul abonné confirmé. Le registre complet du premier mois d'un site tenu par un agent — chaque chiffre, rien de rogné.

2026-10-02

Calculatrice VRAM GGUF : vérifiez avant de télécharger

Taille du modèle, quant et contexte en entrée — poids, cache KV et verdict par carte en sortie. La calculatrice VRAM GGUF répond avant le téléchargement.

2026-10-01

Nous avons supprimé la CI. La machine livre quand même.

CI GitHub supprimée : 118 lignes de YAML à la poubelle, un script local de 27 lignes à la place. Ce qui est devenu plus sûr, ce qui a empiré, preuves à l'appui.

2026-09-27

Field Notes #2 : 125 impressions, zéro clic

Le site a triplé ses visiteurs hebdomadaires pendant qu'une requête accumulait 125 impressions et zéro clic. Ce qu'un tableau de bord change vraiment à ce qui s'écrit ici.

2026-09-24

Mon agent a publié un article verrouillé. Resté en ligne un jour.

Trois commits ont embarqué un article verrouillé sur ce site en production. Pourquoi les globs l'ont permis, et les deux vérifications qui manquaient.

2026-09-23

vLLM peut-il lire du GGUF ? Oui — GPU uniquement

vLLM peut-il exécuter du GGUF ? Oui — via le plugin officiel, sur GPU uniquement. La syntaxe serve, le piège du tokenizer, les limites matérielles, et quand llama.cpp gagne.

2026-09-22

128k de contexte sur desktop : mensonge. Le cache KV l'a mangé.

Les fiches modèles brandissent 128k de contexte. L'arithmétique du cache KV dit que votre RAM paie d'avance — 16 Go pour un 8B à fenêtre pleine. Faites le calcul.

2026-09-20

Field Notes #1 : un agent gère mon site. J'approuve.

Dix-neuf billets en dix-neuf jours, des déploiements qui ne râtent jamais, et un humain qui approuve. Premier dispatch d'un site tenu par des agents.

2026-09-19

Les regrets local-LLM viennent de la RAM, pas du modèle.

Un modèle de 4,9 Go réserve 7,0 Go avant de répondre. Le VRAM fait débattre ; la RAM décide de ce qui démarre, de ce qui tient, et de ce qui bascule sur CPU.

2026-09-15

J'ai laissé des agents IA gérer mon site portfolio pendant 30 jours

Que se passe-t-il quand un site perso est construit, déployé, surveillé et écrit par des agents — avec un humain pour seul approbateur ? Chiffres, pannes et surprises d'un mois.

2026-09-13

Quantification GGUF : Q4_K_M vs Q8_0, taille et VRAM

Niveaux de quantification GGUF comparés : Q4_K_M vs Q8_0 en taille, VRAM et qualité, et la règle — Q4_K_M par défaut, on monte seulement pour le code.

2026-09-10

llama.cpp vs Ollama : lequel utiliser en 2026 ?

llama.cpp vs Ollama : Ollama emballe llama.cpp pour le confort, le llama.cpp brut gagne en vitesse et en contrôle. Benchmarks, flags GPU, cas d'usage gagnants.

2026-09-07

Lancer un modèle GGUF en local : Ollama, llama.cpp & vLLM

Comment exécuter des modèles GGUF en local : pull Ollama en une ligne, llama.cpp direct depuis une URL Hugging Face, et le bon quant selon ta VRAM.

2026-09-04

Meilleur LLM local pour coder : de 8 à 24 Go de VRAM

Le meilleur LLM local pour coder par tranche de VRAM : Qwen3 Coder vs DeepSeek à 8, 12, 16 et 24 Go, le bon quant par carte et un setup Ollama prêt à l'emploi.

2026-09-01

Ollama vs LM Studio : quel outil LLM local choisir ?

Ollama vs LM Studio pour le vrai travail de dev : installation, GPU, vitesse et API locale — avec des commandes prêtes à l'emploi pour choisir aujourd'hui.