
> Les modèles de décision Jev, expliqués▋
Des minuscules modèles qui répondent oui/non avec une probabilité pour chaque option — la vague décision Jev, lue dans les notes de version, pas sur le banc.
mrsaynothing· 7 octobre 2026· 7 min de lecture
curl -fsSL https://ollama.com/install.sh | shLa version courte : quand un pipeline a besoin d'une décision — quelle file, autoriser ou refuser, quelle étiquette — un modèle de décision Jev répond en une passe avec une probabilité attachée. Six checkpoints sont arrivés en local cette semaine : cinq permissifs, un non commercial. Sers-t'en pour décider, jamais pour justifier — et vérifie les chiffres avant de leur faire confiance.
La ligne d'honnêteté : cette vague a quelques jours, alors j'ai lu le dossier, je ne l'ai pas exécuté. Tout ici vient de l'annonce d'Ollama, des notes de release llama.cpp 0.6.0 et des checkpoint cards publiées. Le bench avec de vraies latences, c'est la suite — ces chiffres-là, personne ne pourra nous les prendre.
- modèle de décision — une minuscule IA qui répond à une question par un choix et un chiffre de confiance, pas par une phrase
- probabilité — le chiffre de confiance : 0.87 veut dire « 87 fois sur 100, je dirais la même chose »
- routing — envoyer chaque requête entrante vers la bonne file ou le bon worker, comme un facteur qui répartit ses tournées
- calibration — est-ce que le chiffre de confiance dit la vérité ; un 0.9 calibré a raison 9 fois sur 10
- GGUF — le format de fichier des modèles locaux ; le nom présent dans chaque liste de téléchargement
1 · Les deux formes de réponse
Les modèles de chat répondent à tout par de la prose. C'est la mauvaise forme pour la moitié de ce dont les pipelines ont besoin. Un routeur veut quelle file. Un garde-fou veut autoriser ou refuser, avec quelle certitude. Un classifieur veut une étiquette parmi six.
Demande une décision à un modèle de chat et tu obtiens une phrase qui dit la bonne chose — en général — formulée différemment à chaque fois, plus une étape de parsing qui échoue en silence.
Tu demandes à une personne de trier le courrier, elle te rédige une dissertation sur chaque lettre. L'autre te tend un casier trié avec un post-it : « à 87 %, c'est la pile des factures ». Laquelle tu écoutes à 6h du matin ?
2 · Ce qu'est vraiment la vague Jev
« Jev » est le nom du contrat d'API : un modèle qui prend une question, une liste fixe d'options, et renvoie une probabilité pour chacune. TypeSafe l'a défini ; les outils locaux l'ont adopté à une semaine d'intervalle.
Ollama a livré le support local le 29 septembre — la v0.35 a gagné son propre /v1/systemone, avec Nimble et Tev1 tirables dès le lancement. llama.cpp a suivi dans la 0.6.0 (5 octobre) : un endpoint /v1/systemone qui sert cinq GGUF ouverts — Julia-1, Laya, Kev-4B, lev, OpenJev — avec Nimble débarquant quelques jours plus tard.
Ces modèles sont minuscules — de 144M à 27B paramètres, là où les modèles de chat démarrent à 30 fois plus. Petit, c'est le but : une décision tient en une passe, et un modèle assez petit pour répondre instantanément change les jobs qui peuvent se permettre de demander.
Une seule comparaison publique d'exactitude existe — les 13 jeux de données de Bespoke Labs, 3,880 décisions étiquetées à la main : Nimble 75.7%, Tev1-4B 73.3%, Tev1-0.8B 63.5%, avec le Jev hébergé à 76.0%. Chiffres proches des vendeurs, donc à prendre comme un point de départ — le bench qui compte tourne sur TES étiquettes.
imagine : un modèle de chat, c'est un consultant senior que tu réserves à l'heure. Un modèle de décision, c'est le tampon de l'accueil — il dit juste quelle pile, et il ne fatigue jamais.
3 · Les modèles sur l'étagère
Le tableau ci-dessous est l'étagère llama.cpp — les six checkpoints que son endpoint 0.6.0 sert (la bibliothèque d'Ollama porte son propre lot : Nimble, Tev1, Laya, Clef). Filtre par licence — OpenJev est la seule entrée NC à vérifier avant qu'un pipeline commercial la touche. Que le runtime llama.cpp soit MIT ne change pas ce que les poids autorisent.
| Checkpoint | Taille | Licence | Notes |
|---|---|---|---|
| Julia-1 | 144M | Apache-2.0 | 2–20 options, limite combinée de 8 192 tokens |
| Laya | 421M | Apache-2.0 | Routage en anglais ; ne présume pas qu'il soit multilingue |
| lev | 4B | Apache-2.0 | Décisions sur texte |
| Kev-4B | 4B | Apache-2.0 | Prétraitement des dates de référence non inclus |
| Nimble | 9B | Apache-2.0 | LoRA sur Qwen3.5-9B ; texte seul en local |
| OpenJev | 27B | CC BY-NC 4.0 | Entrée vision via son projector ; non commercial |
Une septième forme, Clef, est arrivée dans la même release 0.6.0 (Apache-2.0, texte et vision), et la ligne Clef de Cloudflare se tire aussi depuis Ollama. Même idée, plus de portes.
L'échelle des tailles se lit simplement : le duo 144M–421M tourne sur un CPU inactif et gère le routing propre ; le duo 4B gagne sa vie quand les étiquettes deviennent subtiles ; le 27B ajoute des yeux. Lance nvidia-smi --query-gpu=memory.total --format=csv,noheader — à ces tailles, presque n'importe quelle carte fait l'affaire.
imagine : la taille, c'est le salaire. La 144M fait le travail pour trois fois rien ; tu ne paies la 27B que quand le job doit regarder des images.
4 · Où il s'intègre — et où il ne s'intègre pas
Il s'intègre quand la sortie est une décision : routage de requêtes (ticket → facturation / ventes / abus), garde-fous (autoriser-ou-refuser avec un score de confiance), et tri de documents en volume — classe avec le petit modèle, ne dépense les tokens du gros que sur ce qu'il signale.
Il ne s'intègre pas quand tu as besoin des raisons. Une étiquette avec une probabilité n'embarque aucune raison. Dès que le pipeline demande « pourquoi », tu reviens à un modèle de chat — ou à la lecture des documents toi-même.
Il ne s'intègre pas quand tu veux la vérité par consensus. L'accord entre modèles n'est pas une vérification. Une réponse fausse à l'unanimité arrive dans la voix la plus sûre d'elle — exactement le mode d'échec que nos registres existent pour attraper.
La fonction silencieuse : la probabilité est la réponse
Un modèle de chat qui dit « c'est probablement la facturation » cache sa propre calibration — tu reçois une formulation, une fois. Un modèle de décision te tend le chiffre, et 0.51 et 0.99 sont deux décisions différentes : sous ton seuil, escalade à un humain au lieu d'agir. Si ce chiffre dit la vérité sur TES étiquettes, aucune note de release ne le dit. C'est le boulot du bench — et c'est pourquoi c'est le prochain post.
verify: ollama run qwen3:0.6b "Reply YES or NO: is 7 prime?" — une réponse d'un token sans dissertation attachée veut dire que la forme tourne sur ta machine.
la suite sur cette vague : llama.cpp vs Ollama · Ollama n'utilise pas ton GPU — et tout le local-LLM vit dans le hub local-LLM.
faq
— mrsaynothing
$ Articles similaires
llama.cpp vs Ollama — lequel devriez-vous lancer ?
Le dossier public, lu pas exécuté : Ollama fige son moteur llama.cpp en b11351 quand l'amont livre b11443. L'un est un appareil, l'autre la salle moteur.
2026-10-06 · 5 min de lecture

llama.cpp vs Ollama: Which Should You Run in 2026?
llama.cpp vs Ollama: Ollama wraps llama.cpp for convenience, raw llama.cpp wins on speed and control. Benchmarks, GPU offload flags, and when each wins.
2026-09-10 · 7 min de lecture

How to Run GGUF Models Locally: Ollama, llama.cpp & vLLM
How to run GGUF models locally: one-line Ollama pulls, llama.cpp straight off a Hugging Face URL, and how to pick the right quant for your VRAM.
2026-09-07 · 7 min de lecture

$ Recevez le prochain how-to par e-mail
Un e-mail par article. Réparez et avancez.