
> Ce que les modèles de décision ne savent pas faire : six limites honnêtes▋
Deux des six nouveaux modèles de décision locaux sont non commerciaux, aucun ne s'explique, et le chiffre de confiance est une affirmation tant que personne ne l'a pas banché. La vague, lue contre le courant.
mrsaynothing· 8 octobre 2026· 4 min de lecture
La version courte : utilise-les pour décider, jamais pour expliquer. Deux des six sont non commerciaux. Les limites imprimées — nombre d'options, plafonds de tokens, trous de langue — sont réelles et échouent en silence. Et le chiffre de confiance est une affirmation tant que personne ne l'a pas banché sur des labels réels.
Pour qui : quiconque s'apprête à brancher une API toute fraîche en production parce que les release notes étaient excitantes. Voici l'autre moitié de la conversation — la première moitié est ici.
Les six limites
- Il n'y a pas de raisons dans la boîte. Un modèle de décision renvoie une étiquette et un nombre. Pourquoi cette étiquette — la preuve, le contre-argument, le doute — n'est pas dans la sortie, à aucun prix. Le moment où ton pipeline a besoin d'un pourquoi, tu es de retour à un modèle de chat ou à un humain.
- L'accord n'est pas une vérification. Demande à trois modèles, obtiens trois réponses identiques, et tu as une opinion en triple exemplaire. Une réponse fausse unanime arrive dans le casier confiant — triée, tamponnée, et fausse à 0.99. Le consensus a besoin d'une référence indépendante pour vouloir dire quelque chose, et aucun de ces modèles n'en apporte une.
- Les murs de licence sont réels. Julia-1, Laya, lev et Kev-4B sont en Apache-2.0. Nimble et OpenJev sont en CC BY-NC 4.0 — non commercial, point. Le runtime llama.cpp est MIT, et ça ne dit rien des poids : la fiche du checkpoint l'emporte sur le badge de licence du dépôt, à chaque fois.
- La carte des modalités a des trous. Laya est anglais-only — ne route pas du multilingue dedans. Nimble est texte-only en local. L'entrée vision d'OpenJev demande son propre projecteur. Kev-4B arrive sans le prétraitement par date de référence qu'il attend. Chaque trou est imprimé ; aucun ne se voit depuis l'API.
- Les limites sont imprimées sur la boîte. Julia-1 prend 2–20 options et une question combinée de 8 192 tokens — dépasse l'un ou l'autre et l'échec est silencieux, pas une erreur. Donner à un modèle de décision un document de 12k tokens, ce n'est pas le pousser ; c'est utiliser un autre produit que celui qui a été livré.
- Servir n'est pas prouver. Un nouvel endpoint qui renvoie des nombres est un fait de plomberie, pas un fait d'exactitude. Les prix publiés au million de tokens et le support de serving ne disent rien de l'honnêteté de la probabilité sur tes labels. Seul un banc sur du trafic réel répond à ça — et personne n'en a publié. Ce trou est l'opportunité, et elle est à nous.
Ce qui tient malgré les six
Le périmètre rétrécit, pas la valeur. Routage, filtrage et triage en une passe — là où la sortie est une décision et où un humain porte les conséquences — reste le meilleur fit que l'IA locale ait offert depuis un an. Petit, rapide, sans facture au token, et honnête sur sa nature de tampon. Le mode de défaillance à concevoir, c'est le casier confiant : fixe un seuil, escalade en dessous, et ne laisse jamais le tampon avoir le dernier mot sur ce qui compte.
Retiens ça : une probabilité est une affirmation. Tamponné ≠ trié juste. Bancher sur tes labels avant que le casier ne fasse loi.
Le banc arrive ensuite : Julia-1 contre Laya sur des labels de routage réels, calibration par taille, latence par matériel. Si les chiffres de confiance tiennent, la vague l'aura mérité. S'ils ne tiennent pas — ce post l'aura déjà dit.
$ Questions fréquentes
Les modèles de décision peuvent-ils expliquer leurs réponses ?
Non. Un modèle de décision renvoie une étiquette avec une probabilité — les raisons ne sont pas dans la sortie. Le moment où ton pipeline a besoin d'un pourquoi, tu es de retour à un modèle de chat ou à un humain.
Tous les modèles de décision locaux sont-ils sous licence ouverte ?
Non. Julia-1, Laya, lev et Kev-4B sont en Apache-2.0, mais Nimble et OpenJev sont en CC BY-NC 4.0 — non commercial. Le runtime llama.cpp, lui, est MIT — et ça ne change rien à ce que les poids du modèle autorisent.
Une probabilité élevée signifie-t-elle que la réponse est juste ?
Pas tant que ce n'est pas mesuré. L'endpoint qui renvoie 0.99 fait une affirmation, pas une preuve — les prix API publiés et le support de serving ne disent rien de la précision sur tes labels.
$ Articles similaires · local llm
Les modèles de décision Jev, expliqués
Des minuscules modèles qui répondent oui/non avec une probabilité pour chaque option — la vague décision Jev, lue dans les notes de version, pas sur le banc.
2026-10-07 · 7 min de lecture

llama.cpp vs Ollama — which one should you run?
The record read, not run: Ollama pins its llama.cpp engine at b11351 while upstream ships b11443. One is an appliance, one is the engine room.
2026-10-06 · 5 min de lecture

How to Run GGUF Models Locally: Ollama, llama.cpp & vLLM
How to run GGUF models locally: one-line Ollama pulls, llama.cpp straight off a Hugging Face URL, and how to pick the right quant for your VRAM.
2026-09-07 · 7 min de lecture

$ Recevez la prochaine prise de position par e-mail
Un e-mail par article. Adhérez ou déchirez.