
> Modelos de decisión Jev, explicados▋
Modelos diminutos que responden sí o no con una probabilidad por opción — la ola de decisiones Jev, leída del registro de versiones, no del banco.
mrsaynothing· 7 de octubre de 2026· 6 min de lectura
curl -fsSL https://ollama.com/install.sh | shLa versión corta: cuando un pipeline necesita una decisión — qué cola, permitir o denegar, qué etiqueta — un modelo de decisión Jev responde en una pasada con una probabilidad adjunta. Seis checkpoints llegaron en local esta semana: cinco permisivos, uno no comercial. Úsalos para decidir, nunca para justificar — y mide los números antes de confiar en ellos.
La línea de honestidad: esta ola tiene días de vida, así que leí el registro, no lo ejecuté. Todo aquí viene del anuncio de Ollama, de las notas de la versión 0.6.0 de llama.cpp y de las checkpoint cards publicadas. El bench con latencias reales es la continuación — esos números son justo los que nadie puede copiarnos.
- modelo de decisión — una IA diminuta que responde una pregunta con una elección y un número de confianza, no con una frase
- probabilidad — el número de confianza: 0.87 significa «87 de cada 100 veces diría lo mismo»
- enrutamiento — mandar cada solicitud entrante a la cola o al trabajador correcto, como un cartero que reparte sus rutas
- calibración — si el número de confianza dice la verdad; un 0.9 calibrado acierta 9 de cada 10 veces
- GGUF — el formato de archivo en que llegan los modelos locales; el nombre en toda lista de descarga
1 · Las dos formas de responder
Los modelos de chat responden todo con prosa. Es la forma equivocada para la mitad de lo que los pipelines necesitan. Un router quiere qué cola. Un filtro quiere permitir o denegar, con cuánta certeza. Un clasificador quiere una etiqueta de seis.
Pídele una decisión a un modelo de chat y obtienes una frase que significa lo correcto — normalmente — con otras palabras cada vez, más un paso de parseo que falla en silencio.
Le pides a una persona que ordene el correo y te escribe un ensayo sobre cada carta. La otra te entrega una bandeja ordenada con una nota adhesiva: «87 % seguro de que esta es la pila de recibos». ¿A cuál le crees a las 6 a.m.?
2 · Qué es realmente la ola Jev
«Jev» es el nombre del contrato de API: un modelo que recibe una pregunta, una lista fija de opciones y devuelve una probabilidad para cada una. Lo definió TypeSafe; las herramientas locales lo adoptaron con una semana de diferencia.
Ollama lanzó el soporte local el 29 de septiembre — la v0.35 ganó su propio /v1/systemone, con Nimble y Tev1 descargables desde el arranque. llama.cpp siguió en la 0.6.0 (5 de octubre): un endpoint /v1/systemone que sirve cinco GGUF abiertos — Julia-1, Laya, Kev-4B, lev, OpenJev — con Nimble llegando días después.
Estos modelos son diminutos — de 144M a 27B parámetros, cuando los modelos de chat empiezan en 30 veces eso. Pequeño es el punto: una decisión es una pasada, y un modelo lo bastante pequeño para sentirse instantáneo cambia qué trabajos pueden permitirse preguntar.
Existe una sola comparación pública de precisión — los 13 conjuntos de datos de Bespoke Labs, 3,880 decisiones etiquetadas por humanos: Nimble 75.7%, Tev1-4B 73.3%, Tev1-0.8B 63.5%, con el Jev alojado en 76.0%. Cifras cercanas a los proveedores, así que tómalas como punto de partida — el bench que importa corre sobre TUS etiquetas.
imagínalo: un modelo de chat es un consultor senior que contratas por hora. Un modelo de decisión es el sello del mostrador — solo dice qué bandeja, y nunca se cansa.
3 · Los modelos en el estante
La tabla de abajo es el estante de llama.cpp — los seis checkpoints que su endpoint 0.6.0 sirve (la librería de Ollama trae su propio lote: Nimble, Tev1, Laya, Clef). Filtra por licencia — OpenJev es la única entrada NC que revisar antes de que un pipeline comercial la toque. Que el runtime de llama.cpp sea MIT no cambia lo que los pesos permiten.
| Checkpoint | Tamaño | Licencia | Notas |
|---|---|---|---|
| Julia-1 | 144M | Apache-2.0 | 2–20 opciones, límite combinado de 8192 tokens |
| Laya | 421M | Apache-2.0 | Enrutamiento en inglés; no asumas que es multilingüe |
| lev | 4B | Apache-2.0 | Decisiones sobre texto |
| Kev-4B | 4B | Apache-2.0 | Preprocesamiento de fechas de referencia no incluido |
| Nimble | 9B | Apache-2.0 | LoRA sobre Qwen3.5-9B; solo texto en local |
| OpenJev | 27B | CC BY-NC 4.0 | Entrada de visión vía su projector; no comercial |
Una séptima forma, Clef, llegó en la misma versión 0.6.0 (Apache-2.0, texto y visión), y la línea Clef de Cloudflare también se descarga desde Ollama. Misma idea, más puertas.
La escalera de tamaños se lee simple: el par 144M–421M corre en una CPU inactiva y resuelve enrutamiento limpio; el par 4B gana su lugar cuando las etiquetas se vuelven sutiles; el 27B suma ojos. Corre nvidia-smi --query-gpu=memory.total --format=csv,noheader — a estos tamaños, casi cualquier tarjeta califica.
imagínalo: el tamaño es el salario. La de 144M hace el trabajo por centavos; a la de 27B solo la pagas cuando el trabajo necesita mirar imágenes.
4 · Dónde encaja — y dónde no
Encaja cuando la salida es una decisión: enrutamiento de solicitudes (ticket → facturación / ventas / abuso), filtros (permitir-o-denegar con puntaje de confianza) y triage de documentos a volumen — clasifica con el modelo pequeño y gasta tokens del modelo grande solo en lo que marca.
No encaja cuando necesitas razones. Una etiqueta con probabilidad no trae razones adjuntas. En cuanto el pipeline pregunta «por qué», vuelves a un modelo de chat — o a leer los documentos tú mismo.
No encaja cuando necesitas verdad por consenso. El acuerdo entre modelos no es verificación. Una respuesta errónea por unanimidad llega con la voz más segura de todas — exactamente el modo de falla que nuestros registros existen para cazar.
La función silenciosa: la probabilidad es la respuesta
Un modelo de chat que dice «esto probablemente es facturación» esconde su propia calibración — recibes una sola redacción, una vez. Un modelo de decisión te entrega el número, y 0.51 y 0.99 son decisiones distintas: por debajo de tu umbral, escala a un humano en vez de actuar. Que ese número diga la verdad sobre TUS etiquetas no está en las notas de versión. Para eso es el bench — y por eso es el siguiente post.
verify: ollama run qwen3:0.6b "Reply YES or NO: is 7 prime?" — una respuesta de un token sin ensayo adjunto significa que la forma funciona en tu máquina.
lo siguiente en esta ola: llama.cpp vs Ollama · Ollama no usa tu GPU — y todo lo local-LLM vive en el hub local LLM.
faq
— mrsaynothing
$ Entradas relacionadas
llama.cpp vs Ollama — ¿cuál deberías ejecutar?
El registro público, leído no ejecutado: Ollama fija su motor llama.cpp en b11351 mientras upstream entrega b11443. Uno es un electrodoméstico, el otro es la sala de máquinas.
2026-10-06 · 5 min de lectura

llama.cpp vs Ollama: Which Should You Run in 2026?
llama.cpp vs Ollama: Ollama wraps llama.cpp for convenience, raw llama.cpp wins on speed and control. Benchmarks, GPU offload flags, and when each wins.
2026-09-10 · 7 min de lectura

How to Run GGUF Models Locally: Ollama, llama.cpp & vLLM
How to run GGUF models locally: one-line Ollama pulls, llama.cpp straight off a Hugging Face URL, and how to pick the right quant for your VRAM.
2026-09-07 · 7 min de lectura
