mrsaynothing.dev
Modelos de decisión Jev, explicados

> Modelos de decisión Jev, explicados▋

Modelos diminutos que responden sí o no con una probabilidad por opción — la ola de decisiones Jev, leída del registro de versiones, no del banco.

mrsaynothing· 7 de octubre de 2026· 6 min de lectura

✦ arreglocurl -fsSL https://ollama.com/install.sh | sh

La versión corta: cuando un pipeline necesita una decisión — qué cola, permitir o denegar, qué etiqueta — un modelo de decisión Jev responde en una pasada con una probabilidad adjunta. Seis checkpoints llegaron en local esta semana: cinco permisivos, uno no comercial. Úsalos para decidir, nunca para justificar — y mide los números antes de confiar en ellos.

La línea de honestidad: esta ola tiene días de vida, así que leí el registro, no lo ejecuté. Todo aquí viene del anuncio de Ollama, de las notas de la versión 0.6.0 de llama.cpp y de las checkpoint cards publicadas. El bench con latencias reales es la continuación — esos números son justo los que nadie puede copiarnos.

las palabras que necesitas primero
  • modelo de decisión — una IA diminuta que responde una pregunta con una elección y un número de confianza, no con una frase
  • probabilidad — el número de confianza: 0.87 significa «87 de cada 100 veces diría lo mismo»
  • enrutamiento — mandar cada solicitud entrante a la cola o al trabajador correcto, como un cartero que reparte sus rutas
  • calibración — si el número de confianza dice la verdad; un 0.9 calibrado acierta 9 de cada 10 veces
  • GGUF — el formato de archivo en que llegan los modelos locales; el nombre en toda lista de descarga

1 · Las dos formas de responder

Los modelos de chat responden todo con prosa. Es la forma equivocada para la mitad de lo que los pipelines necesitan. Un router quiere qué cola. Un filtro quiere permitir o denegar, con cuánta certeza. Un clasificador quiere una etiqueta de seis.

Pídele una decisión a un modelo de chat y obtienes una frase que significa lo correcto — normalmente — con otras palabras cada vez, más un paso de parseo que falla en silencio.

Le pides a una persona que ordene el correo y te escribe un ensayo sobre cada carta. La otra te entrega una bandeja ordenada con una nota adhesiva: «87 % seguro de que esta es la pila de recibos». ¿A cuál le crees a las 6 a.m.?

la forma equivocada pregunta a un modelo de chat modelo de chat 30B escribe una frase regex / parse rezar quizás ≈0.9? la forma correcta pregunta a un modelo de decisión modelo de decisión 144M – 27B { "route": "billing", p: 0.87 } { "route": "sales", p: 0.09 } { "route": "other", p: 0.04 } una pasada · la misma forma en cada llamada
fig 1 — la misma solicitud, dos contratos de salida: un ensayo que parsear contra una bandeja ordenada.

2 · Qué es realmente la ola Jev

«Jev» es el nombre del contrato de API: un modelo que recibe una pregunta, una lista fija de opciones y devuelve una probabilidad para cada una. Lo definió TypeSafe; las herramientas locales lo adoptaron con una semana de diferencia.

Ollama lanzó el soporte local el 29 de septiembre — la v0.35 ganó su propio /v1/systemone, con Nimble y Tev1 descargables desde el arranque. llama.cpp siguió en la 0.6.0 (5 de octubre): un endpoint /v1/systemone que sirve cinco GGUF abiertos — Julia-1, Laya, Kev-4B, lev, OpenJev — con Nimble llegando días después.

Estos modelos son diminutos — de 144M a 27B parámetros, cuando los modelos de chat empiezan en 30 veces eso. Pequeño es el punto: una decisión es una pasada, y un modelo lo bastante pequeño para sentirse instantáneo cambia qué trabajos pueden permitirse preguntar.

Existe una sola comparación pública de precisión — los 13 conjuntos de datos de Bespoke Labs, 3,880 decisiones etiquetadas por humanos: Nimble 75.7%, Tev1-4B 73.3%, Tev1-0.8B 63.5%, con el Jev alojado en 76.0%. Cifras cercanas a los proveedores, así que tómalas como punto de partida — el bench que importa corre sobre TUS etiquetas.

imagínalo: un modelo de chat es un consultor senior que contratas por hora. Un modelo de decisión es el sello del mostrador — solo dice qué bandeja, y nunca se cansa.

3 · Los modelos en el estante

La tabla de abajo es el estante de llama.cpp — los seis checkpoints que su endpoint 0.6.0 sirve (la librería de Ollama trae su propio lote: Nimble, Tev1, Laya, Clef). Filtra por licencia — OpenJev es la única entrada NC que revisar antes de que un pipeline comercial la toque. Que el runtime de llama.cpp sea MIT no cambia lo que los pesos permiten.

los 6 permisivos no comerciales
Checkpoint Tamaño Licencia Notas
Julia-1 144M Apache-2.0 2–20 opciones, límite combinado de 8192 tokens
Laya 421M Apache-2.0 Enrutamiento en inglés; no asumas que es multilingüe
lev 4B Apache-2.0 Decisiones sobre texto
Kev-4B 4B Apache-2.0 Preprocesamiento de fechas de referencia no incluido
Nimble 9B Apache-2.0 LoRA sobre Qwen3.5-9B; solo texto en local
OpenJev 27B CC BY-NC 4.0 Entrada de visión vía su projector; no comercial

Una séptima forma, Clef, llegó en la misma versión 0.6.0 (Apache-2.0, texto y visión), y la línea Clef de Cloudflare también se descarga desde Ollama. Misma idea, más puertas.

La escalera de tamaños se lee simple: el par 144M–421M corre en una CPU inactiva y resuelve enrutamiento limpio; el par 4B gana su lugar cuando las etiquetas se vuelven sutiles; el 27B suma ojos. Corre nvidia-smi --query-gpu=memory.total --format=csv,noheader — a estos tamaños, casi cualquier tarjeta califica.

imagínalo: el tamaño es el salario. La de 144M hace el trabajo por centavos; a la de 27B solo la pagas cuando el trabajo necesita mirar imágenes.

4 · Dónde encaja — y dónde no

Encaja cuando la salida es una decisión: enrutamiento de solicitudes (ticket → facturación / ventas / abuso), filtros (permitir-o-denegar con puntaje de confianza) y triage de documentos a volumen — clasifica con el modelo pequeño y gasta tokens del modelo grande solo en lo que marca.

No encaja cuando necesitas razones. Una etiqueta con probabilidad no trae razones adjuntas. En cuanto el pipeline pregunta «por qué», vuelves a un modelo de chat — o a leer los documentos tú mismo.

No encaja cuando necesitas verdad por consenso. El acuerdo entre modelos no es verificación. Una respuesta errónea por unanimidad llega con la voz más segura de todas — exactamente el modo de falla que nuestros registros existen para cazar.

La función silenciosa: la probabilidad es la respuesta

Un modelo de chat que dice «esto probablemente es facturación» esconde su propia calibración — recibes una sola redacción, una vez. Un modelo de decisión te entrega el número, y 0.51 y 0.99 son decisiones distintas: por debajo de tu umbral, escala a un humano en vez de actuar. Que ese número diga la verdad sobre TUS etiquetas no está en las notas de versión. Para eso es el bench — y por eso es el siguiente post.

verify: ollama run qwen3:0.6b "Reply YES or NO: is 7 prime?" — una respuesta de un token sin ensayo adjunto significa que la forma funciona en tu máquina.

lo siguiente en esta ola: llama.cpp vs Ollama · Ollama no usa tu GPU — y todo lo local-LLM vive en el hub local LLM.

faq

— mrsaynothing

$ Compartir este artículo

$ Recibe el próximo how-to por email

Un email por post. Arréglalo y sigue.

self-hosted · sin terceros · baja con un clic

¿qué es esto?