mrsaynothing.dev
Модели решений Jev — разбор

> Модели решений Jev — разбор▋

Крошечные модели, которые отвечают на вопросы «да или нет» вероятностью для каждого варианта — волна решений Jev по релизным записям, без бенчей.

mrsaynothing· 7 октября 2026 г.· 5 мин чтения

✦ фиксcurl -fsSL https://ollama.com/install.sh | sh

Коротко: когда пайплайну нужно решение — какая очередь, разрешить или отказать, какая метка — модель решений Jev отвечает за один проход, приложив вероятность. Шесть чекпоинтов добрались до локала за эту неделю: пять разрешительных, один некоммерческий. Используйте их для решений, никогда для объяснений — и проверяйте цифрами, прежде чем доверять.

Строка честности: волне несколько дней, поэтому я прочитал записи, но не запускал. Всё здесь — из анонса Ollama, примечаний к релизу llama.cpp 0.6.0 и опубликованных карточек чекпоинтов. Бенч с настоящими задержками — это следующий материал; именно эти цифры никто не сможет стянуть парсером.

слова, которые нужны сначала
  • модель решений — крошечный ИИ, который отвечает на вопрос выбором и числом уверенности, а не фразой
  • вероятность — то самое число уверенности: 0.87 значит «в 87 случаях из 100 я сказал бы то же»
  • маршрутизация — отправить каждый входящий запрос в нужную очередь или нужному воркеру, как почтальон, выбирающий фургон для маршрута
  • калибровка — говорит ли число уверенности правду; откалиброванный 0.9 прав в 9 случаях из 10
  • GGUF — формат файлов, в которых поставляются локальные модели; имя из каждого списка загрузок

1 · Две формы ответа

Чат-модели отвечают на всё прозой. Для половины задач пайплайнов это неправильная форма. Роутеру нужна очередь. Фильтру — разрешить или отказать, насколько уверенно. Классификатору — одна метка из шести.

Попросите чат-модель о решении — получите фразу, которая означает нужное — обычно — другими словами каждый раз, плюс шаг парсинга, который тихо падает.

Вы просите одного человека разобрать почту, а он пишет вам эссе по каждому письму. Другой протягивает разобранный лоток с запиской: «уверен на 87%, это счета». Кому из них вы поверите в шесть утра?

неправильная форма спросить чат-модель чат-модель 30B пишет фразу regex / parse надеемся может быть ≈0.9? правильная форма спросить модель решений модель решений 144M – 27B { "route": "billing", p: 0.87 } { "route": "sales", p: 0.09 } { "route": "other", p: 0.04 } один проход · одна и та же форма на каждый вызов
fig 1 — один запрос, два контракта ответа: эссе на парсинг против разобранного лотка.

2 · Что волна Jev есть на самом деле

«Jev» — имя контракта API: модель принимает вопрос, фиксированный список вариантов и возвращает вероятность для каждого. Его определила TypeSafe; локальные инструменты приняли его с разницей в неделю.

Ollama выпустила локальную поддержку 29 сентября — в v0.35 появился собственный /v1/systemone, с Nimble и Tev1 доступными на старте. llama.cpp догнал в 0.6.0 (5 октября): эндпоинт /v1/systemone с пятью открытыми GGUF — Julia-1, Laya, Kev-4B, lev, OpenJev — Nimble приземлился днями позже.

Эти модели крошечные — от 144M до 27B параметров, тогда как чат-модели стартуют с 30-кратного размера. Малый размер и есть смысл: решение — это один проход, а модель, достаточно маленькая, чтобы отвечать мгновенно, меняет список задач, которым такой вопрос по карману.

Существует одно публичное сравнение точности — 13 наборов данных Bespoke Labs, 3,880 решений с человеческой разметкой: Nimble 75.7%, Tev1-4B 73.3%, Tev1-0.8B 63.5%, хостинговый Jev — 76.0%. Цифры близкие к вендорам, так что считайте их отправной точкой — значимый бенч работает на ВАШЕЙ разметке.

картинка: чат-модель — старший консультант, которого вы нанимаете почасово. Модель решений — печать на стойке регистрации: она говорит лишь, в какой лоток, и никогда не устаёт.

3 · Модели на полке

Таблица ниже — полка llama.cpp: шесть чекпоинтов, которые раздаёт её эндпоинт 0.6.0 (у библиотеки Ollama свой набор: Nimble, Tev1, Laya, Clef). Фильтруйте по лицензии — OpenJev единственная NC-позиция, которую стоит проверить, до того как её коснётся коммерческий пайплайн. MIT-лицензия рантайма llama.cpp не меняет того, что разрешают веса.

все 6 разрешительные некоммерческие
Чекпоинт Размер Лицензия Заметки
Julia-1 144M Apache-2.0 2–20 вариантов, суммарный лимит 8 192 токенов
Laya 421M Apache-2.0 Маршрутизация на английском; многоязычность не обещана
lev 4B Apache-2.0 Решения по тексту
Kev-4B 4B Apache-2.0 Предобработка опорных дат не в комплекте
Nimble 9B Apache-2.0 LoRA на Qwen3.5-9B; локально только текст
OpenJev 27B CC BY-NC 4.0 Ввод изображений через его projector; некоммерческая

Седьмая форма, Clef, вышла в том же релизе 0.6.0 (Apache-2.0, текст и изображения), а линейка Clef от Cloudflare тянется и из Ollama. Та же идея, больше дверей.

Лестница размеров читается просто: пара 144M–421M живёт на простаивающем CPU и справляется с чистой маршрутизацией; пара 4B отрабатывает себя, когда метки становятся тонкими; 27B добавляет глаза. Запустите nvidia-smi --query-gpu=memory.total --format=csv,noheader — при таких размерах подойдёт почти любая карта.

картинка: размер — это зарплата. 144M работает за копейки; 27B вы оплачиваете только когда задаче нужно смотреть на картинки.

4 · Куда встраивается — а куда нет

Встраивается, когда на выходе решение: маршрутизация запросов (тиккет → биллинг / продажи / абуз), фильтры (разрешить-или-отказать с оценкой уверенности), разбор документов потоком — классифицирует малая модель, дорогие токены большой уходят только на отмеченное.

Не встраивается, когда нужны причины. У метки с вероятностью причин нет. Как только пайплайну нужно «почему», вы возвращаетесь к чат-модели — или к чтению документов своими глазами.

Не встраивается, когда нужна правда через консенсус. Согласие моделей — не проверка. Единогласный неверный ответ приходит самым уверенным голосом из всех — ровно тот режим отказа, который наши регистры существуют, чтобы ловить.

Тихая фича: вероятность и есть ответ

Чат-модель, говорящая «это, вероятно, биллинг», прячет собственную калибровку — вы получаете одну формулировку, один раз. Модель решений отдаёт число, а 0.51 и 0.99 — разные решения: ниже вашего порога — эскалация человеку вместо действия. Говорит ли это число правду на ВАШЕЙ разметке, в примечаниях к релизу не написано. Для того и бенч — и потому он следующий пост.

verify: ollama run qwen3:0.6b "Reply YES or NO: is 7 prime?" — ответ в один токен без приложенного эссе значит, что форма работает и у вас.

дальше по волне: llama.cpp против Ollama · Ollama не видит ваш GPU — а весь local-LLM живёт в хабе local LLM.

faq

— mrsaynothing

$ Поделиться

$ Следующий гайд — на почту

Одно письмо на пост. Починил — пошёл дальше.

self-hosted · никаких третьих сторон · отписка в один клик

что это?