
> Модели решений Jev — разбор▋
Крошечные модели, которые отвечают на вопросы «да или нет» вероятностью для каждого варианта — волна решений Jev по релизным записям, без бенчей.
mrsaynothing· 7 октября 2026 г.· 5 мин чтения
curl -fsSL https://ollama.com/install.sh | shКоротко: когда пайплайну нужно решение — какая очередь, разрешить или отказать, какая метка — модель решений Jev отвечает за один проход, приложив вероятность. Шесть чекпоинтов добрались до локала за эту неделю: пять разрешительных, один некоммерческий. Используйте их для решений, никогда для объяснений — и проверяйте цифрами, прежде чем доверять.
Строка честности: волне несколько дней, поэтому я прочитал записи, но не запускал. Всё здесь — из анонса Ollama, примечаний к релизу llama.cpp 0.6.0 и опубликованных карточек чекпоинтов. Бенч с настоящими задержками — это следующий материал; именно эти цифры никто не сможет стянуть парсером.
- модель решений — крошечный ИИ, который отвечает на вопрос выбором и числом уверенности, а не фразой
- вероятность — то самое число уверенности: 0.87 значит «в 87 случаях из 100 я сказал бы то же»
- маршрутизация — отправить каждый входящий запрос в нужную очередь или нужному воркеру, как почтальон, выбирающий фургон для маршрута
- калибровка — говорит ли число уверенности правду; откалиброванный 0.9 прав в 9 случаях из 10
- GGUF — формат файлов, в которых поставляются локальные модели; имя из каждого списка загрузок
1 · Две формы ответа
Чат-модели отвечают на всё прозой. Для половины задач пайплайнов это неправильная форма. Роутеру нужна очередь. Фильтру — разрешить или отказать, насколько уверенно. Классификатору — одна метка из шести.
Попросите чат-модель о решении — получите фразу, которая означает нужное — обычно — другими словами каждый раз, плюс шаг парсинга, который тихо падает.
Вы просите одного человека разобрать почту, а он пишет вам эссе по каждому письму. Другой протягивает разобранный лоток с запиской: «уверен на 87%, это счета». Кому из них вы поверите в шесть утра?
2 · Что волна Jev есть на самом деле
«Jev» — имя контракта API: модель принимает вопрос, фиксированный список вариантов и возвращает вероятность для каждого. Его определила TypeSafe; локальные инструменты приняли его с разницей в неделю.
Ollama выпустила локальную поддержку 29 сентября — в v0.35 появился собственный /v1/systemone, с Nimble и Tev1 доступными на старте. llama.cpp догнал в 0.6.0 (5 октября): эндпоинт /v1/systemone с пятью открытыми GGUF — Julia-1, Laya, Kev-4B, lev, OpenJev — Nimble приземлился днями позже.
Эти модели крошечные — от 144M до 27B параметров, тогда как чат-модели стартуют с 30-кратного размера. Малый размер и есть смысл: решение — это один проход, а модель, достаточно маленькая, чтобы отвечать мгновенно, меняет список задач, которым такой вопрос по карману.
Существует одно публичное сравнение точности — 13 наборов данных Bespoke Labs, 3,880 решений с человеческой разметкой: Nimble 75.7%, Tev1-4B 73.3%, Tev1-0.8B 63.5%, хостинговый Jev — 76.0%. Цифры близкие к вендорам, так что считайте их отправной точкой — значимый бенч работает на ВАШЕЙ разметке.
картинка: чат-модель — старший консультант, которого вы нанимаете почасово. Модель решений — печать на стойке регистрации: она говорит лишь, в какой лоток, и никогда не устаёт.
3 · Модели на полке
Таблица ниже — полка llama.cpp: шесть чекпоинтов, которые раздаёт её эндпоинт 0.6.0 (у библиотеки Ollama свой набор: Nimble, Tev1, Laya, Clef). Фильтруйте по лицензии — OpenJev единственная NC-позиция, которую стоит проверить, до того как её коснётся коммерческий пайплайн. MIT-лицензия рантайма llama.cpp не меняет того, что разрешают веса.
| Чекпоинт | Размер | Лицензия | Заметки |
|---|---|---|---|
| Julia-1 | 144M | Apache-2.0 | 2–20 вариантов, суммарный лимит 8 192 токенов |
| Laya | 421M | Apache-2.0 | Маршрутизация на английском; многоязычность не обещана |
| lev | 4B | Apache-2.0 | Решения по тексту |
| Kev-4B | 4B | Apache-2.0 | Предобработка опорных дат не в комплекте |
| Nimble | 9B | Apache-2.0 | LoRA на Qwen3.5-9B; локально только текст |
| OpenJev | 27B | CC BY-NC 4.0 | Ввод изображений через его projector; некоммерческая |
Седьмая форма, Clef, вышла в том же релизе 0.6.0 (Apache-2.0, текст и изображения), а линейка Clef от Cloudflare тянется и из Ollama. Та же идея, больше дверей.
Лестница размеров читается просто: пара 144M–421M живёт на простаивающем CPU и справляется с чистой маршрутизацией; пара 4B отрабатывает себя, когда метки становятся тонкими; 27B добавляет глаза. Запустите nvidia-smi --query-gpu=memory.total --format=csv,noheader — при таких размерах подойдёт почти любая карта.
картинка: размер — это зарплата. 144M работает за копейки; 27B вы оплачиваете только когда задаче нужно смотреть на картинки.
4 · Куда встраивается — а куда нет
Встраивается, когда на выходе решение: маршрутизация запросов (тиккет → биллинг / продажи / абуз), фильтры (разрешить-или-отказать с оценкой уверенности), разбор документов потоком — классифицирует малая модель, дорогие токены большой уходят только на отмеченное.
Не встраивается, когда нужны причины. У метки с вероятностью причин нет. Как только пайплайну нужно «почему», вы возвращаетесь к чат-модели — или к чтению документов своими глазами.
Не встраивается, когда нужна правда через консенсус. Согласие моделей — не проверка. Единогласный неверный ответ приходит самым уверенным голосом из всех — ровно тот режим отказа, который наши регистры существуют, чтобы ловить.
Тихая фича: вероятность и есть ответ
Чат-модель, говорящая «это, вероятно, биллинг», прячет собственную калибровку — вы получаете одну формулировку, один раз. Модель решений отдаёт число, а 0.51 и 0.99 — разные решения: ниже вашего порога — эскалация человеку вместо действия. Говорит ли это число правду на ВАШЕЙ разметке, в примечаниях к релизу не написано. Для того и бенч — и потому он следующий пост.
verify: ollama run qwen3:0.6b "Reply YES or NO: is 7 prime?" — ответ в один токен без приложенного эссе значит, что форма работает и у вас.
дальше по волне: llama.cpp против Ollama · Ollama не видит ваш GPU — а весь local-LLM живёт в хабе local LLM.
faq
— mrsaynothing
$ Похожие записи
llama.cpp против Ollama — какой запускать?
Публичный след прочитан, не запущен: Ollama прибивает свой движок llama.cpp к b11351, пока upstream выпускает b11443. Один — бытовая техника, другой — машинное отделение.
2026-10-06 · 4 мин чтения

llama.cpp vs Ollama: Which Should You Run in 2026?
llama.cpp vs Ollama: Ollama wraps llama.cpp for convenience, raw llama.cpp wins on speed and control. Benchmarks, GPU offload flags, and when each wins.
2026-09-10 · 7 мин чтения

How to Run GGUF Models Locally: Ollama, llama.cpp & vLLM
How to run GGUF models locally: one-line Ollama pulls, llama.cpp straight off a Hugging Face URL, and how to pick the right quant for your VRAM.
2026-09-07 · 7 мин чтения
