mrsaynothing.dev
Чего модели решений не могут: шесть честных ограничений

> Чего модели решений не могут: шесть честных ограничений▋

Две из шести новых локальных моделей решений некоммерческие, ни одна не объясняет свой ответ, а число уверенности — заявление, пока вы не прогоните бенчмарк. Волна, прочитанная против течения.

mrsaynothing· 8 октября 2026 г.· 3 мин чтения

Коротко: используйте их для решений, никогда для причин. Две из шести — некоммерческие. Напечатанные лимиты — число опций, потолки токенов, языковые пробелы — реальны и отказывают молча. А число уверенности — заявление, пока кто-то не прогонит его на реальных метках.

Для кого это: для тех, кто вот-вот подключит свежий API в продакшн, потому что release notes были захватывающими. Это другая половина разговора — первая половина здесь.

запрос невинный с виду модель решений штамп: уверен на 0.99 лоток A не тот лоток B куда следовало штамп — не доказательство
fig 1 — уверенный лоток: вероятность сортирует, никто не проверяет.

Шесть ограничений

  1. В коробке нет причин. Модель решений возвращает метку и число. Почему именно эта метка — доказательства, контраргумент, сомнение — в выводе отсутствует, за любые деньги. Как только пайплайну нужно «почему», вы снова у чат-модели или человека.
  2. Согласие — не проверка. Спросите три модели, получите три одинаковых ответа — и у вас одно мнение в трёх экземплярах. Единогласный неверный ответ приходит в уверенном лотке — отсортирован, проштампован и неверен при 0.99. Консенсусу нужна независимая эталонная точка, а ни одна из этих моделей её не приносит.
  3. Лицензионные стены настоящие. Julia-1, Laya, lev и Kev-4B — Apache-2.0. Nimble и OpenJev — CC BY-NC 4.0, некоммерческие, точка. Рантайм llama.cpp — MIT, и это ничего не говорит о весах: карточка чекпоинта важнее бейджа лицензии репозитория — каждый раз.
  4. На карте модальностей есть дыры. Laya — только английский, не маршрутизируйте через неё многоязычный трафик. Nimble локально — только текст. Вход vision у OpenJev требует собственного проектора. Kev-4B поставляется без ожидаемой предобработки по опорной дате. Каждая дыра напечатана; ни одной не видно со стороны API.
  5. Лимиты напечатаны на коробке. Julia-1 принимает 2–20 опций и объединённый вопрос до 8 192 токенов — выйдите за любое из ограничений, и отказ будет тихим, а не ошибкой. Скормить модели решений документ на 12k токенов — не растянуть её; это использование другого продукта, не того, что отгрузили.
  6. Сервинг — не доказательство. Новый эндпоинт, возвращающий числа, — факт сантехники, а не точности. Опубликованные цены за миллион токенов и поддержка сервинга ничего не говорят о честности вероятности на ваших метках. Ответит только бенчмарк на реальном трафике — и его ещё никто не публиковал. Эта дыра — возможность, и она наша.

Что выдерживает, несмотря на все шесть

Масштаб сужается, а не ценность. Однопроходные маршрутизация, фильтрация и триаж — где на выходе решение, а последствия несёт человек — остаются самым чистым применением локального ИИ за год. Мало, быстро, без счёта за токены и честно о своей природе штампа. Режим отказа, под который надо проектировать, — уверенный лоток: задайте порог, эскалируйте ниже него и никогда не позволяйте штампу иметь последнее слово в том, что важно.

Запомните: вероятность — это заявление. Штамп ≠ правильная сортировка. Бенчмарк на ваших метках — прежде чем лоток станет истиной.

Дальше — бенчмарк: Julia-1 против Laya на реальных метках маршрутизации, калибровка по размеру, латентность по железу. Если числа уверенности выдержат — волна это заслужила. Если нет — этот пост уже сказал об этом.

$ Частые вопросы

Могут ли модели решений объяснять свои ответы?

Нет. Модель решений возвращает метку с вероятностью — причин в выводе нет. Как только вашему пайплайну нужно «почему», вы возвращаетесь к чат-модели или к человеку.

Все ли локальные модели решений под открытыми лицензиями?

Нет. Julia-1, Laya, lev и Kev-4B — Apache-2.0, но Nimble и OpenJev — CC BY-NC 4.0, некоммерческие. То, что рантайм llama.cpp под MIT, не меняет того, что разрешают веса модели.

Означает ли высокая вероятность, что ответ верен?

Пока не измерено — нет. Эндпоинт, возвращающий 0.99, делает заявление, а не даёт доказательство — опубликованные цены API и поддержка сервинга ничего не говорят о точности на ваших метках.

$ Поделиться

$ Следующий аргумент — на почту

Одно письмо на пост. Согласиться или разобрать.

self-hosted · никаких третьих сторон · отписка в один клик

Одно письмо, еженедельная сводка. Ноль пикселей.

что это?

← Назад в блог