
> 决策模型做不到的事:六个诚实的限制▋
六个新的本地决策模型里有两个不可商用,没有一个能解释自己,置信度数字在跑过基准之前只是声明。这波浪潮,反着读。
mrsaynothing· 2026年10月8日· 1 分钟读完
短版本:拿它们做决策,永远别拿它们要理由。六个里有两个不可商用。印在盒上的限制——选项数、token 上限、语言缺口——都是真的,而且静默失败。置信度数字在有人拿真实标签跑过基准之前,只是个声明。
写给谁:因为 release notes 很激动就准备把新鲜 API 接进生产的你。这是对话的另一半——前一半在这里。
六个限制
- 盒子里没有理由。决策模型返回标签和数字。为什么是这个标签——证据、反方论点、疑虑——不在输出里,出多高价都不在。一旦你的流水线需要「为什么」,你就回到了聊天模型或人类。
- 一致不是验证。问三个模型,得到三个相同的答案,你只是把一个观点复印了三份。一致错误的答案会落进自信的托盘——分好类、盖好章,错到 0.99 都理直气壮。共识需要独立参照物才有意义,这些模型一个都没带。
- 许可墙是真的。Julia-1、Laya、lev 和 Kev-4B 是 Apache-2.0。Nimble 和 OpenJev 是 CC BY-NC 4.0——不可商用,句号。llama.cpp 运行时是 MIT,这改变不了权重的任何事:checkpoint 卡片每次都压过仓库的许可徽章。
- 模态地图上有洞。Laya 只有英语——别把多语言流量路由给它。Nimble 本地只有文本。OpenJev 的视觉输入需要自己的投影器。Kev-4B 出厂不带它期待的参考日期预处理。每个洞都印在说明书上;从 API 侧一个都看不见。
- 限制印在盒子上。Julia-1 接受 2–20 个选项和总共 8,192 token 的问题——越界任何一条,失败都是静默的,不是报错。给决策模型喂 12k token 的文档不是压榨它;那是在用一个和出厂时不同的产品。
- 能调用不等于被证明。一个返回数字的新端点是管道事实,不是精度事实。公开的每百万 token 定价和 serving 支持说明不了概率在你的标签上诚不诚实。只有拿真实流量跑基准才能回答——而还没人发表过。这个缺口就是机会,而且是我们的。
尽管有这六条,什么仍然成立
范围变小了,价值没有。单次推理的路由、门控和分诊——输出是一个决策、后果由人承担——仍然是本地 AI 这一年来最干净的用武之地。小、快、没有按 token 计的账单,而且诚实于自己只是个图章。要为它设计的失败模式就是自信的托盘:设一个阈值,低于就升级,永远别让图章在任何要紧事上拥有最后发言权。
记住这句:概率是声明。盖了章 ≠ 分对了。先在你的标签上跑基准,再让托盘说了算。
接下来是基准篇:Julia-1 对阵 Laya,真实路由标签、按尺寸的校准、按硬件的延迟。如果置信度数字站得住,这波浪潮就配得上。站不住——这篇文章已经先说过了。
$ 常见问题
决策模型能解释自己的答案吗?
不能。决策模型返回一个标签加一个概率——原因不在输出里。一旦你的流水线需要「为什么」,你就回到了聊天模型或人类。
本地决策模型都是开放许可吗?
不是。Julia-1、Laya、lev 和 Kev-4B 是 Apache-2.0,但 Nimble 和 OpenJev 是 CC BY-NC 4.0——不可商用。llama.cpp 运行时是 MIT,改变不了模型权重的许可。
概率高就意味着答案是对的吗?
没测过就不算。返回 0.99 的端点是在声明,不是在证明——公开的 API 定价和 serving 支持说明不了它在你的标签上准不准。
$ 相关文章 · local llm
Jev 决策模型详解
用每个选项都带概率的方式回答是非题的微型模型——Jev 决策浪潮,读的是发布记录,不是跑分。
2026-10-07 · 2 分钟读完

llama.cpp vs Ollama — which one should you run?
The record read, not run: Ollama pins its llama.cpp engine at b11351 while upstream ships b11443. One is an appliance, one is the engine room.
2026-10-06 · 5 分钟读完

How to Run GGUF Models Locally: Ollama, llama.cpp & vLLM
How to run GGUF models locally: one-line Ollama pulls, llama.cpp straight off a Hugging Face URL, and how to pick the right quant for your VRAM.
2026-09-07 · 7 分钟读完
