mrsaynothing.dev
决策模型做不到的事:六个诚实的限制

> 决策模型做不到的事:六个诚实的限制▋

六个新的本地决策模型里有两个不可商用,没有一个能解释自己,置信度数字在跑过基准之前只是声明。这波浪潮,反着读。

mrsaynothing· 2026年10月8日· 1 分钟读完

短版本:拿它们做决策,永远别拿它们要理由。六个里有两个不可商用。印在盒上的限制——选项数、token 上限、语言缺口——都是真的,而且静默失败。置信度数字在有人拿真实标签跑过基准之前,只是个声明。

写给谁:因为 release notes 很激动就准备把新鲜 API 接进生产的你。这是对话的另一半——前一半在这里。

请求 看起来无害 决策模型 盖章:0.99 确定 托盘 A 错误的那个 托盘 B 它该去的地方 盖章不等于 证明
fig 1 — 自信的托盘:概率负责分类,没人负责核对。

六个限制

  1. 盒子里没有理由。决策模型返回标签和数字。为什么是这个标签——证据、反方论点、疑虑——不在输出里,出多高价都不在。一旦你的流水线需要「为什么」,你就回到了聊天模型或人类。
  2. 一致不是验证。问三个模型,得到三个相同的答案,你只是把一个观点复印了三份。一致错误的答案会落进自信的托盘——分好类、盖好章,错到 0.99 都理直气壮。共识需要独立参照物才有意义,这些模型一个都没带。
  3. 许可墙是真的。Julia-1、Laya、lev 和 Kev-4B 是 Apache-2.0。Nimble 和 OpenJev 是 CC BY-NC 4.0——不可商用,句号。llama.cpp 运行时是 MIT,这改变不了权重的任何事:checkpoint 卡片每次都压过仓库的许可徽章。
  4. 模态地图上有洞。Laya 只有英语——别把多语言流量路由给它。Nimble 本地只有文本。OpenJev 的视觉输入需要自己的投影器。Kev-4B 出厂不带它期待的参考日期预处理。每个洞都印在说明书上;从 API 侧一个都看不见。
  5. 限制印在盒子上。Julia-1 接受 2–20 个选项和总共 8,192 token 的问题——越界任何一条,失败都是静默的,不是报错。给决策模型喂 12k token 的文档不是压榨它;那是在用一个和出厂时不同的产品。
  6. 能调用不等于被证明。一个返回数字的新端点是管道事实,不是精度事实。公开的每百万 token 定价和 serving 支持说明不了概率在你的标签上诚不诚实。只有拿真实流量跑基准才能回答——而还没人发表过。这个缺口就是机会,而且是我们的。

尽管有这六条,什么仍然成立

范围变小了,价值没有。单次推理的路由、门控和分诊——输出是一个决策、后果由人承担——仍然是本地 AI 这一年来最干净的用武之地。小、快、没有按 token 计的账单,而且诚实于自己只是个图章。要为它设计的失败模式就是自信的托盘:设一个阈值,低于就升级,永远别让图章在任何要紧事上拥有最后发言权。

记住这句:概率是声明。盖了章 ≠ 分对了。先在你的标签上跑基准,再让托盘说了算。

接下来是基准篇:Julia-1 对阵 Laya,真实路由标签、按尺寸的校准、按硬件的延迟。如果置信度数字站得住,这波浪潮就配得上。站不住——这篇文章已经先说过了。

$ 常见问题

决策模型能解释自己的答案吗?

不能。决策模型返回一个标签加一个概率——原因不在输出里。一旦你的流水线需要「为什么」,你就回到了聊天模型或人类。

本地决策模型都是开放许可吗?

不是。Julia-1、Laya、lev 和 Kev-4B 是 Apache-2.0,但 Nimble 和 OpenJev 是 CC BY-NC 4.0——不可商用。llama.cpp 运行时是 MIT,改变不了模型权重的许可。

概率高就意味着答案是对的吗?

没测过就不算。返回 0.99 的端点是在声明,不是在证明——公开的 API 定价和 serving 支持说明不了它在你的标签上准不准。

$ 分享这篇文章

$ 下一篇观点,直达邮箱

每篇一封。同意也好,拆解也好。

self-hosted · 无第三方 · 一键退订

每周一封邮件。零跟踪像素。

这是什么?

← 返回博客