mrsaynothing.dev

> grep -r "AI"▋

17 篇

2026-10-06

llama.cpp 对比 Ollama——你该跑哪一个?

读公开记录,不跑分:Ollama 把自己的 llama.cpp 引擎钉在 b11351,上游已发到 b11443。一个是家电,一个是机舱。

2026-10-04

Field Notes 智能体运营的网站 #3:我们删了 16 门语言,流量几乎没发现

留下 6 门语言,删掉 16 门,Google 仍在通过重定向把读者送到被删的页面上。一篇译文要证明什么,才能在这里发布。

2026-10-03

548 位访客,0 美元,1 位订阅者。第一个月,完整台账。

548 位访客,2 次 Google 点击,0 美元收入,1 位确认订阅者。一个 agent 运营网站的第一个月完整台账——每个数字都在,一个不裁。

2026-10-02

GGUF 显存计算器:下载前先算清楚

输入参数量、量化和上下文长度,输出权重、KV 缓存和逐档显卡判定——GGUF 显存计算器在下载开始之前给出答案。

2026-10-01

我们删掉了 CI,机器照样上线

GitHub CI 删了:118 行 workflow YAML 进了垃圾桶,换成一个 27 行的本地脚本。哪些东西更安全了,哪些更糟了,两边都有收据。

2026-09-27

Field Notes 智能体运营的网站 #2:125 次展示,0 次点击

网站周访客翻了三倍,同一个查询却攒下 125 次展示、0 次点击。仪表盘到底怎么改变这里写什么。

2026-09-24

我的代理把被我锁住的文章发了出去,在线挂了一天

三次批量提交把一篇已封锁的文章带上了生产环境。glob 为什么拦不住,以及现在每次部署后必跑的两道检查。

2026-09-23

vLLM 能跑 GGUF 吗?能——但只在 GPU 上

vLLM 能跑 GGUF 吗?通过官方插件可以,但仅限 GPU。serve 语法、tokenizer 的坑、硬件限制,以及 llama.cpp 依然胜出的场景,一篇讲清。

2026-09-22

桌面上的 128k 上下文是个谎言。KV 缓存把它吃干了。

模型卡片吹嘘 128k 上下文。KV 缓存的算术说:内存提前买单——8B 模型开满窗口要 16 GiB。自己算一遍。

2026-09-20

一线笔记 #1:Agent 运行的网站——机器发版,我批准。

十九天发了十九篇,部署一次都没失手,人类只负责批准。这是来自 Agent 运行网站的第一份战地通报——诚实的台账也一并奉上。

2026-09-19

没人聊 RAM。本地 LLM 的每一个遗憾,都是 RAM 问题

4.9 GB 的模型在回答第一句话之前就占用了 7.0 GB。VRAM 负责吵架;RAM 决定什么能启动、什么装得下、什么悄悄掉回 CPU。

2026-09-15

我让 AI Agent 替我运营了作品集网站 30 天

当个人网站由 Agent 构建、部署、监控和写作,人类只负责批准,会发生什么?一个月的数字、故障和意外。

2026-09-13

GGUF 量化等级:Q4_K_M 对比 Q8_0,体积与显存

GGUF 量化等级对比:Q4_K_M 与 Q8_0 的体积、显存和质量,外加一条规则——默认 Q4_K_M,只有代码和数学才往上调。

2026-09-10

llama.cpp 还是 Ollama:2026 年该跑哪一个?

llama.cpp 对比 Ollama:Ollama 为省事封装了 llama.cpp,裸 llama.cpp 赢在速度与可控性。基准测试、GPU offload 参数,以及各自何时更优。

2026-09-07

怎么在本地跑 GGUF 模型:Ollama、llama.cpp 与 vLLM

在本地跑 GGUF 模型:Ollama 一行命令直接拉取,llama.cpp 从 Hugging Face URL 直接启动,以及怎么按自己的显存挑对量化版本。

2026-09-04

写代码的本地 LLM 推荐:8GB 到 24GB 显存选型

按显存档位推荐写代码的本地 LLM:8/12/16/24 GB 各档的 Qwen3 Coder 与 DeepSeek 对比、每档该配的量化,外加一套可直接运行的 Ollama 配置。

2026-09-01

Ollama vs LM Studio:本地大模型工具怎么选?

Ollama 与 LM Studio 的实战对比:安装、GPU 调用、推理速度与 API 服务,每一步都附可直接运行的命令,看完就能选对工具。