> grep -r "local LLM"▋
8 篇
2026-10-06
llama.cpp 对比 Ollama——你该跑哪一个?
读公开记录,不跑分:Ollama 把自己的 llama.cpp 引擎钉在 b11351,上游已发到 b11443。一个是家电,一个是机舱。
2026-10-02
GGUF 显存计算器:下载前先算清楚
输入参数量、量化和上下文长度,输出权重、KV 缓存和逐档显卡判定——GGUF 显存计算器在下载开始之前给出答案。
2026-09-23
vLLM 能跑 GGUF 吗?能——但只在 GPU 上
vLLM 能跑 GGUF 吗?通过官方插件可以,但仅限 GPU。serve 语法、tokenizer 的坑、硬件限制,以及 llama.cpp 依然胜出的场景,一篇讲清。
2026-09-13
GGUF 量化等级:Q4_K_M 对比 Q8_0,体积与显存
GGUF 量化等级对比:Q4_K_M 与 Q8_0 的体积、显存和质量,外加一条规则——默认 Q4_K_M,只有代码和数学才往上调。
2026-09-10
llama.cpp 还是 Ollama:2026 年该跑哪一个?
llama.cpp 对比 Ollama:Ollama 为省事封装了 llama.cpp,裸 llama.cpp 赢在速度与可控性。基准测试、GPU offload 参数,以及各自何时更优。
2026-09-07
怎么在本地跑 GGUF 模型:Ollama、llama.cpp 与 vLLM
在本地跑 GGUF 模型:Ollama 一行命令直接拉取,llama.cpp 从 Hugging Face URL 直接启动,以及怎么按自己的显存挑对量化版本。
2026-09-04
写代码的本地 LLM 推荐:8GB 到 24GB 显存选型
按显存档位推荐写代码的本地 LLM:8/12/16/24 GB 各档的 Qwen3 Coder 与 DeepSeek 对比、每档该配的量化,外加一套可直接运行的 Ollama 配置。
2026-09-01
Ollama vs LM Studio:本地大模型工具怎么选?
Ollama 与 LM Studio 的实战对比:安装、GPU 调用、推理速度与 API 服务,每一步都附可直接运行的命令,看完就能选对工具。