一句话结论:想要桌面 GUI 浏览模型、随手对话,选 LM Studio;想要轻量、可脚本化的本地 API 服务,选 Ollama。两者都免费,都能在自己的 GPU 或 CPU 上跑 GGUF 模型,也都能提供 OpenAI 兼容端点——所以不少开发者干脆两个都装,各司其职。这篇对比覆盖安装、GPU 调用、速度和 API 服务,每一步都给你今天就能跑的命令,让你别再翻 Reddit 帖子,直接在本地把 token 跑起来。
Ollama 和 LM Studio 到底有什么区别?
核心区别在于界面和定位:
- Ollama 是 CLI 优先的运行时。一条命令拉下模型,它就以后台服务的形式跑在
localhost:11434,对外暴露 REST API。没有内置聊天窗口——它的定位就是”LLM 界的 Docker”,让别的工具接进来。 - LM Studio 是完整的桌面应用(Electron),带模型搜索浏览器、聊天界面、按模型调节的设置(上下文长度、GPU offload 层数、temperature),还有点一下就能开的本地服务器模式。
两者都认 GGUF 格式,底层引擎也是同一条血脉——Ollama 内置 llama.cpp,LM Studio 用的也是基于 llama.cpp 的运行时,由它替你下载和更新。也就是说,同一个模型文件,两者的原始生成质量实质上没有差别;差的是模型之外的一切。
Ollama 可以免费商用吗?
可以。Ollama 开源(MIT)且可免费商用——你要遵守的是模型的许可,不是 Ollama 的。Llama、Mistral、Qwen、Gemma 各有各的条款,真拿它做产品之前,记得看一眼模型卡片。
LM Studio 个人使用免费,但附带一份闭源许可:工作用途需要申请免费的 “work” 许可标志,营收超过门槛的公司则要付费。如果你司采购问得较真,光这一条就足以替你结束 Ollama vs LM Studio 之争。
Ollama 会自动用你的 GPU 吗?
会——Ollama 启动时自动检测 CUDA(NVIDIA)、Metal(Apple Silicon)和 ROCm(AMD),能塞进显存的层全部卸载到 GPU。两个值得记住的检查:
# Ollama 实际加载到了哪里——GPU 还是 CPU?
ollama ps
# 如果它悄悄回退到 CPU,就强制上 GPU:
OLLAMA_NUM_GPU=999 ollama run qwen2.5-coder:7b 如果 ollama ps 显示 100% GPU,说明已经全部卸载;出现 48%/52% CPU/GPU 这种对半分,说明模型没塞下,tokens/sec 上你会立刻感觉到。LM Studio 把同样的控制做成每个模型的 GPU offload 滑块,做实验时友好得多——这是它确实更顺手的少数地方之一。
Ollama 和 LM Studio 哪个更快?
同一个模型、同一种量化、同一套硬件:实质上是平手,因为两者都把活交给 llama.cpp。“Ollama 更快”之类的跑分结论,多半是在比较不同的量化或不同的上下文长度。别信任何一方,在自己的机器上量:
# Ollama:--verbose 会在结尾输出评估速率(tokens/sec)
ollama run qwen2.5-coder:7b --verbose "Summarise what a Makefile does in one sentence." 在 LM Studio 里加载同一个 GGUF 文件,上下文长度和 GPU 层数设成一致,然后看聊天统计面板里的 tokens/sec。谁数字高,再重跑两次——首次加载混着预热噪声。
LM Studio 能当本地 API 服务器用吗?
能——打开 Developer 标签页启动服务器,就得到一个 localhost:1234 上的 OpenAI 兼容端点。它甚至带了脚本化的 CLI(lms):
lms server start
lms load qwen2.5-coder-7b-instruct --gpu max
curl http://localhost:1234/v1/chat/completions
-H "Content-Type: application/json"
-d '{"model":"qwen2.5-coder-7b-instruct","messages":[{"role":"user","content":"Write a jq filter for the top process by CPU"}]}' Ollama 这边的 API 只要服务在跑就永远在线,原生端点加 OpenAI 兼容路由零配置:
curl -fsSL https://ollama.com/install.sh | sh # Linux 安装
ollama pull qwen2.5-coder:7b
curl http://localhost:11434/api/chat -d '{
"model": "qwen2.5-coder:7b",
"messages": [{"role": "user", "content": "Explain bash exit codes in two lines"}],
"stream": false
}' 两者都能直接插进任何说 OpenAI API 的工具——VS Code 插件、编码 agent、你自己的脚本。这正是 Ollama 拉开差距的地方:服务开机自启,在服务器或 homelab 机器上无头运行,不依赖任何桌面应用开着。我自己的 homelab 跑的就是这套:Ollama 给全网设备供模型,主控机上连鼠标都用不着。
到底该选 Ollama 还是 LM Studio?
| 维度 | Ollama | LM Studio |
|---|---|---|
| 界面 | CLI + REST API | 完整桌面 GUI |
| 开源 | MIT,完全开源 | 闭源,个人使用免费 |
| 商用 | 免费 | 规模化商用需付费 |
| 模型管理 | ollama pull <model> | 内置搜索 + 下载浏览器 |
| 聊天界面 | 无(自备客户端) | 内置 |
| API 端点 | 常驻的 :11434 | 可开关的 :1234 |
| 无头/服务器场景 | 表现出色 | 别扭 |
| Windows / macOS / Linux | 三端全支持 | Windows + macOS,Linux 处于 beta |
经验法则,怎么选都不后悔:
- 你想使用模型——聊天、试用、调滑块:LM Studio。
- 你想在模型之上构建——脚本、agent、CI、家庭 API 服务:Ollama。
- 两个都想要——就都装上,它们相处得很好(只是别让两个服务器抢同一个端口,也别忘了同一个模型加载两份就要吃两倍显存)。
本地模型和 agentic 编码工具尤其般配——把 OpenAI 兼容客户端指到本地端点,completion 无限量,每个 token 零成本。freechat 的 local-first 架构靠的就是这套组合,它也是学 LLM 管线最便宜的方式:唯一的账单是电费。
— mrsaynothing
Get the next one by email
One email per post. No spam, no algorithms.
what is this?喜欢这些文章?我的本职工作就是这样的工程。 雇用我