返回博客

Ollama vs LM Studio:本地大模型工具怎么选?

2026年9月1日

一句话结论:想要桌面 GUI 浏览模型、随手对话,选 LM Studio;想要轻量、可脚本化的本地 API 服务,选 Ollama。两者都免费,都能在自己的 GPU 或 CPU 上跑 GGUF 模型,也都能提供 OpenAI 兼容端点——所以不少开发者干脆两个都装,各司其职。这篇对比覆盖安装、GPU 调用、速度和 API 服务,每一步都给你今天就能跑的命令,让你别再翻 Reddit 帖子,直接在本地把 token 跑起来。

Ollama 和 LM Studio 到底有什么区别?

核心区别在于界面和定位:

  • Ollama 是 CLI 优先的运行时。一条命令拉下模型,它就以后台服务的形式跑在 localhost:11434,对外暴露 REST API。没有内置聊天窗口——它的定位就是”LLM 界的 Docker”,让别的工具接进来。
  • LM Studio 是完整的桌面应用(Electron),带模型搜索浏览器、聊天界面、按模型调节的设置(上下文长度、GPU offload 层数、temperature),还有点一下就能开的本地服务器模式。

两者都认 GGUF 格式,底层引擎也是同一条血脉——Ollama 内置 llama.cpp,LM Studio 用的也是基于 llama.cpp 的运行时,由它替你下载和更新。也就是说,同一个模型文件,两者的原始生成质量实质上没有差别;差的是模型之外的一切。

Ollama 可以免费商用吗?

可以。Ollama 开源(MIT)且可免费商用——你要遵守的是模型的许可,不是 Ollama 的。Llama、Mistral、Qwen、Gemma 各有各的条款,真拿它做产品之前,记得看一眼模型卡片。

LM Studio 个人使用免费,但附带一份闭源许可:工作用途需要申请免费的 “work” 许可标志,营收超过门槛的公司则要付费。如果你司采购问得较真,光这一条就足以替你结束 Ollama vs LM Studio 之争。

Ollama 会自动用你的 GPU 吗?

会——Ollama 启动时自动检测 CUDA(NVIDIA)、Metal(Apple Silicon)和 ROCm(AMD),能塞进显存的层全部卸载到 GPU。两个值得记住的检查:

# Ollama 实际加载到了哪里——GPU 还是 CPU?
ollama ps

# 如果它悄悄回退到 CPU,就强制上 GPU:
OLLAMA_NUM_GPU=999 ollama run qwen2.5-coder:7b

如果 ollama ps 显示 100% GPU,说明已经全部卸载;出现 48%/52% CPU/GPU 这种对半分,说明模型没塞下,tokens/sec 上你会立刻感觉到。LM Studio 把同样的控制做成每个模型的 GPU offload 滑块,做实验时友好得多——这是它确实更顺手的少数地方之一。

Ollama 和 LM Studio 哪个更快?

同一个模型、同一种量化、同一套硬件:实质上是平手,因为两者都把活交给 llama.cpp。“Ollama 更快”之类的跑分结论,多半是在比较不同的量化或不同的上下文长度。别信任何一方,在自己的机器上量:

# Ollama:--verbose 会在结尾输出评估速率(tokens/sec)
ollama run qwen2.5-coder:7b --verbose "Summarise what a Makefile does in one sentence."

在 LM Studio 里加载同一个 GGUF 文件,上下文长度和 GPU 层数设成一致,然后看聊天统计面板里的 tokens/sec。谁数字高,再重跑两次——首次加载混着预热噪声。

LM Studio 能当本地 API 服务器用吗?

能——打开 Developer 标签页启动服务器,就得到一个 localhost:1234 上的 OpenAI 兼容端点。它甚至带了脚本化的 CLI(lms):

lms server start
lms load qwen2.5-coder-7b-instruct --gpu max
curl http://localhost:1234/v1/chat/completions 
  -H "Content-Type: application/json" 
  -d '{"model":"qwen2.5-coder-7b-instruct","messages":[{"role":"user","content":"Write a jq filter for the top process by CPU"}]}'

Ollama 这边的 API 只要服务在跑就永远在线,原生端点加 OpenAI 兼容路由零配置:

curl -fsSL https://ollama.com/install.sh | sh   # Linux 安装
ollama pull qwen2.5-coder:7b
curl http://localhost:11434/api/chat -d '{
  "model": "qwen2.5-coder:7b",
  "messages": [{"role": "user", "content": "Explain bash exit codes in two lines"}],
  "stream": false
}'

两者都能直接插进任何说 OpenAI API 的工具——VS Code 插件、编码 agent、你自己的脚本。这正是 Ollama 拉开差距的地方:服务开机自启,在服务器或 homelab 机器上无头运行,不依赖任何桌面应用开着。我自己的 homelab 跑的就是这套:Ollama 给全网设备供模型,主控机上连鼠标都用不着。

到底该选 Ollama 还是 LM Studio?

维度OllamaLM Studio
界面CLI + REST API完整桌面 GUI
开源MIT,完全开源闭源,个人使用免费
商用免费规模化商用需付费
模型管理ollama pull <model>内置搜索 + 下载浏览器
聊天界面无(自备客户端)内置
API 端点常驻的 :11434可开关的 :1234
无头/服务器场景表现出色别扭
Windows / macOS / Linux三端全支持Windows + macOS,Linux 处于 beta

经验法则,怎么选都不后悔:

  1. 你想使用模型——聊天、试用、调滑块:LM Studio
  2. 你想在模型之上构建——脚本、agent、CI、家庭 API 服务:Ollama
  3. 两个都想要——就都装上,它们相处得很好(只是别让两个服务器抢同一个端口,也别忘了同一个模型加载两份就要吃两倍显存)。

本地模型和 agentic 编码工具尤其般配——把 OpenAI 兼容客户端指到本地端点,completion 无限量,每个 token 零成本。freechat 的 local-first 架构靠的就是这套组合,它也是学 LLM 管线最便宜的方式:唯一的账单是电费。

— mrsaynothing

Get the next one by email

One email per post. No spam, no algorithms.

self-hosted · no third parties · one-click unsubscribe

what is this?

喜欢这些文章?我的本职工作就是这样的工程。 雇用我