Về blog

Ollama vs LM Studio: Nên dùng công cụ LLM local nào?

1 tháng 9, 2026

Ollama vs LM Studio trong một dòng: chọn LM Studio nếu bạn muốn một GUI desktop để duyệt và chat với model; chọn Ollama nếu bạn muốn một local API server nhẹ và script được. Cả hai đều miễn phí, đều chạy model GGUF trên GPU hoặc CPU của bạn, và đều serve được endpoint tương thích OpenAI — nên nhiều dev cài cả hai và dùng cho việc khác nhau. Bài này so sánh cài đặt, xử lý GPU, tốc độ và serving API bằng lệnh thật chạy được ngay, để bạn thôi lướt thread Reddit và bắt đầu generate token ngay trên máy.

Ollama và LM Studio khác nhau ở điểm nào?

Khác biệt cốt lõi nằm ở giao diện và mục đích:

  • Ollama là một runtime ưu tiên CLI. Bạn pull model bằng một lệnh và nó chạy như service nền trên localhost:11434, expose REST API. Không có cửa sổ chat sẵn — nó được dựng để làm “Docker cho LLM”, chỗ các tool khác cắm vào.
  • LM Studio là ứng dụng desktop hoàn chỉnh (Electron) với trình duyệt tìm model, chat UI, tuỳ chọn theo từng model (context length, GPU offload layers, temperature) và chế độ local server bật bằng một cú click.

Cả hai đều hiểu định dạng GGUF và đều cùng chung một dòng engine bên dưới — Ollama nhúng llama.cpp, còn LM Studio dùng runtime dựa trên llama.cpp mà nó tự tải và cập nhật cho bạn. Nghĩa là chất lượng generate thô với cùng một file model là như nhau; hai tool chỉ khác nhau ở mọi thứ xung quanh model.

Ollama có miễn phí cho mục đích thương mại không?

Có. Ollama là open source (MIT) và miễn phí cho mục đích thương mại — điều bạn cần tuân là license của model, không phải của Ollama. Llama, Mistral, Qwen và Gemma mỗi bên có điều khoản riêng, nên đọc model card trước khi đóng gói sản phẩm trên một model nào đó.

LM Studio miễn phí cho mục đích cá nhân nhưng license closed source: dùng cho công việc cần bật cờ “work” license (miễn phí), còn công ty vượt ngưỡng doanh thu thì phải trả tiền. Nếu đội mua sắm của công ty bạn hỏi cho kỹ, riêng khác biệt đó đã đủ xử xong cuộc tranh luận Ollama vs LM Studio.

Ollama có tự dùng GPU của bạn không?

Có — Ollama nhận diện CUDA (NVIDIA), Metal (Apple Silicon) và ROCm (AMD) khi khởi động và offload tối đa số layer vừa với VRAM. Hai cách kiểm tra đáng nhớ:

# Ollama thực sự đã load lên gì — GPU hay CPU?
ollama ps

# Buộc nó dùng GPU nếu nó âm thầm fallback về CPU:
OLLAMA_NUM_GPU=999 ollama run qwen2.5-coder:7b

Nếu ollama ps hiện 100% GPU, model đã lên GPU; tỉ lệ kiểu 48%/52% CPU/GPU nghĩa là model không vừa và bạn sẽ cảm nhận được qua tokens/sec. LM Studio expose cùng control đó thành thanh trượt GPU offload cho từng model, thân thiện hơn khi bạn muốn thử nghiệm — một trong vài điểm UX thật sự tốt hơn của nó.

Ollama hay LM Studio nhanh hơn?

Với cùng model, cùng mức quantisation và phần cứng: hoà, vì cả hai đều đẩy việc chạy xuống llama.cpp. Những claim benchmark kiểu “Ollama nhanh hơn” hay ngược lại thường so hai quant khác nhau hoặc hai context length khác nhau. Đo trên chính máy của bạn thay vì tin phe nào:

# Ollama: --verbose in eval rate (tokens/sec) ở cuối
ollama run qwen2.5-coder:7b --verbose "Summarise what a Makefile does in one sentence."

Trong LM Studio, load cùng file GGUF với context length và GPU layers giống hệt, rồi xem tokens/sec trong panel stats của chat. Bên nào ra số cao hơn, chạy lại thử nghiệm thêm hai lần — lần load đầu luôn lẫn nhiễu warm-up.

Chạy LM Studio làm local API server được không?

Được — vào tab Developer, bật server, và bạn có ngay endpoint tương thích OpenAI trên localhost:1234. Nó còn có CLI (lms) để viết script:

lms server start
lms load qwen2.5-coder-7b-instruct --gpu max
curl http://localhost:1234/v1/chat/completions 
  -H "Content-Type: application/json" 
  -d '{"model":"qwen2.5-coder-7b-instruct","messages":[{"role":"user","content":"Write a jq filter for the top process by CPU"}]}'

API tương đương của Ollama luôn bật khi service đang chạy, và endpoint gốc cùng các route tương thích OpenAI không cần cấu hình gì:

curl -fsSL https://ollama.com/install.sh | sh   # cài trên Linux
ollama pull qwen2.5-coder:7b
curl http://localhost:11434/api/chat -d '{
  "model": "qwen2.5-coder:7b",
  "messages": [{"role": "user", "content": "Explain bash exit codes in two lines"}],
  "stream": false
}'

Cả hai cắm thẳng vào bất kỳ tool nào nói tiếng OpenAI API — extension VS Code, coding agent, script của chính bạn. Đây là chỗ Ollama vượt lên: service khởi động cùng máy, chạy headless trên server hoặc homelab, và không thứ gì phụ thuộc vào việc một app desktop đang mở. Mình chạy đúng setup này trên homelab của mình, nơi Ollama serve model cho mọi thứ trong mạng còn head node thì không cần chuột.

Nên chọn Ollama hay LM Studio?

Tiêu chíOllamaLM Studio
Giao diệnCLI + REST APIGUI desktop đầy đủ
Open sourceMIT, hoàn toànClosed, tier cá nhân miễn phí
Dùng thương mạiMiễn phíTrả phí khi mở rộng
Quản lý modelollama pull <model>Tìm kiếm + tải tích hợp sẵn
Chat UIKhông (tự lo)Tích hợp sẵn
API endpoint:11434 luôn bật:1234 bật/tắt
Chạy headless/serverXuất sắcLúng túng
Windows / macOS / LinuxCả baWindows + macOS, Linux đang beta

Kinh nghiệm chọn nhanh, không hối hận theo hướng nào:

  1. Bạn muốn dùng model — chat, thử nghiệm, vặn đủ loại thanh trượt: LM Studio.
  2. Bạn muốn xây trên model — script, agent, CI, một dịch vụ API tại nhà: Ollama.
  3. Bạn muốn cả hai — cài cả hai; chúng sống chung tốt (chỉ đừng để hai server giành chung một port, và nhớ một model load hai lần là tốn gấp đôi VRAM).

Model local ghép đặc biệt hợp với coding tool dạng agentic — trỏ một client tương thích OpenAI vào local endpoint của bạn và bạn có completions không giới hạn với chi phí mỗi token bằng zero. Bộ đôi này nuôi setup local-first đằng sau freechat, và đây là cách rẻ nhất để học hệ thống LLM: hoá đơn duy nhất là tiền điện.

— mrsaynothing

— mrsaynothing

Ghi chú thực địa về AI, Linux và self-hosting.

Thảo luận bài này trên dev.to dev.to ↗

Nhận how-to tiếp theo qua email

Một email mỗi bài viết. Sửa xong rồi đi tiếp.

self-hosted · không bên thứ ba · hủy đăng ký một cú bấm

cái này là gì?

Thích kiểu viết này? Tôi build như vậy để kiếm sống. thuê tôi