Voltar ao blog

Ollama vs LM Studio: qual ferramenta de LLM local usar?

1 de setembro de 2026

Ollama vs LM Studio em uma linha: escolha o LM Studio se você quer uma GUI de desktop para navegar e conversar com modelos; escolha o Ollama se você quer um servidor de API local, leve e scriptável. Os dois são gratuitos, os dois rodam modelos GGUF na sua própria GPU ou CPU e os dois servem um endpoint compatível com OpenAI — por isso muitos desenvolvedores instalam os dois e usam cada um para um tipo de trabalho. Este guia compara instalação, gerenciamento de GPU, velocidade e servir API com comandos reais que você pode rodar hoje, para você parar de ler thread de Reddit e começar a gerar tokens localmente.

Qual é a diferença entre Ollama e LM Studio?

A diferença essencial está na interface e na intenção:

  • Ollama é um runtime CLI-first. Você puxa um modelo com um comando e ele roda como serviço em segundo plano em localhost:11434, expondo uma API REST. Não tem janela de chat embutida — ele existe para ser o “Docker dos LLMs”, em que outras ferramentas se plugam.
  • LM Studio é um aplicativo de desktop completo (Electron), com navegador de busca de modelos, UI de chat, ajustes por modelo (tamanho de contexto, camadas de GPU offload, temperatura) e um modo servidor local que você liga com um clique.

Os dois entendem o formato GGUF e os dois descem da mesma linhagem de engine — o Ollama embute o llama.cpp, e o LM Studio usa runtimes baseados em llama.cpp que ele baixa e atualiza sozinho. Isso significa que a qualidade bruta de geração para o mesmo arquivo de modelo é praticamente idêntica; as ferramentas diferem em tudo o que fica ao redor do modelo.

O Ollama é gratuito para uso comercial?

Sim. O Ollama é open source (MIT) e livre para uso comercial — a única licença que você precisa respeitar é a do modelo, não a do Ollama. Llama, Mistral, Qwen e Gemma têm termos próprios, então confira o model card se for embarcar um deles num produto.

O LM Studio é gratuito para uso pessoal, mas vem com licença fechada: uso no trabalho exige uma flag de licença “work” gratuita, e empresas acima de um certo faturamento pagam por ela. Se o time de compras da sua empresa faz perguntas difíceis, só essa diferença já decide o debate Ollama vs LM Studio.

O Ollama usa sua GPU automaticamente?

Sim — o Ollama detecta CUDA (NVIDIA), Metal (Apple Silicon) e ROCm (AMD) na inicialização e manda para a VRAM quantas camadas couberem. Dois checks que valem a pena conhecer:

# O que o Ollama carregou de fato — GPU ou CPU?
ollama ps

# Force a barra se ele caiu para a CPU sem avisar:
OLLAMA_NUM_GPU=999 ollama run qwen2.5-coder:7b

Se o ollama ps mostra 100% GPU, o offload aconteceu; um split tipo 48%/52% CPU/GPU significa que o modelo não coube e você vai sentir nos tokens/s. O LM Studio expõe o mesmo controle como um slider de GPU offload por modelo, o que é mais amigável para experimentar — um dos pontos de UX em que ele é genuinamente melhor.

Qual é mais rápido: Ollama ou LM Studio?

Para o mesmo modelo, quantização e hardware: empate técnico, porque os dois delegam ao llama.cpp. Benchmarks de “Ollama é mais rápido” (ou o contrário) geralmente comparam quants ou tamanhos de contexto diferentes. Meça na sua própria máquina em vez de confiar em qualquer um dos lados:

# Ollama: --verbose imprime a taxa de eval (tokens/s) no final
ollama run qwen2.5-coder:7b --verbose "Summarise what a Makefile does in one sentence."

No LM Studio, carregue o mesmo arquivo GGUF com o mesmo tamanho de contexto e as mesmas camadas de GPU, e acompanhe os tokens/s no painel de estatísticas do chat. O que mostrar número maior, rode o teste mais duas vezes — o primeiro load inclui ruído de warm-up.

Dá para usar o LM Studio como servidor de API local?

Sim — vá na aba Developer, ligue o servidor e você ganha um endpoint compatível com OpenAI em localhost:1234. Ele até tem CLI (lms) para script:

lms server start
lms load qwen2.5-coder-7b-instruct --gpu max
curl http://localhost:1234/v1/chat/completions 
  -H "Content-Type: application/json" 
  -d '{"model":"qwen2.5-coder-7b-instruct","messages":[{"role":"user","content":"Write a jq filter for the top process by CPU"}]}'

A API equivalente do Ollama fica sempre ativa enquanto o serviço roda, e o endpoint nativo mais as rotas compatíveis com OpenAI não pedem configuração alguma:

curl -fsSL https://ollama.com/install.sh | sh   # instalação no Linux
ollama pull qwen2.5-coder:7b
curl http://localhost:11434/api/chat -d '{
  "model": "qwen2.5-coder:7b",
  "messages": [{"role": "user", "content": "Explain bash exit codes in two lines"}],
  "stream": false
}'

Os dois se encaixam direto em qualquer ferramenta que fala a API da OpenAI — extensões do VS Code, agentes de código, seus próprios scripts. É aqui que o Ollama se destaca: o serviço sobe no boot, roda headless num servidor ou homelab e nada depende de um app de desktop aberto. Eu rodo exatamente esse setup no meu homelab, com o Ollama servindo modelos para tudo na rede enquanto o nó principal fica livre de mouse.

Qual escolher: Ollama ou LM Studio?

DimensãoOllamaLM Studio
InterfaceCLI + API RESTGUI de desktop completa
Código abertoMIT, totalmenteFechado, grátis para uso pessoal
Uso comercialGrátisLicença paga em escala
Gestão de modelosollama pull <model>Busca e download no próprio app
UI de chatNenhuma (traga a sua)Embutida
Endpoint de APISempre ativo em :11434Alternável em :1234
Uso headless/servidorExcelenteComplicado
Windows / macOS / LinuxOs trêsWindows + macOS, Linux em beta

Regras de bolso, sem arrependimento em nenhum caso:

  1. Você quer usar modelos — conversar, testar, mexer nos sliders: LM Studio.
  2. Você quer construir sobre modelos — scripts, agentes, CI, um serviço de API em casa: Ollama.
  3. Você quer os dois — instale os dois; eles convivem bem (só não deixe os dois servidores brigarem pela mesma porta, e lembre que um modelo carregado duas vezes come VRAM duas vezes).

Modelos locais combinam muito bem com ferramentas de código agênticas — aponte um cliente compatível com OpenAI para o seu endpoint local e você tem completions ilimitadas com custo zero por token. Essa combinação sustenta o setup local-first do freechat, e é o jeito mais barato de aprender a encanagem de LLM: a única conta é a de luz.

— mrsaynothing

Get the next one by email

One email per post. No spam, no algorithms.

self-hosted · no third parties · one-click unsubscribe

what is this?

Gostou dos artigos? É assim que eu construo profissionalmente. me contrate