O melhor LLM local para programar hoje é o Qwen3 Coder 30B A3B numa placa de 24 GB, o Qwen2.5 Coder 14B em Q4 com 12–16 GB e o Qwen2.5 Coder 7B em Q4 com 8 GB. Todos rodam 100% offline, completam e refatoram código real e não custam nada por token. Se a sua GPU tem menos VRAM do que o modelo precisa, baixe um nível de quant antes de baixar o tamanho do modelo. Este guia cruza modelos com faixas de VRAM, compara as duas famílias de código que as pessoas realmente discutem e termina com comandos prontos para você gerar código localmente em uns cinco minutos.
Qual LLM local usar para programar na sua GPU?
Escolha pela VRAM primeiro, modelo depois — o modelo só cabe se os pesos mais o contexto couberem na memória. Esta é a lista curta que segue no topo dos benchmarks comunitários e do uso do dia a dia em 2026:
| VRAM | Modelo | Quant | Pesos em disco | Por que vence nesta faixa |
|---|---|---|---|---|
| 8 GB | Qwen2.5 Coder 7B Instruct | Q4_K_M | ~4,7 GB | Melhor relação tokens/s–qualidade para autocomplete e refactors pequenos |
| 12 GB | Qwen2.5 Coder 14B Instruct | Q4_K_M | ~9,0 GB | Edições de arquivo inteiro cabem no contexto; ainda 30+ tok/s numa placa classe 3060 |
| 16 GB | Qwen3 14B ou gpt-oss-20b | Q4_K_M | ~9–12 GB | Melhor raciocínio em especificações ambíguas; placas classe 4090 o mantêm rápido |
| 24 GB | Qwen3 Coder 30B A3B | Q4_K_M | ~18,6 GB | MoE: só ~3B parâmetros ativos por token, então a velocidade segue utilizável |
Duas regras fazem essa tabela funcionar na prática:
- Deixe 1–2 GB de folga de VRAM para o KV cache. Um modelo 14B em Q4 com contexto de 8K tokens não cabe num orçamento de 10 GB — contexto conta no total.
- Caia um nível de quant antes de cair um tamanho de modelo. Quants Q5/Q4 custam alguns pontos percentuais de qualidade; um 7B no lugar de um 14B custa muito mais que isso.
De quanta VRAM você precisa para um LLM local de código?
A regra honesta de bolso: VRAM necessária ≈ pesos quantizados + 0,125 GB por 1K tokens de contexto com KV cache em 8 bits. Em números:
- 8 GB rodam modelos 7B–8B em Q4 com folga. Espere respostas de tamanho de autocomplete, contexto de 4K–8K.
- 12 GB é o ponto ideal para um 14B em Q4 — espaço para o modelo mais um contexto de código realista de 8K–16K.
- 16 GB abre modelos densos classe 20B e o Qwen3 14B com contexto maior.
- 24 GB roda o Qwen3 Coder 30B A3B MoE em Q4, a coisa mais próxima de um modelo de código com qualidade de nuvem que você pode hospedar.
Só CPU? Funciona — o llama.cpp roda um 7B Q4 num CPU de notebook a 5–10 tok/s sem reclamar — mas trate como exercício de paciência, não como máquina de uso diário. Para a parte de ferramenta, a comparação Ollama vs LM Studio cobre qual runtime colocar por baixo dos seus modelos.
Qwen3 Coder vs DeepSeek: qual é melhor para programar?
É o confronto que as barras de autocomplete realmente perguntam, e a resposta se divide com nitidez:
- Qwen3 Coder (30B A3B) nasceu para o loop de edição: segue as convenções de formato de instrução para tool calling, produz diffs consistentes e — a parte decisiva — o design MoE ativa só ~3B parâmetros por token, então uma placa única de 24 GB atinge 40–60 tok/s. Para uso estilo IDE, responsividade é qualidade.
- A linha DeepSeek V3/R1 argumenta num nível mais alto: decisões de arquitetura, algoritmos espinhosos, raciocínio em múltiplos passos. Mas o flagship tem 600B+ parâmetros; localmente você só o roda muito quantizado em rigs multi-GPU ou de memória unificada da Mac, e ele escreve prosa sobre código mais rápido do que escreve código.
Escolha local: Qwen3 Coder para o dia a dia, DeepSeek só se você tem o hardware para hospedá-lo quase com precisão total. Com 8–16 GB o debate está encerrado — os modelos Qwen2.5/3 Coder são o mais forte que cabe.
Como rodar o melhor LLM local para programar com Ollama?
Cinco comandos, do zero a uma API compatível com OpenAI que seu editor usa:
# 1. Instale o Ollama (Linux)
curl -fsSL https://ollama.com/install.sh | sh
# 2. Puxe o modelo que cabe na sua faixa de VRAM (aqui, uma placa de 8 GB)
ollama pull qwen2.5-coder:7b
# 3. Converse com ele no terminal
ollama run qwen2.5-coder:7b
# 4. Use-o como API compatível com OpenAI em qualquer ferramenta
curl http://localhost:11434/v1/chat/completions
-d '{
"model": "qwen2.5-coder:7b",
"messages": [{"role": "user", "content": "Refactor this fn to be async: add(a,b){return a+b}"}]
}'
# 5. Aponte para ele as ferramentas que esperam OPENAI_BASE_URL
export OPENAI_BASE_URL=http://localhost:11434/v1 Sem chave de API, sem rate limit, sem conta por token. No Linux o instalador registra uma unit systemd, então se o servidor se comportar mal um dia, o journalctl conta o porquê — o cheat sheet de journalctl tem os filtros exatos para depurar serviços.
Um LLM local dá conta do trabalho real de programação?
Sim no loop de edição, não nos problemas difíceis — e essa divisão é exatamente como você deve usá-lo. Um modelo local de 14B–30B resolve refactors, boilerplate, esqueleto de testes, regex e “explica essa função legada” mais rápido do que a maioria das APIs de nuvem completa o round-trip. Onde ele perde para os grandes modelos hospedados é em raciocínio longo multi-arquivo e em detalhes obscuros de framework — um modelo de 30B simplesmente sabe menos que um modelo de fronteira.
O fluxo que funciona: mantenha um modelo local rodando para 90% das suas teclas digitadas e reserve um modelo de fronteira hospedado para as questões de design espinhosas. Seu código nunca sai da máquina no trabalho rotineiro — o que importa em código de cliente — e a VRAM que você já tem substitui discretamente uma assinatura.
— mrsaynothing
Get the next one by email
One email per post. No spam, no algorithms.
what is this?Como desfazer o último commit no Git com segurança
Gostou dos artigos? É assim que eu construo profissionalmente. me contrate