Voltar ao blog

Melhor LLM local para programar: do 8 ao 24 GB de VRAM

4 de setembro de 2026

O melhor LLM local para programar hoje é o Qwen3 Coder 30B A3B numa placa de 24 GB, o Qwen2.5 Coder 14B em Q4 com 12–16 GB e o Qwen2.5 Coder 7B em Q4 com 8 GB. Todos rodam 100% offline, completam e refatoram código real e não custam nada por token. Se a sua GPU tem menos VRAM do que o modelo precisa, baixe um nível de quant antes de baixar o tamanho do modelo. Este guia cruza modelos com faixas de VRAM, compara as duas famílias de código que as pessoas realmente discutem e termina com comandos prontos para você gerar código localmente em uns cinco minutos.

Qual LLM local usar para programar na sua GPU?

Escolha pela VRAM primeiro, modelo depois — o modelo só cabe se os pesos mais o contexto couberem na memória. Esta é a lista curta que segue no topo dos benchmarks comunitários e do uso do dia a dia em 2026:

VRAMModeloQuantPesos em discoPor que vence nesta faixa
8 GBQwen2.5 Coder 7B InstructQ4_K_M~4,7 GBMelhor relação tokens/s–qualidade para autocomplete e refactors pequenos
12 GBQwen2.5 Coder 14B InstructQ4_K_M~9,0 GBEdições de arquivo inteiro cabem no contexto; ainda 30+ tok/s numa placa classe 3060
16 GBQwen3 14B ou gpt-oss-20bQ4_K_M~9–12 GBMelhor raciocínio em especificações ambíguas; placas classe 4090 o mantêm rápido
24 GBQwen3 Coder 30B A3BQ4_K_M~18,6 GBMoE: só ~3B parâmetros ativos por token, então a velocidade segue utilizável

Duas regras fazem essa tabela funcionar na prática:

  1. Deixe 1–2 GB de folga de VRAM para o KV cache. Um modelo 14B em Q4 com contexto de 8K tokens não cabe num orçamento de 10 GB — contexto conta no total.
  2. Caia um nível de quant antes de cair um tamanho de modelo. Quants Q5/Q4 custam alguns pontos percentuais de qualidade; um 7B no lugar de um 14B custa muito mais que isso.

De quanta VRAM você precisa para um LLM local de código?

A regra honesta de bolso: VRAM necessária ≈ pesos quantizados + 0,125 GB por 1K tokens de contexto com KV cache em 8 bits. Em números:

  • 8 GB rodam modelos 7B–8B em Q4 com folga. Espere respostas de tamanho de autocomplete, contexto de 4K–8K.
  • 12 GB é o ponto ideal para um 14B em Q4 — espaço para o modelo mais um contexto de código realista de 8K–16K.
  • 16 GB abre modelos densos classe 20B e o Qwen3 14B com contexto maior.
  • 24 GB roda o Qwen3 Coder 30B A3B MoE em Q4, a coisa mais próxima de um modelo de código com qualidade de nuvem que você pode hospedar.

Só CPU? Funciona — o llama.cpp roda um 7B Q4 num CPU de notebook a 5–10 tok/s sem reclamar — mas trate como exercício de paciência, não como máquina de uso diário. Para a parte de ferramenta, a comparação Ollama vs LM Studio cobre qual runtime colocar por baixo dos seus modelos.

Qwen3 Coder vs DeepSeek: qual é melhor para programar?

É o confronto que as barras de autocomplete realmente perguntam, e a resposta se divide com nitidez:

  • Qwen3 Coder (30B A3B) nasceu para o loop de edição: segue as convenções de formato de instrução para tool calling, produz diffs consistentes e — a parte decisiva — o design MoE ativa só ~3B parâmetros por token, então uma placa única de 24 GB atinge 40–60 tok/s. Para uso estilo IDE, responsividade é qualidade.
  • A linha DeepSeek V3/R1 argumenta num nível mais alto: decisões de arquitetura, algoritmos espinhosos, raciocínio em múltiplos passos. Mas o flagship tem 600B+ parâmetros; localmente você só o roda muito quantizado em rigs multi-GPU ou de memória unificada da Mac, e ele escreve prosa sobre código mais rápido do que escreve código.

Escolha local: Qwen3 Coder para o dia a dia, DeepSeek só se você tem o hardware para hospedá-lo quase com precisão total. Com 8–16 GB o debate está encerrado — os modelos Qwen2.5/3 Coder são o mais forte que cabe.

Como rodar o melhor LLM local para programar com Ollama?

Cinco comandos, do zero a uma API compatível com OpenAI que seu editor usa:

# 1. Instale o Ollama (Linux)
curl -fsSL https://ollama.com/install.sh | sh

# 2. Puxe o modelo que cabe na sua faixa de VRAM (aqui, uma placa de 8 GB)
ollama pull qwen2.5-coder:7b

# 3. Converse com ele no terminal
ollama run qwen2.5-coder:7b

# 4. Use-o como API compatível com OpenAI em qualquer ferramenta
curl http://localhost:11434/v1/chat/completions 
  -d '{
    "model": "qwen2.5-coder:7b",
    "messages": [{"role": "user", "content": "Refactor this fn to be async: add(a,b){return a+b}"}]
  }'

# 5. Aponte para ele as ferramentas que esperam OPENAI_BASE_URL
export OPENAI_BASE_URL=http://localhost:11434/v1

Sem chave de API, sem rate limit, sem conta por token. No Linux o instalador registra uma unit systemd, então se o servidor se comportar mal um dia, o journalctl conta o porquê — o cheat sheet de journalctl tem os filtros exatos para depurar serviços.

Um LLM local dá conta do trabalho real de programação?

Sim no loop de edição, não nos problemas difíceis — e essa divisão é exatamente como você deve usá-lo. Um modelo local de 14B–30B resolve refactors, boilerplate, esqueleto de testes, regex e “explica essa função legada” mais rápido do que a maioria das APIs de nuvem completa o round-trip. Onde ele perde para os grandes modelos hospedados é em raciocínio longo multi-arquivo e em detalhes obscuros de framework — um modelo de 30B simplesmente sabe menos que um modelo de fronteira.

O fluxo que funciona: mantenha um modelo local rodando para 90% das suas teclas digitadas e reserve um modelo de fronteira hospedado para as questões de design espinhosas. Seu código nunca sai da máquina no trabalho rotineiro — o que importa em código de cliente — e a VRAM que você já tem substitui discretamente uma assinatura.

— mrsaynothing

Get the next one by email

One email per post. No spam, no algorithms.

self-hosted · no third parties · one-click unsubscribe

what is this?

Como desfazer o último commit no Git com segurança

Gostou dos artigos? É assim que eu construo profissionalmente. me contrate