Şu an kodlama için en iyi yerel LLM: 24 GB kartta Qwen3 Coder 30B A3B, 12–16 GB’ta Q4 ile Qwen2.5 Coder 14B, 8 GB’ta Q4 ile Qwen2.5 Coder 7B. Bunların hepsi tamamen çevrimdışı çalışır, gerçek kodu otomatik tamamlar ve refactor eder, token başına bedava. GPU’nuzun VRAM’i modelin ihtiyacından azsa, model boyutunu düşürmeden önce quant’ı bir kademe düşürün. Bu rehber modelleri VRAM aralıklarıyla eşleştirir, insanların gerçekten tartıştığı iki kodlama ailesini karşılaştırır ve yaklaşık beş dakikada yerelde kod üretmeye başlamanız için çalıştırılabilir komutlarla biter.
GPU’nuzda kodlama için hangi yerel LLM’i kullanmalısınız?
Önce VRAM’e göre seçin, model sonra — ağırlıklar artı context belleğe sığmadıkça model sığmaz. 2026 topluluk benchmarklarında ve günlük kullanımda sürekli üstte çıkan kısa liste bu:
| VRAM | Model | Quant | Diskte ağırlık | Bu aralığı neden kazanıyor |
|---|---|---|---|---|
| 8 GB | Qwen2.5 Coder 7B Instruct | Q4_K_M | ~4.7 GB | Otomatik tamamlama ve küçük refactor’lar için en iyi hız-kalite oranı |
| 12 GB | Qwen2.5 Coder 14B Instruct | Q4_K_M | ~9.0 GB | Dosya geneli düzenlemeler context’e sığar; 3060 sınıfı kartta hâlâ 30+ tok/s |
| 16 GB | Qwen3 14B ya da gpt-oss-20b | Q4_K_M | ~9–12 GB | Belirsiz spesifikasyonlarda daha iyi akıl yürütme; 4090 sınıfı kartlar hızlı tutar |
| 24 GB | Qwen3 Coder 30B A3B | Q4_K_M | ~18.6 GB | MoE: token başına yalnızca ~3B parametre aktif, hız kullanılabilir kalıyor |
Bu tabloyu pratikte işler kılan iki kural:
- KV cache için 1–2 GB VRAM payı bırakın. Q4’te bir 14B model artı 8K token’lık context, 10 GB bütçeye sığmaz — context de toplama dahildir.
- Model boyutunu düşürmeden önce quant’ı bir kademe düşürün. Q5/Q4 quant’lar kalitenin birkaç yüzdesine mal olur; 14B yerine 7B, ondan çok daha fazlasına.
Yerel bir kodlama LLM’i için ne kadar VRAM gerekir?
Dürüst kural: gerekli VRAM ≈ kuantize ağırlıklar + 8-bit KV cache’te her 1K context token’ı için 0.125 GB. Sayılarla:
- 8 GB, 7B–8B modelleri Q4’te rahat çalıştırır. Otomatik tamamlama uzunluğunda yanıtlar, 4K–8K context bekleyin.
- 12 GB, Q4’te 14B için tatlı nokta — model artı gerçekçi bir 8K–16K kodlama context’i için yeterli alan.
- 16 GB, 20B sınıfı dense modelleri ve daha uzun context’le Qwen3 14B’yi açar.
- 24 GB, Q4’te Qwen3 Coder 30B A3B MoE’yu çalıştırır; kendi barındırabileceğiniz buluta en yakın kodlama modeli budur.
Sadece CPU mu? Çalışır — llama.cpp bir 7B Q4’ü laptop CPU’sunda 5–10 tok/s hızında memnuniyetle çalıştırır — ama bunu günlük sürücü değil, sabır egzersizi olarak görün. Runtime kurma tarafında Ollama vs LM Studio karşılaştırması, modellerinizin altına hangi yerel LLM aracının geleceğini kapsıyor.
Qwen3 Coder vs DeepSeek: kodlama için hangisi daha iyi?
Otomatik tamamlama çubuklarının gerçekten sorduğu eşleşme bu ve cevap temiz ayrışıyor:
- Qwen3 Coder (30B A3B) düzenleme döngüsü için yapılmıştır: tool calling’de talimat formatı kurallarına uyar, tutarlı diff’ler üretir ve — belirleyici olan kısım — MoE tasarımı sayesinde token başına yalnızca ~3B parametre aktifleşir; tek 24 GB kart 40–60 tok/s verir. IDE tarzı kullanımda duyarlılığın kendisi kalitedir.
- DeepSeek V3/R1 hattı bir üst seviyede tartışır: mimari kararlar, çetin algoritmalar, çok adımlı akıl yürütme. Ama amiral gemisi 600B+ parametre; yerelde yalnızca ağır kuantize halde, çoklu GPU ya da Mac birleşik bellekli kurulumlarda çalışır ve koddan çok kod hakkında düzyazı yazar.
Yerel seçim: günlük sürücü Qwen3 Coder, DeepSeek yalnızca onu neredeyse tam hassasiyetle barındıracak donanımınız varsa. 8–16 GB’ta tartışma zaten anlamsız — sığan en güçlü şey Qwen2.5/3 Coder modelleri.
En iyi yerel kodlama LLM’ini Ollama ile nasıl çalıştırırsınız?
Beş komut, sıfırdan düzenleyicinizin kullanabileceği OpenAI uyumlu bir API’ye:
# 1. Ollama'yı kurun (Linux)
curl -fsSL https://ollama.com/install.sh | sh
# 2. VRAM aralığınıza uyan modeli çekin (8 GB kart gösteriliyor)
ollama pull qwen2.5-coder:7b
# 3. Etkileşimli sohbet edin
ollama run qwen2.5-coder:7b
# 4. Herhangi bir araçtan OpenAI uyumlu API olarak kullanın
curl http://localhost:11434/v1/chat/completions
-d '{
"model": "qwen2.5-coder:7b",
"messages": [{"role": "user", "content": "Refactor this fn to be async: add(a,b){return a+b}"}]
}'
# 5. OPENAI_BASE_URL bekleyen araçları buraya çevirin
export OPENAI_BASE_URL=http://localhost:11434/v1 API anahtarı yok, hız limiti yok, token başına fatura yok. Linux’ta yükleyici bir systemd unit kaydeder; sunucu bir gün ters giderse journalctl nedenini söyler — journalctl cheat sheet servis hata ayıklama için tam filtreleri içeriyor.
Yerel bir LLM gerçek kodlama işi için yeterince iyi mi?
Düzenleme döngüsü için evet, zor problemler için hayır — ve tam da bu ayrımla kullanmalısınız. 14B–30B arası yerel bir model, refactor’ları, boilerplate’i, test iskeletlerini, regex’leri ve “bu legacy fonksiyonu açıkla” işini, çoğu bulut API’sinin gidiş-dönüşünden daha hızlı halleder. Büyük barındırılan modellere karşı kaybettiği yer uzun çoklu-dosya akıl yürütme ve bilinmeyen framework bilgileri — 30B’lik bir model, frontier bir modelin bildiğini basitçe bilmiyor.
İşleyen iş akışı: tuş vuruşlarınızın %90’ı için yerel modeli çalışır tutun, çetin tasarım soruları için barındırılan frontier modele uzanın. Rutin iş için kodunuz makineden hiç çıkmaz — müşteri kodunda bu önemli — ve zaten sahip olduğunuz VRAM, sessizce bir aboneliğin yerini tutar.
— mrsaynothing
Get the next one by email
One email per post. No spam, no algorithms.
what is this?Git'te Son Commit'i Geri Al: Değişiklikler Kalsın
Yazıları beğendiniz mi? Ben geçim için böyle inşa ederim. beni işe al