ব্লগে ফিরুন

Best Local LLM for Coding: 8GB থেকে 24GB VRAM পছন্দ

৪ সেপ্টেম্বর, ২০২৬

এই মুহূর্তে কোডিংয়ের সেরা local LLM: 24 GB কার্ডে Qwen3 Coder 30B A3B, 12–16 GB-তে Q4-এ Qwen2.5 Coder 14B, আর 8 GB-তে Q4-এ Qwen2.5 Coder 7B। প্রতিটাই সম্পূর্ণ অফলাইনে চলে, আসল কোড অটোকমপ্লিট ও রিফ্যাক্টর করে, আর প্রতি টোকেনের দাম শূন্য। GPU-র VRAM মডেলের চাহিদার চেয়ে কম হলে মডেল ছোট করার আগে এক ধাপ quant নামান। এই গাইড মডেলকে VRAM ব্র্যাকেটের সাথে মেলায়, যে দুই কোডিং পরিবার নিয়ে আসলেই তর্ক হয় তাদের তুলনা করে, আর শেষ করে চালানোর মতো কমান্ডে — প্রায় পাঁচ মিনিটেই লোকালি কোড জেনারেট শুরু করার জন্য।

আপনার GPU-তে কোডিংয়ের জন্য কোন local LLM নেবেন?

আগে VRAM ধরে বাছুন, মডেল পরে — weights আর context মিলে মেমরিতে না আঁটলে মডেল আঁটবেই না। 2026-র কমিউনিটি বেঞ্চমার্ক আর রোজকার ব্যবহারে বারবার ওপরে ওঠা তালিকাটা এই:

VRAMমডেলQuantডিস্কে weightsএই ব্র্যাকেটে কেন এগিয়ে
8 GBQwen2.5 Coder 7B InstructQ4_K_M~4.7 GBঅটোকমপ্লিট ও ছোট রিফ্যাক্টরে tokens-per-second-to-quality অনুপাতে সেরা
12 GBQwen2.5 Coder 14B InstructQ4_K_M~9.0 GBপুরো ফাইলের এডিট context-এ আঁটে; 3060-শ্রেণির কার্ডেও 30+ tok/s
16 GBQwen3 14B বা gpt-oss-20bQ4_K_M~9–12 GBঅস্পষ্ট স্পেকে ভালো reasoning; 4090-শ্রেণির কার্ডে গতি ধরে রাখে
24 GBQwen3 Coder 30B A3BQ4_K_M~18.6 GBMoE: প্রতি টোকেনে মাত্র ~3B প্যারামিটার সক্রিয়, তাই গতি ব্যবহারযোগ্য থাকে

দুটো নিয়ম টেবিলটাকে বাস্তবে কাজ করায়:

  1. KV cache-এর জন্য 1–2 GB VRAM ফাঁকা রাখুন। Q4-তে একটা 14B মডেল আর 8K-টোকেন context 10 GB বাজেটে আঁটবে না — context-ও মোট হিসাবে গোনে।
  2. মডেল সাইজ নামানোর আগে এক ধাপ quant নামান। Q5/Q4 quant কোয়ালিটির কয়েক শতাংশ খায়; 14B-র বদলে 7B তার চেয়ে অনেক বেশি খায়।

লোকাল কোডিং LLM-এর জন্য কত VRAM লাগে?

সৎ নিয়ম: লাগবে VRAM ≈ quantised weights + 8-বিট KV cache-এ 1K context প্রতি 0.125 GB। সংখ্যায়:

  • 8 GB — Q4-তে 7B–8B মডেল আরামে চলে। অটোকমপ্লিট-দৈর্ঘ্যের উত্তর আর 4K–8K context আশা করুন।
  • 12 GB — Q4-তে 14B-র সুইট স্পট — মডেল আর বাস্তবসম্মত 8K–16K কোডিং context-এর জায়গা দুই-ই মেলে।
  • 16 GB — 20B-শ্রেণির ডেন্স মডেল আর লম্বা context-সহ Qwen3 14B খুলে দেয়।
  • 24 GB — Q4-তে Qwen3 Coder 30B A3B MoE চলে, যা নিজে হোস্ট করা সবচেয়ে ক্লাউড-কোয়ালিটির কোডিং মডেল।

শুধু CPU? চলে — llama.cpp ল্যাপটপ CPU-তেই 7B Q4 নির্দ্বিধায় 5–10 tok/s-এ চালায় — তবে এটাকে ধৈর্য-অনুশীলন হিসেবে নিন, রোজকার ড্রাইভার নয়। রানটাইম ইনস্টলের টুলিং-দিকটা Ollama vs LM Studio তুলনা দেখে — কোন লোকাল LLM টুল মডেলের নিচে বসাবেন।

Qwen3 Coder vs DeepSeek: কোডিংয়ে কোনটি ভালো?

অটোকমপ্লিট-বারগুলো যে লড়াই আসলেই জিজ্ঞেস করে, আর উত্তরটা পরিষ্কারভাবে ভাগ হয়ে যায়:

  • Qwen3 Coder (30B A3B) এডিট-লুপের জন্যই বানানো: tool calling-এ instruction-format রীতি মানে, ধারাবাহিক diff দেয়, আর নির্ণায়ক অংশ — MoE ডিজাইনে প্রতি টোকেনে মাত্র ~3B প্যারামিটার সক্রিয় হয়, তাই একটা 24 GB কার্ডেই 40–60 tok/s। IDE-ধাঁচের ব্যবহারে responsiveness-ই কোয়ালিটি।
  • DeepSeek V3/R1 ধারা উপরের স্তরে তর্ক করে: আর্কিটেকচার সিদ্ধান্ত, কঠিন অ্যালগরিদম, বহু-ধাপ reasoning। কিন্তু ফ্ল্যাগশিপ 600B+ প্যারামিটার; লোকালে চালাতে হয় ভারী quant-এ, মাল্টি-GPU বা Mac-এর unified memory-র রিগে, আর সে কোড লেখার চেয়ে কোড-নিয়ে গদ্য দ্রুত লেখে।

লোকাল সিদ্ধান্ত: রোজকার ড্রাইভার Qwen3 Coder; DeepSeek শুধু তখনই, যখন প্রায়-ফুল-প্রিসিশনে হোস্ট করার হার্ডওয়্যার আছে। 8–16 GB-তে বিতর্কটাই অপ্রাসঙ্গিক — যা আঁটে তার মধ্যে সবচেয়ে শক্তিশালী Qwen2.5/3 Coder।

Ollama দিয়ে সেরা লোকাল কোডিং LLM কীভাবে চালাবেন?

পাঁচটা কমান্ড — শূন্য থেকে এডিটর-ব্যবহার্য OpenAI-কম্প্যাটিবল API:

# 1. Ollama ইনস্টল (Linux)
curl -fsSL https://ollama.com/install.sh | sh

# 2. VRAM ব্র্যাকেটে আঁটা মডেল পুল করুন (8 GB কার্ড ধরে দেখানো)
ollama pull qwen2.5-coder:7b

# 3. ইন্টারঅ্যাক্টিভভাবে চ্যাট করুন
ollama run qwen2.5-coder:7b

# 4. যেকোনো টুল থেকে OpenAI-কম্প্যাটিবল API হিসেবে ব্যবহার করুন
curl http://localhost:11434/v1/chat/completions 
  -d '{
    "model": "qwen2.5-coder:7b",
    "messages": [{"role": "user", "content": "Refactor this fn to be async: add(a,b){return a+b}"}]
  }'

# 5. OPENAI_BASE_URL আশা করা টুলগুলোকে এদিকে ধরান
export OPENAI_BASE_URL=http://localhost:11434/v1

API key নেই, rate limit নেই, প্রতি-টোকেন বিল নেই। Linux-এ ইনস্টলার একটা systemd unit রেজিস্টার করে, তাই সার্ভার কখনো গোলমাল করলে journalctl কারণ বলে দেয় — সার্ভিস ডিবাগের হুবহু ফিল্টারগুলো journalctl cheat sheet-এ আছে।

আসল কোডিং কাজে লোকাল LLM কি যথেষ্ট?

এডিট-লুপে হ্যাঁ, কঠিন সমস্যায় না — আর এই ভাগটাই আসলে ব্যবহারের সঠিক উপায়। 14B–30B লোকাল মডেল রিফ্যাক্টর, বয়লারপ্লেট, টেস্ট স্ক্যাফোল্ড, regex, আর “এই লিগ্যাসি ফাংশনটা বোঝাও” — বেশিরভাগ ক্লাউড API-র রাউন্ড-ট্রিপের চেয়ে দ্রুত সামলায়। বড় হোস্টেড মডেলের কাছে হারে লম্বা মাল্টি-ফাইল reasoning আর বিরল ফ্রেমওয়ার্ক-ট্রিভিয়ায় — 30B মডেল সরলভাবে frontier মডেলের চেয়ে কম জানে।

যে ওয়ার্কফ্লো কাজ করে: কিস্ট্রোকের 90%-এর জন্য একটা লোকাল মডেল চালু রাখুন, আর খাঁজকাটা ডিজাইন-প্রশ্নেই শুধু হোস্টেড frontier মডেলে হাত দিন। রুটিন কাজে আপনার কোড মেশিন ছেড়ে যায় না — ক্লায়েন্ট কোডে এটা ম্যাটার করে — আর আপনার মালিকানাধীন VRAM-ই নিঃশব্দে একটা সাবস্ক্রিপশনের বদল নেয়।

— mrsaynothing

— mrsaynothing

AI, Linux ও self-hosting নিয়ে ফিল্ড নোটস।

পোস্টটি নিয়ে dev.to-তে আলোচনা করুন dev.to ↗

পরের হাউ-টু ইমেইলে পান

প্রতি পোস্টে একটি ইমেইল। সমাধান করুন, এগিয়ে যান।

self-hosted · কোনো তৃতীয় পক্ষ নেই · এক ক্লিকে আনসাবস্ক্রাইব

এটা কী?

Git Undo Last Commit: পরিবর্তন রেখে নিরাপদ বাতিল

লেখাগুলো ভালো লাগছে? এমন জিনিস বানানোই আমার পেশা। আমাকে নিন