এই মুহূর্তে কোডিংয়ের সেরা local LLM: 24 GB কার্ডে Qwen3 Coder 30B A3B, 12–16 GB-তে Q4-এ Qwen2.5 Coder 14B, আর 8 GB-তে Q4-এ Qwen2.5 Coder 7B। প্রতিটাই সম্পূর্ণ অফলাইনে চলে, আসল কোড অটোকমপ্লিট ও রিফ্যাক্টর করে, আর প্রতি টোকেনের দাম শূন্য। GPU-র VRAM মডেলের চাহিদার চেয়ে কম হলে মডেল ছোট করার আগে এক ধাপ quant নামান। এই গাইড মডেলকে VRAM ব্র্যাকেটের সাথে মেলায়, যে দুই কোডিং পরিবার নিয়ে আসলেই তর্ক হয় তাদের তুলনা করে, আর শেষ করে চালানোর মতো কমান্ডে — প্রায় পাঁচ মিনিটেই লোকালি কোড জেনারেট শুরু করার জন্য।
আপনার GPU-তে কোডিংয়ের জন্য কোন local LLM নেবেন?
আগে VRAM ধরে বাছুন, মডেল পরে — weights আর context মিলে মেমরিতে না আঁটলে মডেল আঁটবেই না। 2026-র কমিউনিটি বেঞ্চমার্ক আর রোজকার ব্যবহারে বারবার ওপরে ওঠা তালিকাটা এই:
| VRAM | মডেল | Quant | ডিস্কে weights | এই ব্র্যাকেটে কেন এগিয়ে |
|---|---|---|---|---|
| 8 GB | Qwen2.5 Coder 7B Instruct | Q4_K_M | ~4.7 GB | অটোকমপ্লিট ও ছোট রিফ্যাক্টরে tokens-per-second-to-quality অনুপাতে সেরা |
| 12 GB | Qwen2.5 Coder 14B Instruct | Q4_K_M | ~9.0 GB | পুরো ফাইলের এডিট context-এ আঁটে; 3060-শ্রেণির কার্ডেও 30+ tok/s |
| 16 GB | Qwen3 14B বা gpt-oss-20b | Q4_K_M | ~9–12 GB | অস্পষ্ট স্পেকে ভালো reasoning; 4090-শ্রেণির কার্ডে গতি ধরে রাখে |
| 24 GB | Qwen3 Coder 30B A3B | Q4_K_M | ~18.6 GB | MoE: প্রতি টোকেনে মাত্র ~3B প্যারামিটার সক্রিয়, তাই গতি ব্যবহারযোগ্য থাকে |
দুটো নিয়ম টেবিলটাকে বাস্তবে কাজ করায়:
- KV cache-এর জন্য 1–2 GB VRAM ফাঁকা রাখুন। Q4-তে একটা 14B মডেল আর 8K-টোকেন context 10 GB বাজেটে আঁটবে না — context-ও মোট হিসাবে গোনে।
- মডেল সাইজ নামানোর আগে এক ধাপ quant নামান। Q5/Q4 quant কোয়ালিটির কয়েক শতাংশ খায়; 14B-র বদলে 7B তার চেয়ে অনেক বেশি খায়।
লোকাল কোডিং LLM-এর জন্য কত VRAM লাগে?
সৎ নিয়ম: লাগবে VRAM ≈ quantised weights + 8-বিট KV cache-এ 1K context প্রতি 0.125 GB। সংখ্যায়:
- 8 GB — Q4-তে 7B–8B মডেল আরামে চলে। অটোকমপ্লিট-দৈর্ঘ্যের উত্তর আর 4K–8K context আশা করুন।
- 12 GB — Q4-তে 14B-র সুইট স্পট — মডেল আর বাস্তবসম্মত 8K–16K কোডিং context-এর জায়গা দুই-ই মেলে।
- 16 GB — 20B-শ্রেণির ডেন্স মডেল আর লম্বা context-সহ Qwen3 14B খুলে দেয়।
- 24 GB — Q4-তে Qwen3 Coder 30B A3B MoE চলে, যা নিজে হোস্ট করা সবচেয়ে ক্লাউড-কোয়ালিটির কোডিং মডেল।
শুধু CPU? চলে — llama.cpp ল্যাপটপ CPU-তেই 7B Q4 নির্দ্বিধায় 5–10 tok/s-এ চালায় — তবে এটাকে ধৈর্য-অনুশীলন হিসেবে নিন, রোজকার ড্রাইভার নয়। রানটাইম ইনস্টলের টুলিং-দিকটা Ollama vs LM Studio তুলনা দেখে — কোন লোকাল LLM টুল মডেলের নিচে বসাবেন।
Qwen3 Coder vs DeepSeek: কোডিংয়ে কোনটি ভালো?
অটোকমপ্লিট-বারগুলো যে লড়াই আসলেই জিজ্ঞেস করে, আর উত্তরটা পরিষ্কারভাবে ভাগ হয়ে যায়:
- Qwen3 Coder (30B A3B) এডিট-লুপের জন্যই বানানো: tool calling-এ instruction-format রীতি মানে, ধারাবাহিক diff দেয়, আর নির্ণায়ক অংশ — MoE ডিজাইনে প্রতি টোকেনে মাত্র ~3B প্যারামিটার সক্রিয় হয়, তাই একটা 24 GB কার্ডেই 40–60 tok/s। IDE-ধাঁচের ব্যবহারে responsiveness-ই কোয়ালিটি।
- DeepSeek V3/R1 ধারা উপরের স্তরে তর্ক করে: আর্কিটেকচার সিদ্ধান্ত, কঠিন অ্যালগরিদম, বহু-ধাপ reasoning। কিন্তু ফ্ল্যাগশিপ 600B+ প্যারামিটার; লোকালে চালাতে হয় ভারী quant-এ, মাল্টি-GPU বা Mac-এর unified memory-র রিগে, আর সে কোড লেখার চেয়ে কোড-নিয়ে গদ্য দ্রুত লেখে।
লোকাল সিদ্ধান্ত: রোজকার ড্রাইভার Qwen3 Coder; DeepSeek শুধু তখনই, যখন প্রায়-ফুল-প্রিসিশনে হোস্ট করার হার্ডওয়্যার আছে। 8–16 GB-তে বিতর্কটাই অপ্রাসঙ্গিক — যা আঁটে তার মধ্যে সবচেয়ে শক্তিশালী Qwen2.5/3 Coder।
Ollama দিয়ে সেরা লোকাল কোডিং LLM কীভাবে চালাবেন?
পাঁচটা কমান্ড — শূন্য থেকে এডিটর-ব্যবহার্য OpenAI-কম্প্যাটিবল API:
# 1. Ollama ইনস্টল (Linux)
curl -fsSL https://ollama.com/install.sh | sh
# 2. VRAM ব্র্যাকেটে আঁটা মডেল পুল করুন (8 GB কার্ড ধরে দেখানো)
ollama pull qwen2.5-coder:7b
# 3. ইন্টারঅ্যাক্টিভভাবে চ্যাট করুন
ollama run qwen2.5-coder:7b
# 4. যেকোনো টুল থেকে OpenAI-কম্প্যাটিবল API হিসেবে ব্যবহার করুন
curl http://localhost:11434/v1/chat/completions
-d '{
"model": "qwen2.5-coder:7b",
"messages": [{"role": "user", "content": "Refactor this fn to be async: add(a,b){return a+b}"}]
}'
# 5. OPENAI_BASE_URL আশা করা টুলগুলোকে এদিকে ধরান
export OPENAI_BASE_URL=http://localhost:11434/v1 API key নেই, rate limit নেই, প্রতি-টোকেন বিল নেই। Linux-এ ইনস্টলার একটা systemd unit রেজিস্টার করে, তাই সার্ভার কখনো গোলমাল করলে journalctl কারণ বলে দেয় — সার্ভিস ডিবাগের হুবহু ফিল্টারগুলো journalctl cheat sheet-এ আছে।
আসল কোডিং কাজে লোকাল LLM কি যথেষ্ট?
এডিট-লুপে হ্যাঁ, কঠিন সমস্যায় না — আর এই ভাগটাই আসলে ব্যবহারের সঠিক উপায়। 14B–30B লোকাল মডেল রিফ্যাক্টর, বয়লারপ্লেট, টেস্ট স্ক্যাফোল্ড, regex, আর “এই লিগ্যাসি ফাংশনটা বোঝাও” — বেশিরভাগ ক্লাউড API-র রাউন্ড-ট্রিপের চেয়ে দ্রুত সামলায়। বড় হোস্টেড মডেলের কাছে হারে লম্বা মাল্টি-ফাইল reasoning আর বিরল ফ্রেমওয়ার্ক-ট্রিভিয়ায় — 30B মডেল সরলভাবে frontier মডেলের চেয়ে কম জানে।
যে ওয়ার্কফ্লো কাজ করে: কিস্ট্রোকের 90%-এর জন্য একটা লোকাল মডেল চালু রাখুন, আর খাঁজকাটা ডিজাইন-প্রশ্নেই শুধু হোস্টেড frontier মডেলে হাত দিন। রুটিন কাজে আপনার কোড মেশিন ছেড়ে যায় না — ক্লায়েন্ট কোডে এটা ম্যাটার করে — আর আপনার মালিকানাধীন VRAM-ই নিঃশব্দে একটা সাবস্ক্রিপশনের বদল নেয়।
— mrsaynothing
— mrsaynothing
AI, Linux ও self-hosting নিয়ে ফিল্ড নোটস।
পোস্টটি নিয়ে dev.to-তে আলোচনা করুন dev.to ↗
পরের হাউ-টু ইমেইলে পান
প্রতি পোস্টে একটি ইমেইল। সমাধান করুন, এগিয়ে যান।
এটা কী?Git Undo Last Commit: পরিবর্তন রেখে নিরাপদ বাতিল
লেখাগুলো ভালো লাগছে? এমন জিনিস বানানোই আমার পেশা। আমাকে নিন