กลับไปที่บล็อก

Ollama vs LM Studio: ควรใช้เครื่องมือ LLM ในเครื่องตัวไหน

1 กันยายน 2569

Ollama หรือ LM Studio ในหนึ่งบรรทัด: ถ้าต้องการ GUI บนเดสก์ท็อปสำหรับเรียกดูโมเดลและแชต ให้เลือก LM Studio ถ้าต้องการ API server ในเครื่องที่เบาและสั่งงานด้วยสคริปต์ได้ ให้เลือก Ollama ทั้งคู่ฟรี ทั้งคู่รันโมเดล GGUF บน GPU หรือ CPU ของคุณได้ และทั้งคู่เปิด endpoint ที่รองรับ OpenAI — นักพัฒนาจำนวนมากจึงติดตั้งทั้งสองตัวและใช้ต่างหน้าที่กัน บทความนี้เทียบกันตั้งแต่การติดตั้ง การจัดการ GPU ความเร็ว ไปจนถึงการเปิด API ด้วยคำสั่งจริงที่รันได้ทันที เพื่อให้คุณเลิกอ่านเธรดใน Reddit แล้วเริ่มสร้าง token ในเครื่องของตัวเอง

Ollama กับ LM Studio ต่างกันอย่างไร?

ความต่างที่แท้คืออินเทอร์เฟซและเจตนาของเครื่องมือ:

  • Ollama เป็น runtime ที่ให้ความสำคัญกับ CLI ดึงโมเดลมาด้วยคำสั่งเดียว แล้วโมเดลทำงานเป็น background service บน localhost:11434 พร้อม REST API — ไม่มีหน้าต่างแชตในตัว เพราะถูกออกแบบให้เป็น “Docker ของวงการ LLM” ที่เครื่องมืออื่นมาต่อเข้ากับมัน
  • LM Studio เป็นแอปเดสก์ท็อปเต็มรูปแบบ (Electron) มีตัวค้นหาโมเดล UI สำหรับแชต ตั้งค่ารายโมเดลได้ (ความยาว context จำนวน layer ที่ย้ายไป GPU temperature) และมีโหมด local server ที่เปิดด้วยคลิกเดียว

ทั้งคู่เข้าใจฟอร์แมต GGUF และใช้เอนจินสายเดียวกัน — Ollama ฝัง llama.cpp มาในตัว ส่วน LM Studio ใช้ runtime ที่สร้างบน llama.cpp และดาวน์โหลดอัปเดตให้เอง แปลว่าคุณภาพการสร้างข้อความของไฟล์โมเดลเดียวกันนั้นเหมือนกันในทางปฏิบัติ สิ่งที่ต่างคือทุกอย่าง รอบตัว โมเดล

Ollama ใช้งานเชิงพาณิชย์ได้ฟรีหรือไม่?

ได้ Ollama เป็น open source (สัญญาอนุญาต MIT) และใช้เชิงพาณิชย์ได้ฟรี — สิ่งเดียวที่ต้องรับผิดชอบคือสัญญาอนุญาตของ โมเดล ไม่ใช่ของ Ollama Llama, Mistral, Qwen และ Gemma ต่างก็มีเงื่อนไขของตัวเอง จึงควรตรวจ model card ก่อนนำไปต่อยอดเป็นสินค้า

ส่วน LM Studio ฟรีเฉพาะการใช้ส่วนบุคคล โดยมาพร้อมสัญญาอนุญาตแบบปิดซอร์ส: การใช้ในที่ทำงานต้องเปิดใช้ work license ซึ่งฟรี แต่บริษัทที่มีรายได้เกินเกณฑ์ที่กำหนดต้องจ่ายเงิน ถ้าฝ่ายจัดซื้อของบริษัทคุณถามเป็น ข้อต่างข้อนี้อย่างเดียวก็ตัดสินประเด็น Ollama vs LM Studio ได้แล้ว

Ollama ใช้ GPU ให้เองอัตโนมัติหรือไม่?

ใช่ — Ollama ตรวจจับ CUDA (NVIDIA), Metal (Apple Silicon) และ ROCm (AMD) ตั้งแต่ตอนเริ่มทำงาน แล้วย้าย layer ไปยัง GPU มากเท่าที่ VRAM จะรับไหว มีสองคำสั่งตรวจสอบที่ควรจำ:

# Ollama โหลดอะไรจริง ๆ — GPU หรือ CPU?
ollama ps

# บังคับถ้ามันถอยกลับไปใช้ CPU เงียบ ๆ:
OLLAMA_NUM_GPU=999 ollama run qwen2.5-coder:7b

ถ้า ollama ps แสดง 100% GPU แปลว่าย้ายสำเร็จ ถ้าเห็นสัดส่วนแบบ 48%/52% CPU/GPU แปลว่าโมเดลไม่พอดี และคุณจะรู้สึกได้จาก tokens/sec LM Studio เปิดการควบคุมแบบเดียวกันผ่าน แถบเลื่อน GPU offload ต่อโมเดล ซึ่งสะดวกกว่าเวลาอยากทดลอง — เป็นจุดที่ UX ของมันทำได้ดีกว่าจริง

อะไรเร็วกว่ากัน: Ollama หรือ LM Studio?

โมเดลเดียวกัน quantization เดียวกัน เครื่องเดียวกัน: เสมอกันในทางปฏิบัติ เพราะทั้งคู่ส่งงานต่อให้ llama.cpp ผล benchmark ที่อ้างว่า “Ollama เร็วกว่า” หรือกลับกัน มักเทียบกันข้ามระดับ quant หรือความยาว context อยู่แล้ว วัดเองบนเครื่องคุณดีกว่าเชื่อฝ่ายใดฝ่ายหนึ่ง:

# ฝั่ง Ollama: --verbose พิมพ์อัตราการประมวลผล (tokens/sec) ตอนท้าย
ollama run qwen2.5-coder:7b --verbose "Summarise what a Makefile does in one sentence."

ฝั่ง LM Studio ให้โหลดไฟล์ GGUF ตัวเดียวกันด้วยความยาว context และจำนวน layer บน GPU เท่ากัน แล้วดู tokens/sec จากแผงสถิติของหน้าแชต ฝ่ายไหนตัวเลขสูงกว่า ให้รันซ้ำอีกสองรอบ — การโหลดครั้งแรกมีสัญญาณรบกวนตอนอุ่นเครื่อง

รัน LM Studio เป็น local API server ได้หรือไม่?

ได้ — เปิดแท็บ Developer สั่งเริ่มเซิร์ฟเวอร์ แล้วคุณจะได้ endpoint ที่รองรับ OpenAI บน localhost:1234 มีถึง CLI (lms) ไว้เขียนสคริปต์ด้วย:

lms server start
lms load qwen2.5-coder-7b-instruct --gpu max
curl http://localhost:1234/v1/chat/completions 
  -H "Content-Type: application/json" 
  -d '{"model":"qwen2.5-coder-7b-instruct","messages":[{"role":"user","content":"Write a jq filter for the top process by CPU"}]}'

ฝั่ง Ollama API ใช้ได้ตลอดเวลาที่ service ทำงานอยู่ ทั้ง endpoint ดั้งเดิมและเส้นทางที่รองรับ OpenAI ไม่ต้องตั้งค่าอะไรเลย:

curl -fsSL https://ollama.com/install.sh | sh   # ติดตั้งบน Linux
ollama pull qwen2.5-coder:7b
curl http://localhost:11434/api/chat -d '{
  "model": "qwen2.5-coder:7b",
  "messages": [{"role": "user", "content": "Explain bash exit codes in two lines"}],
  "stream": false
}'

ทั้งคู่เสียบเข้ากับเครื่องมือใดก็ได้ที่พูดภาษา OpenAI API — extension ของ VS Code, coding agent หรือสคริปต์ของคุณเอง จุดที่ Ollama แซงหน้าคือ: service เริ่มพร้อมบูตเครื่อง รันแบบ headless บนเซิร์ฟเวอร์หรือเครื่อง homelab และไม่มีอะไรต้องพึ่งแอปเดสก์ท็อปที่ต้องเปิดค้างไว้ ผมใช้เซ็ตอัปแบบนี้พอดีบน homelab ของตัวเอง Ollama แจกโมเดลให้ทุกอย่างในเครือข่ายโดยที่เครื่องหลักไม่ต้องมีเมาส์

แล้วควรเลือกตัวไหน: Ollama หรือ LM Studio?

เกณฑ์OllamaLM Studio
อินเทอร์เฟซCLI + REST APIGUI เดสก์ท็อปเต็มรูปแบบ
Open sourceMIT ทั้งหมดปิดซอร์ส ฟรีเฉพาะรายบุคคล
ใช้เชิงพาณิชย์ฟรีต้องจ่ายเมื่อขยายขนาด
การจัดการโมเดลollama pull <model>ค้นหาในตัว + ตัวดาวน์โหลด
UI แชตไม่มี (หามาเอง)มีในตัว
API endpoint:11434 เปิดตลอด:1234 เปิด-ปิดได้
ใช้แบบ headless/บนเซิร์ฟเวอร์ดีเยี่ยมลำบาก
Windows / macOS / Linuxครบสามแพลตฟอร์มWindows + macOS, Linux ยังเบตา

กฎนิ้วโป้ง ไม่มีทางเสียใจทางไหน:

  1. อยาก ใช้ โมเดล — แชต ลองเล่น จัดการแถบเลื่อน: LM Studio
  2. อยาก สร้าง สิ่งบนโมเดล — สคริปต์ agent CI หรือ API service ที่บ้าน: Ollama
  3. อยากได้ทั้งคู่ — ติดตั้งทั้งสองตัว อยู่ร่วมกันได้สบาย (แค่อย่าปล่อยให้สองเซิร์ฟเวอร์ทวงหมายเลขพอร์ตเดียวกัน และจำไว้ว่าโมเดลที่โหลดซ้ำสองรอบกิน VRAM สองรอบเหมือนกัน)

โมเดลในเครื่องเข้าคู่กับเครื่องมือ coding แบบ agentic ได้ดีเป็นพิเศษ — ชี้ client ที่รองรับ OpenAI ไปที่ endpoint ในเครื่องแล้วคุณจะได้ completion ไม่จำกัดโดยไม่มีค่าใช้จ่ายต่อ token การจับคู่แบบนี้คือหัวใจของเซ็ตอัปแบบ local-first ที่อยู่เบื้องหลัง freechat และเป็นวิธีเรียนรู้งานช่างฝั่ง LLM ที่ถูกที่สุด เพราะบิลเดียวที่ต้องจ่ายคือค่าไฟ

— mrsaynothing

— mrsaynothing

บันทึกหน้างานเรื่อง AI, Linux และ self-hosted

คุยต่อโพสต์นี้บน dev.to dev.to ↗

รับวิธีแก้ฉบับถัดไปทางอีเมล

อีเมลหนึ่งฉบับต่อหนึ่งโพสต์ แก้เสร็จแล้วไปต่อ

self-hosted · ไม่มีบุคคลที่สาม · ยกเลิกได้ในคลิกเดียว

นี่คืออะไร?

ถ้าอ่านแล้วชอบ — ผมสร้างงานแบบนี้เป็นอาชีพ จ้างผม