Kembali ke blog

Cara Menjalankan Model GGUF Lokal: Ollama, llama.cpp & vLLM

7 September 2026

Baru mengunduh berkas .gguf dan bingung cara menjalankannya? Jalur tercepat: ollama run hf.co/<repo>:Q4_K_M — Ollama menarik GGUF langsung dari Hugging Face dan menyajikannya. GGUF adalah format model satu berkas yang diperkenalkan llama.cpp dan kini dipahami semua alat LLM lokal, sehingga berkas yang sama berjalan di Ollama, llama.cpp, LM Studio, Jan, dan (dengan catatan) vLLM. Panduan ini membahas tiap runner dengan perintah siap salin, cara memilih kuantisasi yang tepat untuk VRAM Anda, dan galat pemuatan yang benar-benar akan Anda temui.

Apa itu berkas GGUF?

GGUF (GGML Universal File) adalah format wadah untuk model bahasa terkuantisasi. Satu berkas memuat bobot, tokenizer, dan metadata model — tak ada lagi yang perlu diunduh, tanpa tumpukan konfigurasi. Bobot di dalamnya terkuantisasi: dipadatkan dari float 16-bit menjadi integer 4-bit (atau lebih rendah), itulah sebabnya model 9B yang butuh ~18 GB dalam presisi penuh muat dalam ~5.5 GB sebagai berkas Q4 dan berjalan di GPU gaming atau bahkan CPU.

Dua hal penting tentang nama berkas GGUF:

  1. Model dasarnyagemma-3-4b-it-GGUF adalah Gemma 3 4B hasil fine-tune yang diekspor ke GGUF.
  2. Tag quant-nyaQ4_K_M, Q8_0, IQ4_XS, dan kawan-kawannya menunjukkan seberapa agresif bobot dipadatkan. Lebih lanjut soal memilihnya di bawah.

Bisakah Ollama menjalankan model GGUF?

Bisa — GGUF adalah format natif Ollama, dan sejak 2024 ia bisa menariknya langsung dari Hugging Face tanpa Anda menyentuh berkas mana pun:

# Tarik quant GGUF langsung dari Hugging Face dan mengobrol dengannya
ollama run hf.co/bartowski/gemma-2-9b-it-GGUF:Q4_K_M

# Tag quant setelah titik dua memilih berkas di dalam repo
ollama run hf.co/ggml-org/gemma-3-4b-it-GGUF:Q8_0

Sudah mengunduh berkas .gguf sendiri? Arahkan sebuah Modelfile ke sana:

# Modelfile — satu baris sudah cukup
FROM ./gemma-2-9b-it-Q4_K_M.gguf
ollama create gemma9b -f Modelfile
ollama run gemma9b

Ollama memutuskan offload GPU secara otomatis dan menyajikan API kompatibel OpenAI di port 11434, sehingga apa pun yang berbicara bahasa API itu bisa memakai modelnya. Tarif baliknya adalah kontrol: Anda tidak memilih berapa banyak lapisan yang pindah ke GPU.

Bagaimana menjalankan berkas GGUF di llama.cpp?

llama.cpp adalah tempat GGUF berasal — format ini memang ada untuknya — sehingga dukungannya paling dalam dan paling segar. Biner llama-server memberi Anda UI obrolan sekaligus endpoint kompatibel OpenAI:

# Unduh langsung dari Hugging Face (memilih GGUF yang cocok untuk mesin Anda)
llama-server -hf ggml-org/gemma-3-4b-it-GGUF --port 8080

# Atau jalankan berkas yang sudah Anda miliki, dengan offload GPU penuh
llama-server -m ./gemma-2-9b-it-Q4_K_M.gguf -ngl 99 --port 8080

-ngl 99 mendorong 99 lapisan ke GPU; atur lebih rendah dari izin VRAM Anda dan sisanya tinggal di CPU. Dial offload parsial inilah keunggulan super llama.cpp — model 9B berjalan mulus di kartu 6 GB dengan 20 dari 48 lapisan di-offload, hanya lebih lambat. Untuk prompting sekali jalan alih-alih server, ganti llama-server dengan llama-cli dengan flag -m yang sama.

LM Studio adalah mesin yang sama di balik GUI desktop: letakkan berkas .gguf ke folder modelnya (atau cari Hugging Face dari dalam aplikasi) lalu klik load. Untuk soal pemilihan tooling-nya sendiri, perbandingan Ollama vs LM Studio membahas mana yang diletakkan di bawah model Anda.

Kuantisasi GGUF mana yang sebaiknya diunduh?

Jawaban bawaan: Q4_K_M. Inilah titik manis komunitas — dalam satu-dua persen dari kualitas presisi penuh dengan ukuran sekitar seperempatnya. Tangganya, dari terbesar ke terkecil:

  • Q8_0 — nyaris tanpa kehilangan; pakai jika VRAM Anda menelan 8.5 bit per bobot tanpa merasakannya.
  • Q6_K / Q5_K_M — turun satu langkah ukuran, tetap sangat baik untuk model 30B+.
  • Q4_K_M — pilihan bawaan. Untuk model 7–14B, di sinilah kualitas per GB memuncak.
  • IQ4_XS / Q3_K_M — untuk memampatkan model besar ke kartu kecil; kehilangan kualitas mulai terasa.
  • Q2_K dan di bawahnya — jalan terakhir; model mulai melantur menjadi omong kosong di tengah kalimat.

Patokan muat: ukuran berkas dalam GB plus ~1–2 GB overhead konteks seharusnya muat di VRAM Anda. Q4_K_M 4.7 GB dari model 9B nyaman di kartu 8 GB. Utamakan model lebih kecil dengan quant lebih tinggi daripada model lebih besar dengan quant buruk — Q8 4B biasanya mengalahkan Q2 9B.

GGUF vs Safetensors: format mana yang Anda butuhkan?

Safetensors adalah format arsip tak terkuantisasi — bobot presisi penuh untuk training, fine-tuning, dan alat seperti transformers dan ComfyUI. GGUF adalah format terkuantisasi yang bisa dijalankan untuk inferensi di perangkat keras Anda sendiri. Anda tak bisa melakukan fine-tune pada GGUF, dan Anda tak bisa menjalankan berkas safetensors di Ollama atau llama.cpp tanpa mengonversinya dulu (untuk itulah skrip convert_hf_to_gguf.py di llama.cpp). Aturannya: training atau pipeline gambar → safetensors; obrolan dan serving lokal → GGUF. Jika pencarian Anda berawal dari “gguf vs safetensors”, pemisahan itulah seluruh jawabannya.

Runner GGUF mana yang sebaiknya dipakai?

RunnerPaling cocok untukInstalasiOffload GPUAPI kompatibel OpenAI
OllamaLayanan pasang-lalu-lupakancurl satu barisOtomatisYa (:11434/v1)
llama.cppKontrol maksimal, fitur terbaruBuild atau manajer paketDial -ngl manualYa (llama-server)
LM StudioGUI desktop, menjelajah modelUnduh aplikasiOtomatisYa (server lokal)
vLLMServing multi-pengguna terbatchingpip install vllmOtomatisYa (natif)

Pilih Ollama jika Anda mau ia menyala saat boot dan tak terlihat — itulah yang saya pakai di homelab saya untuk menyajikan model ke seluruh perangkat di jaringan. Pilih llama.cpp saat Anda butuh fitur di hari ia dirilis (arsitektur baru mendarat di sana lebih dulu) atau menginginkan kontrol memori hingga level lapisan. Pilih LM Studio untuk GUI. Pilih vLLM hanya saat satu model harus melayani banyak pengguna serentak — dukungan GGUF-nya bekerja, tapi kelas dua dibanding format natifnya.

Kenapa model GGUF saya gagal dimuat?

Empat galat yang menutupi sebagian besar kasus:

  1. unknown model architecture — GGUF memakai arsitektur yang lebih baru daripada runtime Anda (model MoE dan vision terus bermunculan). Perbarui Ollama atau bangun ulang llama.cpp; tak ada perbaikan lain.
  2. Kehabisan memori saat memuat — quant terlalu besar untuk VRAM Anda plus konteks. Turun satu anak tangga (Q4_K_MQ3_K_M), turunkan -ngl, atau perkecil konteks dengan -c 4096.
  3. Unduhan terpotong / korup — pemuatan GGUF gagal dengan galat magic-number atau metadata. Unduh ulang dan cocokkan SHA256 yang tertera di halaman Hugging Face.
  4. ollama run ./model.gguf menolak — wajar: run milik Ollama menerima nama model, bukan jalur berkas. Pakai rute Modelfile di atas.

Satu sudut pandang terakhir yang layak diketahui: endpoint GGUF lokal berpadu baik dengan alat coding agentic — arahkan klien kompatibel OpenAI ke sana dan completions hanya berbiaya listrik. LLM lokal terbaik untuk coding menguji model mana yang layak mendapat slot itu setelah perpipaan dalam panduan ini bekerja.

— mrsaynothing

Get the next one by email

One email per post. No spam, no algorithms.

self-hosted · no third parties · one-click unsubscribe

what is this?

Git Sync Fork With Upstream: 3 Metode Aman

Suka tulisannya? Saya membangun seperti ini untuk hidup. pekerjakan saya