mrsaynothing.dev

> grep -r "GGUF"▋

5 записей

2026-10-06

llama.cpp против Ollama — какой запускать?

Публичный след прочитан, не запущен: Ollama прибивает свой движок llama.cpp к b11351, пока upstream выпускает b11443. Один — бытовая техника, другой — машинное отделение.

2026-10-02

Калькулятор VRAM для GGUF: проверь до загрузки

Размер модели, квант и контекст на входе — веса, KV-кэш и вердикт по каждой карте на выходе. Калькулятор VRAM отвечает до того, как начнётся загрузка.

2026-09-23

Запустит ли vLLM GGUF? Да — только на GPU

Запустит ли vLLM GGUF? Да — через официальный плагин и только на GPU. Синтаксис serve, ловушка с токенизатором, аппаратные лимиты и когда всё ещё выигрывает llama.cpp.

2026-09-13

Квантование GGUF: Q4_K_M vs Q8_0, размер и VRAM

Уровни квантования GGUF: Q4_K_M vs Q8_0 — размер, VRAM и качество, и одно правило: по умолчанию Q4_K_M, выше — только для кода и математики.

2026-09-07

Как запускать GGUF-модели локально: Ollama, llama.cpp и vLLM

Как запускать GGUF-модели локально: Ollama в одну команду, llama.cpp прямо с URL Hugging Face и как выбрать правильный квант под ваш объём VRAM.