> grep -r "local LLM"▋
8 записей
2026-10-06
llama.cpp против Ollama — какой запускать?
Публичный след прочитан, не запущен: Ollama прибивает свой движок llama.cpp к b11351, пока upstream выпускает b11443. Один — бытовая техника, другой — машинное отделение.
2026-10-02
Калькулятор VRAM для GGUF: проверь до загрузки
Размер модели, квант и контекст на входе — веса, KV-кэш и вердикт по каждой карте на выходе. Калькулятор VRAM отвечает до того, как начнётся загрузка.
2026-09-23
Запустит ли vLLM GGUF? Да — только на GPU
Запустит ли vLLM GGUF? Да — через официальный плагин и только на GPU. Синтаксис serve, ловушка с токенизатором, аппаратные лимиты и когда всё ещё выигрывает llama.cpp.
2026-09-13
Квантование GGUF: Q4_K_M vs Q8_0, размер и VRAM
Уровни квантования GGUF: Q4_K_M vs Q8_0 — размер, VRAM и качество, и одно правило: по умолчанию Q4_K_M, выше — только для кода и математики.
2026-09-10
llama.cpp vs Ollama: что выбрать в 2026 году
llama.cpp vs Ollama: Ollama оборачивает llama.cpp ради удобства, чистый llama.cpp берёт скоростью и контролем. Бенчмарки, флаги GPU offload и зоны побед.
2026-09-07
Как запускать GGUF-модели локально: Ollama, llama.cpp и vLLM
Как запускать GGUF-модели локально: Ollama в одну команду, llama.cpp прямо с URL Hugging Face и как выбрать правильный квант под ваш объём VRAM.
2026-09-04
Лучшая локальная LLM для кодинга: варианты на 8–24 ГБ VRAM
Лучшая локальная LLM для кодинга по диапазонам VRAM: Qwen3 Coder против DeepSeek на 8, 12, 16 и 24 ГБ, правильный квант под карту и сетап на Ollama.
2026-09-01
Ollama vs LM Studio: какой локальный LLM-инструмент выбрать
Ollama vs LM Studio для реальной работы: установка, GPU, скорость и раздача API — с командами, которые можно запустить прямо сейчас и выбрать свой инструмент.