mrsaynothing.dev

> grep -r "Ollama"▋

8 записей

2026-10-06

llama.cpp против Ollama — какой запускать?

Публичный след прочитан, не запущен: Ollama прибивает свой движок llama.cpp к b11351, пока upstream выпускает b11443. Один — бытовая техника, другой — машинное отделение.

2026-09-30

Ollama connection refused — диагностика за 60 секунд

Connection refused означает, что на порту 11434 никто не слушает. Шесть реальных причин по убыванию вероятности и одна команда curl, которая назовёт вашу.

2026-09-19

Все провалы локальных LLM — это про RAM. О чём не говорят.

Модель на 4,9 ГБ резервирует 7,0 ГБ до первого ответа. VRAM собирает споры; RAM решает, что запустится, что поместится и что тихо уедет на CPU.

2026-09-16

Ollama не использует GPU? Чиним на Linux, Windows и в WSL

Ollama игнорирует GPU и пересаживается на CPU? Пять реальных причин — драйверы, VRAM, закреплённый бэкенд, ROCm, флаги Docker — и команда для каждой.

2026-09-10

llama.cpp vs Ollama: что выбрать в 2026 году

llama.cpp vs Ollama: Ollama оборачивает llama.cpp ради удобства, чистый llama.cpp берёт скоростью и контролем. Бенчмарки, флаги GPU offload и зоны побед.

2026-09-07

Как запускать GGUF-модели локально: Ollama, llama.cpp и vLLM

Как запускать GGUF-модели локально: Ollama в одну команду, llama.cpp прямо с URL Hugging Face и как выбрать правильный квант под ваш объём VRAM.

2026-09-04

Лучшая локальная LLM для кодинга: варианты на 8–24 ГБ VRAM

Лучшая локальная LLM для кодинга по диапазонам VRAM: Qwen3 Coder против DeepSeek на 8, 12, 16 и 24 ГБ, правильный квант под карту и сетап на Ollama.

2026-09-01

Ollama vs LM Studio: какой локальный LLM-инструмент выбрать

Ollama vs LM Studio для реальной работы: установка, GPU, скорость и раздача API — с командами, которые можно запустить прямо сейчас и выбрать свой инструмент.