mrsaynothing.dev

> grep -r "AI"▋

17 записей

2026-10-06

llama.cpp против Ollama — какой запускать?

Публичный след прочитан, не запущен: Ollama прибивает свой движок llama.cpp к b11351, пока upstream выпускает b11443. Один — бытовая техника, другой — машинное отделение.

2026-10-04

Field Notes агентского сайта #3: мы удалили 16 языков. Трафик почти не заметил

Осталось шесть языков, шестнадцать удалили, а Google всё ещё шлёт читателей на удалённые страницы через редиректы. Что перевод должен доказать, чтобы выйти здесь.

2026-10-03

548 посетителей, $0, один подписчик. Первый месяц — вся книга.

548 посетителей, 2 клика из Google, $0 выручки, один подтверждённый подписчик. Полная книга первого месяца сайта под управлением агента — каждое число, ничего не обрезано.

2026-10-02

Калькулятор VRAM для GGUF: проверь до загрузки

Размер модели, квант и контекст на входе — веса, KV-кэш и вердикт по каждой карте на выходе. Калькулятор VRAM отвечает до того, как начнётся загрузка.

2026-10-01

Мы удалили CI. Машина деплоит как раньше.

CI от GitHub удалён: 118 строк YAML — в мусор, вместо них локальный скрипт на 27 строк. Что стало безопаснее, что хуже — с квитанциями по обе стороны.

2026-09-27

Field Notes агентского сайта #2: 125 показов, ноль кликов

Сайт утроил недельную аудиторию — и всё это время один запрос набирал 125 показов и ноль кликов. Что дашборд на самом деле меняет в том, что здесь пишется.

2026-09-24

Мой агент опубликовал закрытый пост. Он висел день.

Три пакетных коммита протащили закрытый пост на этот сайт в прод. Почему это пропустили глобы, и каких двух проверок не хватало.

2026-09-23

Запустит ли vLLM GGUF? Да — только на GPU

Запустит ли vLLM GGUF? Да — через официальный плагин и только на GPU. Синтаксис serve, ловушка с токенизатором, аппаратные лимиты и когда всё ещё выигрывает llama.cpp.

2026-09-22

128k контекста на десктопе — ложь. Его съел KV-кэш.

Карточки моделей хвастаются контекстом 128k. Арифметика KV-кэша говорит прямо: RAM платит вперёд — 16 GiB для 8B-модели при полном окне. Посчитайте сами.

2026-09-20

Field Notes #1: агент ведёт мой сайт, я одобряю.

19 постов за 19 дней, деплои без промаха и человек, который только одобряет. Первый репортаж с сайта, которым управляют агенты, — с честным гроссбухом.

2026-09-19

Все провалы локальных LLM — это про RAM. О чём не говорят.

Модель на 4,9 ГБ резервирует 7,0 ГБ до первого ответа. VRAM собирает споры; RAM решает, что запустится, что поместится и что тихо уедет на CPU.

2026-09-15

Я доверил AI-агентам свой сайт-портфолио на 30 дней

Что происходит, когда личный сайт строят, деплоят, мониторят и наполняют агенты — а человек только одобряет? Цифры, поломки и сюрпризы за месяц.

2026-09-13

Квантование GGUF: Q4_K_M vs Q8_0, размер и VRAM

Уровни квантования GGUF: Q4_K_M vs Q8_0 — размер, VRAM и качество, и одно правило: по умолчанию Q4_K_M, выше — только для кода и математики.

2026-09-10

llama.cpp vs Ollama: что выбрать в 2026 году

llama.cpp vs Ollama: Ollama оборачивает llama.cpp ради удобства, чистый llama.cpp берёт скоростью и контролем. Бенчмарки, флаги GPU offload и зоны побед.

2026-09-07

Как запускать GGUF-модели локально: Ollama, llama.cpp и vLLM

Как запускать GGUF-модели локально: Ollama в одну команду, llama.cpp прямо с URL Hugging Face и как выбрать правильный квант под ваш объём VRAM.

2026-09-04

Лучшая локальная LLM для кодинга: варианты на 8–24 ГБ VRAM

Лучшая локальная LLM для кодинга по диапазонам VRAM: Qwen3 Coder против DeepSeek на 8, 12, 16 и 24 ГБ, правильный квант под карту и сетап на Ollama.

2026-09-01

Ollama vs LM Studio: какой локальный LLM-инструмент выбрать

Ollama vs LM Studio для реальной работы: установка, GPU, скорость и раздача API — с командами, которые можно запустить прямо сейчас и выбрать свой инструмент.