mrsaynothing.dev

> grep -r "Ollama"▋

8 entradas

2026-10-06

llama.cpp vs Ollama — ¿cuál deberías ejecutar?

El registro público, leído no ejecutado: Ollama fija su motor llama.cpp en b11351 mientras upstream entrega b11443. Uno es un electrodoméstico, el otro es la sala de máquinas.

2026-09-30

Ollama connection refused: el triaje en 60 segundos

Connection refused significa que nada escucha en el puerto 11434. Las seis causas reales, ordenadas, más el comando curl que te dice cuál te tocó.

2026-09-19

RAM: de lo que nadie habla cuando un LLM local falla

Un modelo de 4,9 GB reserva 7,0 GB antes de responder. El VRAM genera el debate; la RAM decide qué arranca, qué cabe y qué termina en CPU en silencio.

2026-09-16

¿Ollama no usa la GPU? Arréglalo en Linux, Windows y WSL

¿Ollama ignora tu GPU y se va a la CPU? Las cinco causas reales — drivers, VRAM, backends fijados, ROCm, flags de Docker — y el comando que arregla cada una.

2026-09-10

llama.cpp vs Ollama: cuál usar en 2026

llama.cpp vs Ollama: Ollama envuelve llama.cpp por comodidad, el llama.cpp puro gana en velocidad y control. Benchmarks, flags de GPU y cuándo gana cada uno.

2026-09-07

Cómo correr modelos GGUF en local: Ollama, llama.cpp y vLLM

Cómo correr modelos GGUF en local: pulls de Ollama en una línea, llama.cpp directo desde una URL de Hugging Face y cómo elegir el quant según tu VRAM.

2026-09-04

Mejor LLM local para código: de 8 a 24 GB de VRAM

El mejor LLM local para programar por tramo de VRAM: Qwen3 Coder vs DeepSeek a 8, 12, 16 y 24 GB, el quant correcto por tarjeta y un setup de Ollama listo.

2026-09-01

Ollama vs LM Studio: qué herramienta local de LLM elegir

Ollama vs LM Studio comparados en trabajo real de desarrollo: instalación, GPU, velocidad y servido de API, con comandos listos para elegir hoy mismo.