> grep -r "Ollama"▋
8 entradas
2026-10-06
llama.cpp vs Ollama — ¿cuál deberías ejecutar?
El registro público, leído no ejecutado: Ollama fija su motor llama.cpp en b11351 mientras upstream entrega b11443. Uno es un electrodoméstico, el otro es la sala de máquinas.
2026-09-30
Ollama connection refused: el triaje en 60 segundos
Connection refused significa que nada escucha en el puerto 11434. Las seis causas reales, ordenadas, más el comando curl que te dice cuál te tocó.
2026-09-19
RAM: de lo que nadie habla cuando un LLM local falla
Un modelo de 4,9 GB reserva 7,0 GB antes de responder. El VRAM genera el debate; la RAM decide qué arranca, qué cabe y qué termina en CPU en silencio.
2026-09-16
¿Ollama no usa la GPU? Arréglalo en Linux, Windows y WSL
¿Ollama ignora tu GPU y se va a la CPU? Las cinco causas reales — drivers, VRAM, backends fijados, ROCm, flags de Docker — y el comando que arregla cada una.
2026-09-10
llama.cpp vs Ollama: cuál usar en 2026
llama.cpp vs Ollama: Ollama envuelve llama.cpp por comodidad, el llama.cpp puro gana en velocidad y control. Benchmarks, flags de GPU y cuándo gana cada uno.
2026-09-07
Cómo correr modelos GGUF en local: Ollama, llama.cpp y vLLM
Cómo correr modelos GGUF en local: pulls de Ollama en una línea, llama.cpp directo desde una URL de Hugging Face y cómo elegir el quant según tu VRAM.
2026-09-04
Mejor LLM local para código: de 8 a 24 GB de VRAM
El mejor LLM local para programar por tramo de VRAM: Qwen3 Coder vs DeepSeek a 8, 12, 16 y 24 GB, el quant correcto por tarjeta y un setup de Ollama listo.
2026-09-01
Ollama vs LM Studio: qué herramienta local de LLM elegir
Ollama vs LM Studio comparados en trabajo real de desarrollo: instalación, GPU, velocidad y servido de API, con comandos listos para elegir hoy mismo.