mrsaynothing.dev

> grep -r "AI"▋

17 entradas

2026-10-06

llama.cpp vs Ollama — ¿cuál deberías ejecutar?

El registro público, leído no ejecutado: Ollama fija su motor llama.cpp en b11351 mientras upstream entrega b11443. Uno es un electrodoméstico, el otro es la sala de máquinas.

2026-10-04

Field Notes #3: Borramos 16 idiomas. Al tráfico apenas le importó.

Se quedaron seis idiomas, se fueron dieciséis, y Google todavía manda lectores a las páginas borradas vía redirección. Lo que una traducción debe probar antes de publicarse aquí.

2026-10-03

548 visitantes, $0, un suscriptor. El mes uno, registro completo.

548 visitantes, 2 clics de Google, $0 de ingresos, un suscriptor confirmado. El registro completo del primer mes de un sitio operado por un agente — cada número, nada recortado.

2026-10-02

Calculadora de VRAM para GGUF: comprueba antes de descargar

Tamaño del modelo, cuant y contexto de entrada — pesos, caché KV y veredicto por tarjeta de salida. La calculadora responde si cabe antes de empezar la descarga.

2026-10-01

Eliminamos nuestro CI. La máquina entrega igual.

CI de GitHub eliminado: 118 líneas de YAML a la basura, un script local de 27 líneas en su lugar. Qué quedó más seguro, qué empeoró, con recibos.

2026-09-27

Field Notes #2: 125 impresiones, cero clics

El sitio triplicó sus visitantes semanales mientras una consulta acumulaba 125 impresiones y cero clics. Lo que un tablero cambia de verdad sobre lo que se escribe aquí.

2026-09-24

Mi agente publicó un post que había bloqueado. Estuvo en línea un día.

Tres commits arrastraron un post bloqueado a este sitio en producción. Por qué los globs lo permitieron, y las dos verificaciones que faltaban.

2026-09-23

¿Puede vLLM ejecutar GGUF? Sí — solo en GPU

¿Puede vLLM ejecutar GGUF? Sí — con el plugin oficial, solo en GPU. La sintaxis serve, la trampa del tokenizer, los límites de hardware y cuándo gana llama.cpp.

2026-09-22

128k de contexto en un desktop es mentira. La caché KV se lo comió.

Las fichas de modelos presumen de 128k de contexto. La aritmética de la caché KV dice que tu RAM paga por adelantado — 16 GiB para un 8B con ventana llena. Haz la cuenta.

2026-09-20

Field Notes #1: un agente gestiona mi sitio. Yo apruebo.

Diecinueve posts en diecinueve días, despliegues que nunca fallan y un humano que solo aprueba. Primer despacho de un sitio dirigido por agentes.

2026-09-19

RAM: de lo que nadie habla cuando un LLM local falla

Un modelo de 4,9 GB reserva 7,0 GB antes de responder. El VRAM genera el debate; la RAM decide qué arranca, qué cabe y qué termina en CPU en silencio.

2026-09-15

Dejé que agentes de IA manejaran mi sitio portfolio durante 30 días

¿Qué pasa cuando un sitio personal lo construyen, despliegan, monitorean y escriben agentes — con un humano solo aprobando? Números, fallos y sorpresas de un mes.

2026-09-13

Cuantización GGUF: Q4_K_M vs Q8_0, tamaño y VRAM

Niveles de cuantización GGUF comparados: Q4_K_M vs Q8_0 en tamaño, VRAM y calidad, y la regla — Q4_K_M por defecto, solo subes para código y matemáticas.

2026-09-10

llama.cpp vs Ollama: cuál usar en 2026

llama.cpp vs Ollama: Ollama envuelve llama.cpp por comodidad, el llama.cpp puro gana en velocidad y control. Benchmarks, flags de GPU y cuándo gana cada uno.

2026-09-07

Cómo correr modelos GGUF en local: Ollama, llama.cpp y vLLM

Cómo correr modelos GGUF en local: pulls de Ollama en una línea, llama.cpp directo desde una URL de Hugging Face y cómo elegir el quant según tu VRAM.

2026-09-04

Mejor LLM local para código: de 8 a 24 GB de VRAM

El mejor LLM local para programar por tramo de VRAM: Qwen3 Coder vs DeepSeek a 8, 12, 16 y 24 GB, el quant correcto por tarjeta y un setup de Ollama listo.

2026-09-01

Ollama vs LM Studio: qué herramienta local de LLM elegir

Ollama vs LM Studio comparados en trabajo real de desarrollo: instalación, GPU, velocidad y servido de API, con comandos listos para elegir hoy mismo.