> grep -r "GGUF"▋
5 entradas
2026-10-06
llama.cpp vs Ollama — ¿cuál deberías ejecutar?
El registro público, leído no ejecutado: Ollama fija su motor llama.cpp en b11351 mientras upstream entrega b11443. Uno es un electrodoméstico, el otro es la sala de máquinas.
2026-10-02
Calculadora de VRAM para GGUF: comprueba antes de descargar
Tamaño del modelo, cuant y contexto de entrada — pesos, caché KV y veredicto por tarjeta de salida. La calculadora responde si cabe antes de empezar la descarga.
2026-09-23
¿Puede vLLM ejecutar GGUF? Sí — solo en GPU
¿Puede vLLM ejecutar GGUF? Sí — con el plugin oficial, solo en GPU. La sintaxis serve, la trampa del tokenizer, los límites de hardware y cuándo gana llama.cpp.
2026-09-13
Cuantización GGUF: Q4_K_M vs Q8_0, tamaño y VRAM
Niveles de cuantización GGUF comparados: Q4_K_M vs Q8_0 en tamaño, VRAM y calidad, y la regla — Q4_K_M por defecto, solo subes para código y matemáticas.
2026-09-07
Cómo correr modelos GGUF en local: Ollama, llama.cpp y vLLM
Cómo correr modelos GGUF en local: pulls de Ollama en una línea, llama.cpp directo desde una URL de Hugging Face y cómo elegir el quant según tu VRAM.