¿Qué modelo abierto corre en tu fierro?
Elige cuánta memoria tienes y te decimos qué modelos caben a 4 bits. Los tamaños vienen de las bibliotecas oficiales o de pruebas publicadas, y cada uno trae su etiqueta. No medimos velocidad: eso va con pasaporte.
Cabe con holgura 0
Cabe justo 0
No cabe 0
Una regla simple, explicada
Un modelo cabe si su tamaño cargado más ~1,5 GB para un contexto corto entra en la memoria disponible. En un Mac contamos ~75% de la memoria unificada, porque el sistema se reserva una parte; en “solo CPU” restamos ~4 GB y advertimos que será lento. Son estimaciones nuestras Sin confirmar: el tamaño de cada modelo sí tiene fuente.
¿Más contexto? Necesitas más memoria. Por ejemplo, ComputingForGeeks midió Qwen3.8-27B en una RTX 4090: 19,7 GiB con 32K de contexto en Ollama, y 22,2 GiB con 262K en llama.cpp usando caché KV de 4 bits Terceros.
Ayúdanos a medir
Corre benchmarks/benchmark.sh en tu equipo y mándanos el pasaporte. Con eso pasamos datos de “terceros” a “probado”, con crédito para ti.