Cómo trabajamos
“IA probada desde el sur” es una promesa exigente. Estas son las reglas que nos ponemos para cumplirla, y cómo puedes revisar que las cumplimos.
Cuatro etiquetas, siempre visibles
La forma del ícono cambia además del color, para que se distingan sin depender de él.
Lo dice quien lo vende. Ejemplo: “Sonnet 5.5 marca 70,6% en Terminal-Bench 4.0”, según Anthropic.
Lo midió otro. Ejemplo: “~109 tok/s con Qwen3.8-27B y MTP en una RTX 4090”, según ComputingForGeeks.
Lo medimos nosotros, con pasaporte. Hoy no hay ninguna cifra con esta etiqueta: preferimos decirlo.
No hay fuente o es estimación. Ejemplo: “Mistral Large 4 pesaría ~500 GB a 4 bits” (regla general, no archivo real).
Diez reglas
- Fuente primaria siempre que exista. Página oficial de precios, release en GitHub, comunicado o documento público. Si usamos un medio, lo decimos.
- Ninguna cifra de rendimiento se presenta como propia si no la medimos con pasaporte. Las cifras ajenas llevan su etiqueta.
- Precios en CLP con fecha. Precio de lista × dólar observado del día × 1,19 de IVA. Siempre decimos qué dólar usamos.
- Benchmarks del proveedor se describen como tales. Nunca como “el modelo es mejor”.
- Lo que no sabemos, lo decimos. “No publicado” no se reemplaza por una estimación disfrazada.
- Correcciones visibles. Todo error corregido queda en el registro de cambios, con lo que decía antes.
- Nada se borra. Las tablas viejas se archivan con su fecha.
- Patrocinios rotulados y sin poder de veto sobre resultados. Hoy no tenemos ninguno.
- Sin recomendar hardware caro con una sola prueba.
- Usamos IA para investigar y redactar borradores; una persona revisa cada dato y firma la pieza.
Cada medición, reproducible
Cuando publiquemos una cifra propia, irá con un pasaporte: un bloque que cualquiera puede copiar para repetir la prueba en su equipo. Si no hay pasaporte, no hay etiqueta “Probado por nosotros”.
El script benchmarks/benchmark.sh corre un modelo de Ollama varias veces con un prompt fijo, toma los tokens por segundo que informa --verbose, anota el hardware y las versiones, y agrega una fila a benchmarks.csv. El CSV viene vacío: no inventamos resultados.
./benchmarks/benchmark.sh qwen3.8:27b 5
# → agrega una fila a benchmarks/benchmarks.csv
# → crea benchmarks/pasaportes/AAAA-MM-DD-qwen3.8-27b.md- ID
- LIA-2026-___
- Equipo
- CPU · GPU/VRAM · RAM · SO
- Runtime
- Ollama 0.40.2 (u otro, con versión)
- Modelo
- qwen3.8:27b · Q4_K_M · digest
- Contexto
- num_ctx usado
- Prompt
- fijo, publicado en el repo
- Corridas
- 5 (se informa la mediana)
- Comando
- ./benchmark.sh qwen3.8:27b 5
- Resultado
- Pendiente: aún no medido