IA en la nube o en local: calcula tu propio punto de equilibrio en 15 minutos
Al terminar este artículo tendrás tu propio número: el mes en el que una máquina que es tuya sale más barata que pagar por token. No necesitas más que una hoja de cálculo o Python, y los precios y velocidades que vienen a continuación. El sitio más barato para empezar es el portátil que ya tienes.
Qué necesitas
- Una idea aproximada de tu carga de trabajo diaria: cuántas peticiones haces y cuánto ocupan el prompt y la respuesta. Un cálculo con un margen de error del doble sirve para la primera pasada.
- Diez minutos con las tablas de precios de abajo.
- Opcional: Python 3 para ejecutar la calculadora. Cualquier asistente de IA también puede hacerte las cuentas si le pegas las tablas.
Paso 1: apunta lo que cobra hoy la nube
Precios por millón de tokens, en dólares, tal y como están publicados en septiembre de 2026. Un token equivale a unas tres cuartas partes de una palabra en inglés y a aproximadamente media palabra en español.
| Modelo | Entrada / 1M tokens | Salida / 1M tokens | Fuente |
|---|---|---|---|
| GPT-5 | 1,25 $ | 10,00 $ | Precios de OpenAI |
| GPT-5 mini | 0,25 $ | 2,00 $ | Precios de OpenAI |
| Claude Sonnet 5 | 2,00 $ | 10,00 $ | Precios de Anthropic |
| Claude Haiku 4.5 | 1,00 $ | 5,00 $ | Precios de Anthropic |
Fíjate en dos cosas. Los tokens de salida cuestan entre 4 y 10 veces más que los de entrada, así que las cargas que escriben mucho (informes, código, respuestas largas) son las caras. Y los modelos pequeños son baratos: un modelo de clase mini o Haiku por unos pocos dólares al mes es una opción real, y este artículo no va a fingir lo contrario.
Paso 2: apunta lo que cuesta y lo que rinde el hardware local
| Hardware | Precio (EUR) | Ejecuta con soltura | Velocidad medida o documentada | Consumo |
|---|---|---|---|---|
| El portátil o PC que ya tienes (16 GB de RAM, solo CPU) | 0 | Modelos de 3B; 7B despacio | 5 a 10 tokens/s (CPU) | ya pagado |
| NVIDIA Jetson Orin Nano Super | ~250 | Modelos de 3B | ~12 a 18 tokens/s (Edge AI Vision) | 25 W |
| Mac mini M4, 24 GB | ~920 | Modelos de 7B a 14B | ~35 tokens/s con Qwen 2.5 7B (Compute Market) | 30 W |
| Nuestra estación de trabajo (NVIDIA GB10, 128 GB de memoria unificada) | mucho más de lo que necesitas | Modelos de 35B o más | 33,2 tokens/s con Qwen 2.5 Coder 7B, medido el 09-09-2026 | compartida con otros 50 servicios |
La última fila está por honestidad, no como recomendación. Los números que importan a una pequeña empresa son los de las tres primeras filas.
Electricidad de un Mac mini encendido todo el día, todos los días: 30 W × 24 h × 30 días = 21,6 kWh al mes. A 0,15 EUR por kWh son unos 3,25 EUR al mes. Una Jetson, menos de 3 EUR. Ese es todo el coste de funcionamiento una vez que la caja está en tu mesa.
Paso 3: convierte tu carga de trabajo en tokens
Elige la fila que se parezca a tu negocio o construye la tuya con la misma aritmética.
Carga A: procesamiento de documentos. 200 documentos al día, cada uno enviado con 3.000 tokens de contexto y devolviendo un resumen de 500 tokens. Al mes (22 días laborables): 13,2 millones de tokens de entrada y 2,2 millones de salida.
Carga B: un asistente interno. 20 personas, 50 preguntas al día cada una, 4.000 tokens de contexto por pregunta y respuestas de 300 tokens. Al mes: 88 millones de tokens de entrada y 6,6 millones de salida.
Paso 4: ejecuta la calculadora
# punto_equilibrio.py — meses hasta que el hardware propio gana a la facturación por token
PRECIOS = { # USD por 1M tokens (entrada, salida), sept. 2026
"GPT-5": (1.25, 10.0),
"GPT-5 mini": (0.25, 2.0),
"Claude Sonnet 5": (2.00, 10.0),
"Claude Haiku 4.5":(1.00, 5.0),
}
HARDWARE_EUR = 920 # Mac mini M4 24 GB; usa 250 para una Jetson, 0 para tu propio PC
LUZ_EUR_MES = 3.25 # 30 W, 24/7, 0,15 EUR/kWh
ENT_M, SAL_M = 88, 6.6 # carga B en millones de tokens al mes
for nombre, (p_ent, p_sal) in PRECIOS.items():
nube = ENT_M * p_ent + SAL_M * p_sal # tratamos 1 USD como 1 EUR: favorece a la nube
meses = HARDWARE_EUR / (nube - LUZ_EUR_MES) if nube > LUZ_EUR_MES else float("inf")
print(f"{nombre:18s} nube {nube:7.2f}/mes equilibrio {meses:5.1f} meses")
Ejecútalo con python3 punto_equilibrio.py y cambia los tres números de arriba por los tuyos. Si lo prefieres, pega las dos tablas en cualquier asistente de IA y pídele: “Calcula mi coste mensual en la nube y el mes de equilibrio para una máquina de 920 EUR que cuesta 3,25 EUR al mes mantener encendida.”
Qué dicen los números
| Carga | Modelo | Nube al mes | Equilibrio Mac mini | Equilibrio Jetson |
|---|---|---|---|---|
| A: 200 docs/día | GPT-5 | 38,50 $ | 26 meses | 7 meses |
| A: 200 docs/día | GPT-5 mini | 7,70 $ | no compensa solo por coste | 56 meses |
| A: 200 docs/día | Claude Haiku 4.5 | 24,20 $ | 44 meses | 12 meses |
| B: asistente de 20 personas | GPT-5 | 176,00 $ | 5,3 meses | 1,4 meses |
| B: asistente de 20 personas | Claude Sonnet 5 | 242,00 $ | 3,9 meses | 1,0 mes |
| B: asistente de 20 personas | GPT-5 mini | 35,00 $ | 29 meses | 8 meses |
| B: asistente de 20 personas | Claude Haiku 4.5 | 121,00 $ | 7,8 meses | 2,1 meses |
Léelo con honestidad:
- Con poco volumen, los modelos más baratos de la nube ganan en coste. Si envías unos cientos de peticiones cortas al día y un modelo de clase mini resuelve la tarea, 8 EUR al mes son difíciles de batir. En ese caso eliges local por otras razones: los datos no salen del edificio, funciona cuando internet no funciona y la factura nunca puede darte una sorpresa.
- En cuanto varias personas lo usan a diario, el hardware propio se amortiza en menos de un año frente a cualquier modelo de primera línea, y en menos de dos meses frente a los modelos más caros.
- La placa en la que corre un modelo de 3B cuesta menos que un mes de factura de un equipo activo. Ese es el punto de entrada sin barreras: empieza con un dispositivo de 250 EUR o con el PC que tienes, mide tus tokens reales durante dos semanas y decide después si una máquina mayor está justificada.
Lo que el local no puede hacer, para que lo planifiques
Un modelo de 7B en un Mac mini no iguala a un modelo de primera línea en razonamiento difícil, en agentes largos de varios pasos ni en conocimiento muy especializado. El patrón práctico es híbrido: el trabajo rutinario, repetitivo y privado va a la máquina local, y se mantiene una clave de nube con límite de gasto para el 5 por ciento de tareas que necesitan el modelo más grande. Tu cálculo de equilibrio se aplica entonces solo a la parte rutinaria, que suele ser donde está el volumen de todos modos.
Siguientes pasos
- Dimensiona bien la máquina: Mejores dispositivos para IA local en 2026.
- Mete un modelo más grande en menos memoria: La cuantización explicada.
- Convierte el equilibrio en un caso de negocio completo: Marco de ROI de la IA local con calculadora.
- Instálalo todo paso a paso: Cómo implementar IA en una empresa española.
Trabaja con nosotros
Hacemos exactamente este cálculo con cada cliente antes de recomendar hardware, con sus recuentos de tokens reales y no con estimaciones. Si quieres una segunda opinión sobre tus números, escríbenos o mira cómo trabajamos en consultoría.