Ver todos los artículos
Análisis de CostesIA LocalHardwareGuía

IA en la nube o en local: calcula tu propio punto de equilibrio en 15 minutos

JG
Jacobo Gonzalez Jaspe
|
Este artículo también está en inglés:Cloud vs Local AI: Work Out Your Own Break-Even in 15 Minutes

Al terminar este artículo tendrás tu propio número: el mes en el que una máquina que es tuya sale más barata que pagar por token. No necesitas más que una hoja de cálculo o Python, y los precios y velocidades que vienen a continuación. El sitio más barato para empezar es el portátil que ya tienes.

Qué necesitas

  • Una idea aproximada de tu carga de trabajo diaria: cuántas peticiones haces y cuánto ocupan el prompt y la respuesta. Un cálculo con un margen de error del doble sirve para la primera pasada.
  • Diez minutos con las tablas de precios de abajo.
  • Opcional: Python 3 para ejecutar la calculadora. Cualquier asistente de IA también puede hacerte las cuentas si le pegas las tablas.

Paso 1: apunta lo que cobra hoy la nube

Precios por millón de tokens, en dólares, tal y como están publicados en septiembre de 2026. Un token equivale a unas tres cuartas partes de una palabra en inglés y a aproximadamente media palabra en español.

ModeloEntrada / 1M tokensSalida / 1M tokensFuente
GPT-51,25 $10,00 $Precios de OpenAI
GPT-5 mini0,25 $2,00 $Precios de OpenAI
Claude Sonnet 52,00 $10,00 $Precios de Anthropic
Claude Haiku 4.51,00 $5,00 $Precios de Anthropic

Fíjate en dos cosas. Los tokens de salida cuestan entre 4 y 10 veces más que los de entrada, así que las cargas que escriben mucho (informes, código, respuestas largas) son las caras. Y los modelos pequeños son baratos: un modelo de clase mini o Haiku por unos pocos dólares al mes es una opción real, y este artículo no va a fingir lo contrario.

Paso 2: apunta lo que cuesta y lo que rinde el hardware local

HardwarePrecio (EUR)Ejecuta con solturaVelocidad medida o documentadaConsumo
El portátil o PC que ya tienes (16 GB de RAM, solo CPU)0Modelos de 3B; 7B despacio5 a 10 tokens/s (CPU)ya pagado
NVIDIA Jetson Orin Nano Super~250Modelos de 3B~12 a 18 tokens/s (Edge AI Vision)25 W
Mac mini M4, 24 GB~920Modelos de 7B a 14B~35 tokens/s con Qwen 2.5 7B (Compute Market)30 W
Nuestra estación de trabajo (NVIDIA GB10, 128 GB de memoria unificada)mucho más de lo que necesitasModelos de 35B o más33,2 tokens/s con Qwen 2.5 Coder 7B, medido el 09-09-2026compartida con otros 50 servicios

La última fila está por honestidad, no como recomendación. Los números que importan a una pequeña empresa son los de las tres primeras filas.

Electricidad de un Mac mini encendido todo el día, todos los días: 30 W × 24 h × 30 días = 21,6 kWh al mes. A 0,15 EUR por kWh son unos 3,25 EUR al mes. Una Jetson, menos de 3 EUR. Ese es todo el coste de funcionamiento una vez que la caja está en tu mesa.

Paso 3: convierte tu carga de trabajo en tokens

Elige la fila que se parezca a tu negocio o construye la tuya con la misma aritmética.

Carga A: procesamiento de documentos. 200 documentos al día, cada uno enviado con 3.000 tokens de contexto y devolviendo un resumen de 500 tokens. Al mes (22 días laborables): 13,2 millones de tokens de entrada y 2,2 millones de salida.

Carga B: un asistente interno. 20 personas, 50 preguntas al día cada una, 4.000 tokens de contexto por pregunta y respuestas de 300 tokens. Al mes: 88 millones de tokens de entrada y 6,6 millones de salida.

Paso 4: ejecuta la calculadora

# punto_equilibrio.py — meses hasta que el hardware propio gana a la facturación por token
PRECIOS = {              # USD por 1M tokens (entrada, salida), sept. 2026
    "GPT-5":           (1.25, 10.0),
    "GPT-5 mini":      (0.25, 2.0),
    "Claude Sonnet 5": (2.00, 10.0),
    "Claude Haiku 4.5":(1.00, 5.0),
}
HARDWARE_EUR = 920        # Mac mini M4 24 GB; usa 250 para una Jetson, 0 para tu propio PC
LUZ_EUR_MES = 3.25        # 30 W, 24/7, 0,15 EUR/kWh
ENT_M, SAL_M = 88, 6.6    # carga B en millones de tokens al mes

for nombre, (p_ent, p_sal) in PRECIOS.items():
    nube = ENT_M * p_ent + SAL_M * p_sal       # tratamos 1 USD como 1 EUR: favorece a la nube
    meses = HARDWARE_EUR / (nube - LUZ_EUR_MES) if nube > LUZ_EUR_MES else float("inf")
    print(f"{nombre:18s} nube {nube:7.2f}/mes   equilibrio {meses:5.1f} meses")

Ejecútalo con python3 punto_equilibrio.py y cambia los tres números de arriba por los tuyos. Si lo prefieres, pega las dos tablas en cualquier asistente de IA y pídele: “Calcula mi coste mensual en la nube y el mes de equilibrio para una máquina de 920 EUR que cuesta 3,25 EUR al mes mantener encendida.”

Qué dicen los números

CargaModeloNube al mesEquilibrio Mac miniEquilibrio Jetson
A: 200 docs/díaGPT-538,50 $26 meses7 meses
A: 200 docs/díaGPT-5 mini7,70 $no compensa solo por coste56 meses
A: 200 docs/díaClaude Haiku 4.524,20 $44 meses12 meses
B: asistente de 20 personasGPT-5176,00 $5,3 meses1,4 meses
B: asistente de 20 personasClaude Sonnet 5242,00 $3,9 meses1,0 mes
B: asistente de 20 personasGPT-5 mini35,00 $29 meses8 meses
B: asistente de 20 personasClaude Haiku 4.5121,00 $7,8 meses2,1 meses

Léelo con honestidad:

  • Con poco volumen, los modelos más baratos de la nube ganan en coste. Si envías unos cientos de peticiones cortas al día y un modelo de clase mini resuelve la tarea, 8 EUR al mes son difíciles de batir. En ese caso eliges local por otras razones: los datos no salen del edificio, funciona cuando internet no funciona y la factura nunca puede darte una sorpresa.
  • En cuanto varias personas lo usan a diario, el hardware propio se amortiza en menos de un año frente a cualquier modelo de primera línea, y en menos de dos meses frente a los modelos más caros.
  • La placa en la que corre un modelo de 3B cuesta menos que un mes de factura de un equipo activo. Ese es el punto de entrada sin barreras: empieza con un dispositivo de 250 EUR o con el PC que tienes, mide tus tokens reales durante dos semanas y decide después si una máquina mayor está justificada.

Lo que el local no puede hacer, para que lo planifiques

Un modelo de 7B en un Mac mini no iguala a un modelo de primera línea en razonamiento difícil, en agentes largos de varios pasos ni en conocimiento muy especializado. El patrón práctico es híbrido: el trabajo rutinario, repetitivo y privado va a la máquina local, y se mantiene una clave de nube con límite de gasto para el 5 por ciento de tareas que necesitan el modelo más grande. Tu cálculo de equilibrio se aplica entonces solo a la parte rutinaria, que suele ser donde está el volumen de todos modos.

Siguientes pasos

Trabaja con nosotros

Hacemos exactamente este cálculo con cada cliente antes de recomendar hardware, con sus recuentos de tokens reales y no con estimaciones. Si quieres una segunda opinión sobre tus números, escríbenos o mira cómo trabajamos en consultoría.

Compartir: LinkedIn X
Newsletter

Acceda a recursos exclusivos

Suscríbase para desbloquear 230+ workflows, 43 agentes y 26 plantillas profesionales. Insights semanales sin spam.

Bonus: Checklist EU AI Act gratis al suscribirte
1x por semana Sin spam Cancela cuando quieras
EU AI Act en vigor — ¿Está su organización en cumplimiento?

Cuéntanos qué quieres ejecutar

Dinos qué quieres ejecutar y con qué presupuesto. Te decimos qué hardware necesitas, qué modelo encaja y qué puedes esperar de él — antes de que gastes nada.

Primera llamada gratis, 15 min Local-first: tus datos no salen de tu red Herramientas y guías abiertas

136 páginas de recursos gratuitos · 26 plantillas de compliance