Precio de un modelo de pesos abiertos
Updated September 1, 2026 · first published September 1, 2026
Qwen3.8-Flash-Next apareció el 26 de agosto de 2026 como vista previa de pesos abiertos de la arquitectura Qwen4: unos 6B de parámetros activos, contexto nativo de 262.144 tokens y ninguna tarifa alojada anunciada. Eso rompe la comparación habitual: un modelo cerrado te da un número por millón de tokens; unos pesos abiertos te dan un checkpoint y te dejan el número a ti.
La fórmula
coste por MTok = precio_hora / (tokens_por_segundo * 3600) * 1.000.000A 2,00 $ la hora y 1.500 tokens por segundo medidos, son 0,37 $ por millón de tokens. Frente a una API a 3,00 $/MTok parece un ahorro de ocho veces. También es una cifra equivocada, porque supone que la GPU está ocupada cada segundo que pagas.
El término que todos olvidan: la utilización
Alquilas la hora y usas una fracción. Divide por esa fracción: al 60% son 0,62 $; al 30%, 1,23 $; al 10%, 3,70 $ — más caro que la API que ibas a sustituir. La mayoría de los primeros despliegues están entre el 10% y el 30%, porque el tráfico es irregular y la instancia se dimensiona para el pico. El ahorro es real, pero es un ahorro de utilización, no de pesos.
Mide antes de comprometerte
Ejecuta el modelo en la instancia que alquilarías de verdad, con tus prompts y tus longitudes de contexto, y anota los tokens por segundo bajo concurrencia, no el número de flujo único de la ficha del modelo. Después calcula la utilización con tu perfil real de tráfico. Dos números, una división, y la decisión se toma sola. Ponle precio al contexto que envías, no al que el modelo admite.
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →