Quick answer: O Qwen3.8-Flash-Next chegou a 26 de agosto de 2026 como pré-visualização de pesos abertos da arquitetura Qwen4: cerca de 6 mil milhões de parâmetros ativos, contexto nativo de 262 144 tokens e nenhuma...

Preço de um modelo de pesos abertos

Updated September 1, 2026 · first published September 1, 2026

O Qwen3.8-Flash-Next chegou a 26 de agosto de 2026 como pré-visualização de pesos abertos da arquitetura Qwen4: cerca de 6 mil milhões de parâmetros ativos, contexto nativo de 262 144 tokens e nenhuma tarifa alojada anunciada. A comparação habitual deixa de funcionar: um modelo fechado dá um preço por milhão de tokens; pesos abertos dão um checkpoint e deixam a conta consigo.

A fórmula

custo por MTok = preço_hora / (tokens_por_segundo * 3600) * 1 000 000

A 2,00 $ por hora e 1500 tokens por segundo medidos, dá 0,37 $ por milhão de tokens. Face a uma API a 3,00 $/MTok parece uma poupança de oito vezes. Também está errado, porque assume que a GPU trabalha em cada segundo que paga.

O termo esquecido: a utilização

Aluga a hora e usa uma fração dela. Divida por essa fração: 0,62 $ a 60%, 1,23 $ a 30%, 3,70 $ a 10% — mais caro do que a API que ia substituir. A maioria das primeiras implementações fica entre 10% e 30%, porque o tráfego é irregular e a instância é dimensionada para o pico. A poupança é real, mas vem da utilização, não dos pesos.

Meça antes de decidir

Execute o modelo na instância que alugaria mesmo, com os seus prompts e comprimentos de contexto, e registe tokens por segundo em concorrência — não o valor de fluxo único do cartão do modelo. Depois calcule a utilização com o seu perfil real de tráfego. Dois números, uma divisão, e a decisão faz-se sozinha. Ponha preço ao contexto que envia, não ao que o modelo suporta.

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research