Vai al contenuto

Downgrade silenziosi e modelli di costo

Aggiornato September 27, 2026 · pubblicato inizialmente September 27, 2026

Il 23 settembre 2026 un thread su r/GroundTruthAINews ha segnalato una nota a piè di pagina nascosta nelle note di lancio di Opus 5.5 di Anthropic: una richiesta a Opus 5.5 può essere servita da Opus 4.8. Anthropic e OpenAI hanno entrambe annunciato tagli di prezzo nello stesso pomeriggio. Entrambi i laboratori hanno venduto la stessa idea: mantenere la capacità e spendere molto meno. La nota a piè di pagina è la parte che conta per FinOps.

Cosa è successo davvero

Claude Opus 5.5 è partito a $4/$20 per milione di token, circa il 20% in meno di Opus 5, con le letture dalla cache ridotte del 60% a $0.20. Anthropic afferma che meno token per attività e un output del 30% più veloce rendono i carichi tipici circa il 40% più economici. Circa 90 minuti dopo OpenAI ha lanciato GPT-6 Sol a $2/$10 e Luna a $0.10/$0.50, entrambi a metà dei prezzi di GPT-5.6.

Ogni post di lancio di questo periodo riporta lo stesso tipo di nota: l'endpoint che chiami è un alias, e l'alias viene bilanciato tra versioni del modello durante una finestra di transizione. È una normale pratica di gestione della capacità. È anche un problema per la modellazione dei costi.

Perché rompe i numeri

Come rilevare lo scambio

Ogni grande provider restituisce il modello risolto nel corpo della risposta. Registralo. Un campo, quattro righe di codice:

resolved = response.model  # e.g. "claude-opus-4-8-20260115"
assert resolved.startswith(EXPECTED_PREFIX) or resolved in ALLOWED_FALLBACKS

Poi suddividi ogni metrica di costo per modello risolto, non per il modello richiesto. Nel momento in cui un gruppo inizia a slittare, hai la risposta: l'alias sta mescolando versioni e il tuo costo per attività è una media ponderata di due prodotti diversi.

Le implicazioni per il budget

Durante una transizione, pianifica sul costo mescolato, non sul titolo. Se il 20% delle chiamate scende su un modello più vecchio, la tua tariffa effettiva di input non è $4.00 per milione — è quella che produce il mix. La stessa logica vale per il risparmio dichiarato: il 40% più economico è una media su carichi tipici che presume già una riduzione del numero di token, che può non reggere se il modello più economico ma più vecchio è quello che genera le risposte più lunghe.

Regole da rispettare

  1. Non modellare mai su un alias. Fissa un ID di modello datato per tutto ciò che budgetti o valuti.
  2. Registra il modello risolto su ogni richiesta. Non negoziabile se mai rieseguirai una valutazione.
  3. Ricalibra la baseline dopo la finestra di transizione. La durata tipica è di settimane, non di trimestri, ma verificalo.
  4. Prezza una transizione come un mix. Chiedi al provider la suddivisione attesa, o misurala.

In sintesi

Un taglio di prezzo e un downgrade silenzioso possono arrivare nello stesso pomeriggio. Il taglio è il titolo; il downgrade è la nota a piè di pagina che invalida in silenzio la previsione del mese scorso. Registra il modello risolto, fissa gli ID datati e prezza il mix.

Correlati


Vuoi applicarlo al tuo stack? Porta le fatture dei provider, i log del gateway e i flussi di lavoro principali: mapperemo i costi e i possibili risparmi. Prenota un audit gratuito →

Torna a finopsllm.com