Vai al contenuto

Modello di costo dell'API Decisions di OpenAI: prezzo solo sull'input e output tipizzati rapidi

Aggiornato October 7, 2026 · pubblicato inizialmente October 7, 2026

Risposta rapida: L'API Decisions di OpenAI è un endpoint in beta che trasforma prove condivise, sotto forma di testo o immagini, in classificazioni, scelte o punteggi tipizzati. Con GPT-6 Luna costa $0.10 per milione...

L'API Decisions di OpenAI è un endpoint in beta che trasforma prove condivise, sotto forma di testo o immagini, in classificazioni, scelte o punteggi tipizzati. Con GPT-6 Luna costa $0.10 per milione di token di input e non prevede addebiti per token di cache o di output. Considerate l'affermazione “10x più veloce” come un segnale di latenza, poi verificate qualità e costo totale dell'attività sul vostro carico di lavoro.

Cosa ha rilasciato OpenAI il 6 ottobre 2026?

OpenAI ha aggiunto l'API Decisions in beta pubblica il 6 ottobre 2026. La guida dedicata a Decisions afferma che restituisce risposte tipizzate circa 10 volte più velocemente della Responses API. Al lancio GPT-6 Luna è l'unico modello supportato e le richieste usano POST /v1/decisions. Il confronto sulla velocità è un'affermazione pubblicata da OpenAI, non la promessa che ogni applicazione otterrà lo stesso miglioramento end-to-end.

Una richiesta contiene un input condiviso e una o più domande. Ogni domanda può chiedere un predicato (la probabilità che una condizione sia vera), una scelta da un insieme fornito o un punteggio su livelli ordinati. L'endpoint restituisce queste risposte in forma tipizzata, con probabilità o informazioni di confidenza. Per questo è adatto a decisioni circoscritte, come instradare un ticket di supporto, segnalare un probabile danno in una foto di prodotto o valutare la gravità di un incidente.

Come funziona la fatturazione dell'API Decisions?

Per l'endpoint Decisions, OpenAI indica $0.10 per milione di token di input con GPT-6 Luna. La guida precisa che vengono fatturati solo i token di input: non si applicano addebiti per lettura della cache, scrittura della cache o token di output. Questo differisce da una normale richiesta Responses a GPT-6 Luna, per la quale le tariffe standard in contesto breve sono $0.10 per milione di token di input non in cache, $0.01 per input in cache, $0.125 per le scritture in cache e $0.50 per i token di output. Per questo endpoint usate le condizioni di prezzo specifiche di Decisions, non il listino completo del modello.

Ecco una stima ipotetica, prima di eventuali adeguamenti regionali o per contesto lungo: se una richiesta media usa 1,200 token di input, il costo dei token è 1,200 ÷ 1,000,000 × $0.10 = $0.00012. Un milione di richieste così userebbe 1.2 miliardi di token di input e costerebbe circa $120. È un esempio di pianificazione, non un preventivo: misurate l'uso reale dei token e confermate la tariffa in vigore prima di fissare un budget.

Poiché i token di output non sono una voce fatturata qui, contate con attenzione l'input completo: le prove, il contesto di sistema incluso nella richiesta, e le istruzioni e le scelte di ogni domanda. Dove ha senso, ponete domande indipendenti sullo stesso input in un'unica richiesta. OpenAI documenta che domande indipendenti possono condividere le prove; le domande che dipendono da risposte precedenti vanno inviate in chiamate separate. Mantenete le domande brevi e osservabili, così la richiesta non consuma token in rubriche ambigue.

Quando un team dovrebbe usare Decisions invece di Responses?

Usate Decisions quando il risultato è per natura circoscritto: “Questa immagine presenta danni visibili?”, “Quale di queste tre code è responsabile di questo ticket?” oppure “Quanto è grave questo incidente rispetto a questi livelli espliciti?”. Restituisce una risposta che l'applicazione può instradare o contare, senza chiedere a un modello generico di scrivere un paragrafo e poi analizzare quel testo.

Mantenete Responses per le attività che richiedono spiegazioni, schemi JSON arbitrari, testo generato, chiamate di strumenti o una decisione che richiede una conversazione con il modello. La guida di OpenAI indirizza esplicitamente gli sviluppatori verso Structured Outputs quando serve un oggetto JSON personalizzato, e verso il function calling quando il modello deve richiedere una chiamata di strumento. Una scelta tipizzata non sostituisce una spiegazione motivata né un'azione eseguibile.

Il confronto corretto è il costo per risultato di business corretto, non i token o la latenza considerati isolatamente. Un classificatore veloce che genera falsi positivi costosi può aumentare il lavoro di revisione. Un endpoint a basso prezzo può comunque risultare peggiore se i team compensano con prompt ripetuti, revisione manuale o correzioni a valle. Tracciate i campi di utilizzo e di risposta di Decisions, confrontate un campione di esiti con esempi etichettati e includete la revisione umana e la gestione a valle nel costo per caso instradato con successo.

Come può il FinOps verificare l'affermazione sul risparmio?

  1. Scegliete un carico di lavoro circoscritto. Individuate un passaggio di classificazione o di punteggio ad alto volume, con un insieme chiaro di risposte e un costo degli errori misurabile.
  2. Costruite un set di test etichettato. Misurate la precisione per categoria e verificate la calibrazione di confidenza o probabilità. Fissate le soglie di revisione umana in base al costo di falsi positivi e falsi negativi, come raccomanda OpenAI.
  3. Avviate un pilota confrontabile. Confrontate il percorso di produzione attuale e Decisions su input equivalenti. Registrate latenza dell'endpoint, token, nuovi tentativi, tasso di revisione e costo degli errori corretti.
  4. Includete l'intero percorso nel budget. Aggiungete storage, calcolo applicativo, tempo dei revisori ed eventuali successive chiamate a Responses o a strumenti. Il prezzo a token di Decisions non rende gratuito il resto del flusso di lavoro.
  5. Mantenete una via d'uscita. L'endpoint è in beta pubblica. Fissate endpoint e modello nella configurazione, seguite il changelog e ritestate prima di un'adozione ampia se cambiano comportamento o disponibilità.

OpenAI documenta il supporto a Zero Data Retention e all'uso conforme a HIPAA per i clienti idonei, oltre a opzioni di residenza dei dati negli Stati Uniti e in Europa (SEE e Svizzera), con requisiti di idoneità e di accordo. Verificate questi controlli rispetto alla configurazione effettiva della vostra organizzazione prima di introdurre dati regolamentati in un pilota.

Cosa dovrebbe ricordare un acquirente sul prezzo dell'API Decisions?

L'API Decisions offre una nuova combinazione di prezzo e latenza per decisioni compatte e tipizzate: alla tariffa pubblicata di GPT-6 Luna, l'input costa $0.10 per milione di token e i token di output generati non sono addebitati. I carichi di lavoro più adatti hanno prove riutilizzabili, tipi di risposta chiari e modi economici per individuare i risultati incerti. Misurate la qualità dell'attività e il costo operativo totale prima di spostare volumi di produzione.

Quali ricerche correlate dovrebbero leggere i team?

Correlati


Vuoi applicarlo al tuo stack? Porta le fatture dei provider, i log del gateway e i flussi di lavoro principali: mapperemo i costi e i possibili risparmi. Prenota un audit gratuito →

Torna a finopsllm.com