Prezzi e velocità dell'API OpenAI Ultrafast
Aggiornato October 7, 2026 · pubblicato inizialmente September 27, 2026
OpenAI Ultrafast accelera la generazione dell'output di GPT-6 Astra a sei volte i prezzi standard dei token. La guida attuale dichiara una generazione fino a otto volte più veloce; l'annuncio del DevDay parlava di fino a sei volte. Nessuna delle due cifre garantisce la latenza end-to-end. Confrontate l'addebito aggiuntivo di inferenza con il tempo di completamento misurato e il valore di business prima di instradare il traffico di produzione verso questo livello.
Cosa cambia Ultrafast?
Ultrafast riduce il tempo tra un token di output generato e il successivo. Non rende ogni parte di una richiesta otto volte più veloce: l'elaborazione dell'input, la configurazione di rete, gli strumenti, il codice applicativo e l'attesa di servizi esterni incidono ancora sulla latenza totale. OpenAI raccomanda WebSocket, soprattutto per gli agenti che effettuano più chiamate di strumenti in rapida successione, perché l'overhead di connessione può annullare parte del guadagno.
Quanto costa GPT-6 Astra Ultrafast?
La tabella dei prezzi di OpenAI riporta quanto segue per un milione di token di testo, per richieste GPT-6 Astra a contesto breve:
| Livello | Input | Input in cache | Scrittura in cache | Output |
|---|---|---|---|---|
| Standard | $10 | $1 | $12.50 | $50 |
| Ultrafast | $60 | $6 | $75 | $300 |
Ultrafast costa 6× la tariffa Standard indicata per ogni categoria di token. Verificate la pagina dei prezzi aggiornata prima di fare il budget, perché tariffe ed eleggibilità possono cambiare. Ultrafast supporta l'elaborazione globale e la residenza dei dati negli Stati Uniti; non supporta endpoint di elaborazione regionali nell'UE o in altre regioni non statunitensi. Dove sono supportati, possono applicarsi adeguamenti regionali e FedRAMP.
Cosa significa il sovrapprezzo per attività?
Ecco una richiesta ipotetica senza cache con 8,000 token di input e 2,000 di output. Alle tariffe Standard costa $0.18: $0.08 per l'input e $0.10 per l'output. Alle tariffe Ultrafast costa $1.08: $0.48 per l'input e $0.60 per l'output. Il sovrapprezzo è di $0.90 per attività. Questo esempio usa prezzi pubblicati e conteggi di token ipotizzati; non prevede la latenza né il valore di business di un carico reale.
Per un carico reale, moltiplicate i token mensili di input, input in cache, scrittura in cache e output per i prezzi correnti di ciascun livello. Mantenete lo stesso modello, gli stessi prompt, le stesse impostazioni di ragionamento e lo stesso mix di attività quando confrontate i livelli.
Quando Ultrafast vale il sovrapprezzo?
Provatelo su lavori in cui il tempo di generazione del modello influisce su un risultato misurabile: un assistente interattivo con un obiettivo di latenza, un flusso dal vivo che attende la prossima azione, o un agente in cui turni più rapidi riducono il tempo di inattività fatturato. Confrontate il tempo di completamento end-to-end p50 e p95, il tasso di successo e il costo per attività riuscita. Usate il sovrapprezzo solo quando il tempo risparmiato misurato vale più del costo incrementale.
Per l'arricchimento offline, i riepiloghi programmati e gli altri lavori che possono attendere, Standard o un'opzione di elaborazione scontata può essere più adatta. Mantenete una rotta di riserva per le richieste che superano il limite di frequenza di Ultrafast.
Chi può usarlo e quali limiti si applicano?
La guida attuale di OpenAI su Ultrafast indica che l'accesso a GPT-6 Astra è disponibile per i clienti API con i limiti di frequenza predefiniti. I limiti predefiniti documentati in token al minuto sono 500,000 per Build, 1,000,000 per Launch e 5,000,000 per Grow. Limiti più alti possono richiedere una richiesta al team account di OpenAI.
Quali fonti documentano le affermazioni su prezzi e velocità?
Fonti primarie: guida alla modalità Ultrafast di OpenAI, prezzi dell'API OpenAI e riepilogo del DevDay 2026 di OpenAI. Vedete anche instradamento dei modelli e benchmark del costo LLM per utente.
Correlati
- Instradamento dei modelli
- Benchmark del costo LLM per utente
- ChatGPT Pro Max: economia del piano da $500
- Come limitare i costi di inferenza
Vuoi applicarlo al tuo stack? Porta le fatture dei provider, i log del gateway e i flussi di lavoro principali: mapperemo i costi e i possibili risparmi. Prenota un audit gratuito →