Vai al contenuto

Il costo in token di JSON mode e schemi

Aggiornato September 1, 2026 · pubblicato inizialmente September 1, 2026

Risposta rapida: Chiedere a un modello un output strutturato sembra una scelta di formato. In fattura è una scelta di volume, e incide in tre punti contemporaneamente.Lo schema è un costo di input su ogni richiestaUna...

Chiedere a un modello un output strutturato sembra una scelta di formato. In fattura è una scelta di volume, e incide in tre punti contemporaneamente.

Lo schema è un costo di input su ogni richiesta

Una response format o una definizione di tool viene serializzata nella richiesta. Uno schema modesto — una dozzina di campi, una descrizione per ciascuno, un paio di oggetti annidati — vale qualche centinaio di token. È poco finché lo moltiplichi per ogni chiamata, a ogni turno, per tutta la vita della funzionalità. Uno schema da 400 token su un milione di chiamate sono 400 milioni di token di input che paghi per descrivere una forma che non cambia mai.

Peggio ancora, nelle implementazioni ingenue lo schema finisce di solito dopo la parte volatile del prompt, e così si rompe il prefisso in cache. Lo schema allora costa il prezzo pieno ogni volta e distrugge lo sconto su tutto ciò che lo precede.

La sintassi è un costo di output

Ogni parentesi graffa, virgoletta, virgola e nome di campo nella risposta è un token generato, fatturato alla tariffa di output. I nomi di campo prolissi sono un addebito ricorrente: customer_shipping_address_line_one costa per sempre più di addr1. Gli oggetti molto annidati pagano la propria impalcatura. Per risposte brevi racchiuse in un involucro grande, la struttura può superare davvero il contenuto.

I retry sono la parte cara

La decodifica vincolata dei principali provider rende rare le violazioni dello schema, ma gli errori di validazione succedono comunque: un campo che il modello non può compilare onestamente, un enum senza una risposta giusta, uno schema ambiguo per chi lo legge. Ogni fallimento costa un retry completo: di nuovo tutti i token di input, di nuovo tutti i token di output, più latenza. Un tasso di invalidi del 2% su un endpoint ad alto volume è un aumento di costo del 2% senza nulla in cambio.

Cosa fare davvero

Metti lo schema nel prefisso stabile così viene messo in cache, e tienilo identico tra una chiamata e l'altra. Chiedi solo i campi che consumi — i campi extra si pagano due volte, una nello schema e una nella risposta. Preferisci nomi di campo brevi e strutture piatte. Se l'output è un singolo valore, non avvolgerlo affatto in un oggetto. E misura il tasso di fallimento della validazione: è l'unica parte di tutto questo che è puro spreco.

Correlati

Correlati


Vuoi applicarlo al tuo stack? Porta le fatture dei provider, i log del gateway e i flussi di lavoro principali: mapperemo i costi e i possibili risparmi. Prenota un audit gratuito →

Torna a finopsllm.com