Vai al contenuto

Come lo stile del prompt compare in fattura

Aggiornato September 1, 2026 · pubblicato inizialmente September 1, 2026

Risposta rapida: I prompt crescono come i file di configurazione. Qualcuno aggiunge un'istruzione per correggere un guasto. Qualcun altro aggiunge un esempio. Una terza persona aggiunge un paragrafo che spiega perché...

I prompt crescono come i file di configurazione. Qualcuno aggiunge un'istruzione per correggere un guasto. Qualcun altro aggiunge un esempio. Una terza persona aggiunge un paragrafo che spiega perché la seconda istruzione conta. Non si toglie mai nulla, perché rimuoverla potrebbe reintrodurre un bug che nessuno sa riprodurre. Sei mesi dopo il system prompt è di tremila token e nessuno sa dire quali duecento siano portanti.

Perché si accumula

A differenza dell'output, che varia con l'attività, l'overhead del prompt si paga su ogni singola richiesta, in modo identico, per sempre. Mille token sprecati su una funzionalità che serve dieci milioni di chiamate al mese sono dieci miliardi di token mensili di pura formattazione.

Nelle conversazioni multi-turno va peggio: il system prompt viene rispedito a ogni turno, quindi il suo costo scala con il numero di turni, non di richieste. E nei loop degli agenti, dove una sola azione dell'utente può innescare una dozzina di chiamate al modello, lo stesso preambolo gonfio viene fatturato una dozzina di volte per un unico lavoro.

Cosa è davvero sprecato

Non la cortesia, che sono poche decine di token e a volte migliora la conformità. Il peso vero sta in: istruzioni ridondanti che ripetono la stessa regola in tre modi, boilerplate difensivo aggiunto per una generazione di modelli che non ne ha più bisogno, esempi duplicati invece di coprire casi distinti, e spiegazioni rivolte ai lettori umani del file del prompt invece che al modello.

Quest'ultima categoria è in pratica la più pesante. Gli esempi few-shot costano molto per token e i team raramente rivedono se cinque esempi facciano un lavoro che ne farebbero due.

Trattare il prompt come codice con un budget

Misura l'overhead fisso del prompt come quota della dimensione media della richiesta: se supera la metà, è un problema di costo, non una questione di stile. Metti la parte stabile in testa così si applica la cache, il che rende il resto del gonfiore molto più economico senza cancellare nulla. Poi fai un'ablation: rimuovi un blocco, esegui le tue valutazioni, tieni la rimozione se la qualità regge. Ridurre il prompt senza una suite di valutazione è un'ipotesi, e il rischio — una regressione di qualità scoperta dai clienti — costa più dei token risparmiati.

Correlati

Correlati


Vuoi applicarlo al tuo stack? Porta le fatture dei provider, i log del gateway e i flussi di lavoro principali: mapperemo i costi e i possibili risparmi. Prenota un audit gratuito →

Torna a finopsllm.com