Real-SWE: costo per issue risolto
Aggiornato September 27, 2026 · pubblicato inizialmente September 27, 2026
Real-SWE è uscito il 12 settembre 2026 e su Hacker News ha raccolto 275 punti e 158 commenti. La premessa è proprio ciò che sbagliano la maggior parte dei modelli di costo: le suite di benchmark sono pubbliche, memorizzate e poco rappresentative del codice che i tuoi agenti toccano davvero. Real-SWE esegue i modelli su repository aziendali reali e privati.
Perché il numero del costo conta più del punteggio
Un benchmark pubblico ti dà un tasso di successo. Non ti dà un costo. Il costo per issue risolto richiede tre cose insieme:
- Tasso di successo sui compiti difficili e privati.
- Token consumati per tentativo, fallimenti inclusi.
- Numero di tentativi — il modello ha avuto bisogno di un retry, di una revisione del piano, di un ciclo di confronto del diff e di riprogettazione?
Moltiplicando questi valori ottieni l'unica cifra che corrisponde a una voce di spesa. Un modello che segna 4 punti in meno del leader ma risolve gli issue in un tentativo con un terzo dei token costa meno per issue risolto, e su un backlog reale questa differenza si accumula più in fretta di quanto suggerisca il divario di punteggio.
Perché i benchmark pubblici sovrastimano la qualità
Le codebase aziendali hanno proprietà che rompono le ipotesi dei benchmark pubblici: lunghe convenzioni interne, invarianti non documentati, test che codificano incidenti storici e sistemi di build che nessuno comprende del tutto. Un modello che riconosce pattern in un repo pubblico non può farlo in un monorepo da 400 file con tre anni di decisioni accumulate. Per questo, questo mese, il risultato più discusso è stato quello di un modello open-weights da 27B per la scrittura creativa che opera al livello di Fable 5 a un prezzo riportato 40x più basso — i pesi aperti partono da un prior sul repository locale che i modelli via API non hanno.
Facciamo il calcolo
Prendi un repository backend reale con 40 issue in scope. Diciamo che il modello più economico ne risolve 22 in un tentativo con 60K di input / 8K di output, e il modello premium ne risolve 26 con un moltiplicatore di retry di 1.4x e 90K di input / 14K di output. Alle tariffe di Opus 5.5 ($4/$20, letture dalla cache $0.20):
| Modello | Risolti | Costo per issue | Totale |
|---|---|---|---|
| Fascia economica | 22 | $0.32 | $7.04 | Fascia premium | 26 | $0.61 | $15.86 |
Il premium costa 2.3x il totale per il 18% di issue risolti in più. Su un backlog di 40 issue sono $9 in più. Lo stesso scambio a 4.000 issue al mese fa $880 — e comunque compra solo il 18% di throughput in più. La fascia economica non è evidentemente sbagliata: stai barattando tasso di risoluzione con volume, e la risposta giusta dipende dal fatto che un issue mancato costi più di un dollaro.
Cosa strumentare
- Costo per issue risolto, non per tentativo. Il denominatore sono le PR mergiate, non le richieste.
- Moltiplicatore dei retry per modello. Un modello a 1.4x costa un terzo in più del suo prezzo di listino prima ancora di contare altro.
- Token per diff accettato, inclusi i token di piano e di auto-revisione che il diff non mostra mai.
- Minuti di revisione umana. Un modello il 12% più economico che richiede il 20% di tempo in più per la revisione costa di più.
Conclusione
I benchmark pubblici classificano le capacità su compiti che non assomigliano al tuo backlog. Real-SWE è un primo tentativo della versione onesta. Finché non lo esegui sui tuoi repo, tratta ogni confronto tra modelli come un'ipotesi di costo per issue risolto e valuta quell'ipotesi con i tuoi conteggi di token.
Correlati
- Costo reale per task: modelli frontier
- Costo per task riuscito
- Costo del coding agentico intensivo: Claude vs Qwen
- Controllo dei costi delle eval
- Prezzare un modello open-weight
Vuoi applicarlo al tuo stack? Porta le fatture dei provider, i log del gateway e i flussi di lavoro principali: mapperemo i costi e i possibili risparmi. Prenota un audit gratuito →