Ga naar inhoud

Real-SWE: kosten per opgelost issue

Bijgewerkt September 27, 2026 · eerst gepubliceerd September 27, 2026

Real-SWE verscheen op 12 september 2026 en kreeg 275 punten en 158 reacties op Hacker News. Het uitgangspunt is het deel dat de meeste kostenmodellen verkeerd hebben: benchmarksuites zijn openbaar, uit het hoofd geleerd en niet representatief voor de code waar je agents echt aan werken. Real-SWE draait modellen tegen private, echte enterprise-repositories.

Waarom het kostengetal zwaarder weegt dan de score

Een openbare benchmark geeft je een slagingspercentage. Het geeft je geen kosten. Kosten per opgelost issue vragen drie dingen tegelijk:

Vermenigvuldig die en je krijgt het enige cijfer dat op een kostenpost aansluit. Een model dat 4 punten onder de koploper scoort maar issues in één poging oplost met een derde van de tokens, is goedkoper per opgelost issue, en op een echte backlog groeit dat verschil sneller dan het scoreverschil doet vermoeden.

Waarom openbare benchmarks de kwaliteit overschatten

Enterprise-codebases hebben precies de eigenschappen die de aannames van openbare benchmarks breken: lange interne conventies, ongedocumenteerde invarianten, tests die historische toevalligheden vastleggen en buildsystemen die niemand volledig begrijpt. Een model dat patronen herkent in een openbare repo, herkent ze niet in een monorepo van 400 bestanden met drie jaar opgestapelde beslissingen. Daarom was een veelbesproken resultaat deze maand een 27B open-weights creatief-schrijfmodel dat op Fable 5-niveau presteerde tegen een gemelde 40x lagere prijs — open weights beginnen met een voorkennis over lokale repositories die API-modellen missen.

De berekening uitvoeren

Neem een echte backend-repo waarin 40 issues binnen scope vallen. Stel dat het goedkopere model er 22 in één poging oplost met 60K input / 8K output, en het premiummodel er 26 oplost met een retry-multiplier van 1.4x bij 90K input / 14K output. Tegen Opus 5.5-tarieven ($4/$20, cache-reads $0.20):

ModelOpgelostKosten per issueTotaal
Goedkope tier22$0.32$7.04
Premium tier26$0.61$15.86

Premium kost 2.3x het totaal voor 18% meer opgeloste issues. Op een backlog van 40 issues is dat $9 extra. Dezelfde afweging bij 4.000 issues per maand is $880 — en levert nog steeds maar 18% meer doorvoer op. De goedkopere tier is niet vanzelfsprekend fout; je ruilt oplossingspercentage tegen volume, en het juiste antwoord hangt af van de vraag of een gemist issue meer dan een dollar kost.

Wat je moet instrumenteren

  1. Kosten per opgelost issue, niet per poging. De noemer zijn gemergede PR's, geen verzoeken.
  2. Retry-multiplier per model. Een model op 1.4x is een derde van zijn listprijs kwijt voordat je iets anders meetelt.
  3. Tokens per geaccepteerde diff, inclusief plan- en zelfreviewtokens die de diff nooit toont.
  4. Reviewminuten van mensen. Een model dat 12% goedkoper is maar 20% langer kost om te reviewen, is duurder.

Conclusie

Openbare benchmarks rangschikken capaciteit op taken die niet op je backlog lijken. Real-SWE is een eerste poging tot de eerlijke versie. Tot je het op je eigen repos draait, behandel je elke modelvergelijking als een hypothese over kosten per opgelost issue en prijs je die hypothese met je eigen tokentellingen.

Gerelateerd


Wilt u dit toepassen op uw stack? Neem leveranciersfacturen, gatewaylogs en de belangrijkste workflows mee; we brengen kostenfactoren en besparingskansen in kaart. Plan een gratis audit →

Terug naar finopsllm.com