Zum Inhalt springen

Real-SWE: Kosten pro gelöstem Issue

Aktualisiert September 27, 2026 · erstveröffentlicht September 27, 2026

Real-SWE erschien am 12. September 2026 und sammelte auf Hacker News 275 Punkte und 158 Kommentare. Die Prämisse ist genau das, was die meisten Kostenmodelle falsch machen: Benchmark-Suiten sind öffentlich, auswendig gelernt und nicht repräsentativ für den Code, den Ihre Agenten tatsächlich anfassen. Real-SWE lässt Modelle gegen private, reale Unternehmens-Repositories laufen.

Warum die Kostenzahl wichtiger ist als der Score

Ein öffentlicher Benchmark liefert Ihnen eine Erfolgsquote. Er liefert keine Kosten. Die Kosten pro gelöstem Issue brauchen drei Dinge gleichzeitig:

Multiplizieren Sie diese drei, erhalten Sie die einzige Zahl, die sich einer Budgetposition zuordnen lässt. Ein Modell, das 4 Punkte unter dem Spitzenreiter liegt, Issues aber in einem Versuch mit einem Drittel der Tokens löst, ist pro gelöstem Issue günstiger, und in einem echten Backlog summiert sich dieser Unterschied schneller, als es die Score-Lücke vermuten lässt.

Warum öffentliche Benchmarks die Qualität überschätzen

Unternehmens-Codebasen haben genau die Eigenschaften, die die Annahmen öffentlicher Benchmarks sprengen: lange interne Konventionen, undokumentierte Invarianten, Tests, die historische Zufälle festschreiben, und Build-Systeme, die niemand vollständig versteht. Ein Modell, das Muster in einem öffentlichen Repo erkennt, kann das nicht in einem Monorepo mit 400 Dateien und drei Jahren angesammelter Entscheidungen. Deshalb war ein viel diskutiertes Ergebnis in diesem Monat ein Open-Weights-Modell für kreatives Schreiben mit 27B, das auf Fable-5-Niveau arbeitet, zu einem gemeldeten 40x niedrigeren Preis — offene Gewichte starten mit einem Prior für das lokale Repository, den API-Modellen nicht haben.

Die Rechnung

Nehmen Sie ein reales Backend-Repo mit 40 Issues im Umfang. Angenommen, das günstigere Modell löst 22 in einem Versuch bei 60K Input / 8K Output, und das Premium-Modell löst 26 mit einem Retry-Multiplikator von 1.4x bei 90K Input / 14K Output. Zu Opus-5.5-Preisen ($4/$20, Cache-Lesezugriffe $0.20):

ModellGelöstKosten pro IssueGesamt
Günstige Stufe22$0.32$7.04
Premium-Stufe26$0.61$15.86

Premium kostet 2.3x so viel insgesamt für 18 % mehr gelöste Issues. Bei einem Backlog von 40 Issues sind das $9 mehr. Derselbe Tausch bei 4,000 Issues pro Monat sind $880 — und er erkauft weiterhin nur 18 % mehr Durchsatz. Die günstige Stufe ist nicht offensichtlich falsch; Sie tauschen Lösungsquote gegen Volumen, und die richtige Antwort hängt davon ab, ob ein verpasstes Issue mehr als einen Dollar kostet.

Was Sie messen sollten

  1. Kosten pro gelöstem Issue, nicht pro Versuch. Der Nenner sind gemergte PRs, nicht Requests.
  2. Retry-Multiplikator pro Modell. Ein Modell bei 1.4x liegt bei einem Drittel seines Listenpreises, bevor Sie irgendetwas anderes mitzählen.
  3. Tokens pro akzeptiertem Diff, einschließlich der Plan- und Selbstreview-Tokens, die der Diff nie zeigt.
  4. Minuten menschlichen Reviews. Ein um 12 % günstigeres Modell, dessen Review 20 % länger dauert, ist teurer.

Fazit

Öffentliche Benchmarks ranken Fähigkeiten bei Aufgaben, die Ihrem Backlog nicht ähneln. Real-SWE ist ein früher Versuch der ehrlichen Version. Bis Sie ihn auf Ihren eigenen Repos laufen lassen, behandeln Sie jeden Modellvergleich als Hypothese über die Kosten pro gelöstem Issue und bepreisen Sie diese Hypothese mit Ihren eigenen Token-Zahlen.

Weiterführend


Möchten Sie das auf Ihren Stack anwenden? Bringen Sie Anbieterrechnungen, Gateway-Protokolle und die wichtigsten Workflows mit; wir ordnen Kostentreiber und Einsparpotenziale zu. Kostenlose Prüfung buchen →

Zurück zu finopsllm.com