Przejdź do treści

Real-SWE: koszt rozwiązanego zgłoszenia

Zaktualizowano September 27, 2026 · pierwsza publikacja September 27, 2026

Real-SWE pojawił się 12 września 2026 i zdobył 275 punktów oraz 158 komentarzy na Hacker News. Jego założenie to część, w której większość modeli kosztów się myli: zestawy testów publicznych są jawne, zapamiętane i nie odzwierciedlają kodu, którego faktycznie dotykają Twoi agenci. Real-SWE uruchamia modele na prywatnych, rzeczywistych repozytoriach korporacyjnych.

Dlaczego liczba kosztu waży więcej niż wynik

Publiczny benchmark daje wskaźnik zaliczeń. Nie daje kosztu. Koszt za rozwiązane zgłoszenie wymaga trzech rzeczy naraz:

Pomnóż te wartości, a dostaniesz jedyną liczbę, która odpowiada pozycji na fakturze. Model, który zdobywa o 4 punkty mniej od lidera, ale rozwiązuje zgłoszenia w jednej próbie przy jednej trzeciej tokenów, jest tańszy za rozwiązane zgłoszenie, a na prawdziwym backlogu ta różnica narasta szybciej, niż sugeruje luka w wyniku.

Dlaczego publiczne benchmarki zawyżają jakość

Korporacyjne bazy kodu mają cechy, które łamią założenia publicznych benchmarków: długie wewnętrzne konwencje, nieudokumentowane niezmienniki, testy kodujące historyczne przypadki i systemy budowania, których nikt w pełni nie rozumie. Model, który dopasowuje wzorce do publicznego repozytorium, nie poradzi sobie z monorepo na 400 plików z trzema latami nagromadzonych decyzji. Dlatego głośnym wynikiem tego miesiąca był 27-miliardowy model open-weights do pisania kreatywnego, działający na poziomie Fable 5 przy raportowanej cenie niższej 40 razy — modele open weights zaczynają od priorytetu lokalnego repozytorium, którego modelom API brakuje.

Przeliczenie

Weź prawdziwe repozytorium backendu, w którym mieści się 40 zgłoszeń. Załóżmy, że tańszy model rozwiązuje 22 w jednej próbie przy 60K wejścia / 8K wyjścia, a model premium rozwiązuje 26 z mnożnikiem ponowień 1.4x przy 90K wejścia / 14K wyjścia. Według stawek Opus 5.5 ($4/$20, odczyty z cache $0.20):

ModelRozwiązaneKoszt za zgłoszenieRazem
Tańszy poziom22$0.32$7.04
Poziom premium26$0.61$15.86

Premium kosztuje 2.3x więcej w sumie za 18% więcej rozwiązanych zgłoszeń. Przy backlogu 40 zgłoszeń to $9 więcej. Ta sama wymiana przy 4,000 zgłoszeń miesięcznie daje $880 — i nadal kupuje tylko 18% większą przepustowość. Tańszy poziom nie jest oczywiście błędny; wymieniasz wskaźnik rozwiązań na wolumen, a właściwa odpowiedź zależy od tego, czy pominięte zgłoszenie kosztuje więcej niż dolara.

Co mierzyć

  1. Koszt za rozwiązane zgłoszenie, a nie za próbę. Mianownikiem są scalone PR-y, a nie żądania.
  2. Mnożnik ponowień dla każdego modelu. Model z mnożnikiem 1.4x kosztuje w praktyce jedną trzecią więcej, zanim policzysz cokolwiek innego.
  3. Tokeny na zaakceptowany diff, włącznie z tokenami planowania i samooceny, których diff nigdy nie pokazuje.
  4. Minuty przeglądu przez człowieka. Model o 12% tańszy, którego przegląd trwa o 20% dłużej, jest droższy.

Wnioski

Publiczne benchmarki klasyfikują zdolności na zadaniach, które nie przypominają Twojego backlogu. Real-SWE to wczesna próba uczciwej wersji tego. Dopóki nie uruchomisz go na własnych repozytoriach, traktuj każde porównanie modeli jako hipotezę kosztu za rozwiązane zgłoszenie i wyceń tę hipotezę na podstawie własnej liczby tokenów.

Powiązane


Chcesz zastosować to w swoim stosie? Przynieś faktury dostawców, logi bramy i najważniejsze przepływy pracy; wskażemy czynniki kosztów i ścieżkę oszczędności. Umów bezpłatny audyt →

Wróć do finopsllm.com