Wycena modelu o otwartych wagach
Zaktualizowano September 1, 2026 · pierwsza publikacja September 1, 2026
Qwen3.8-Flash-Next pojawił się 26 sierpnia 2026 jako podgląd z otwartymi wagami architektury Qwen4: około 6B aktywnych parametrów, natywny kontekst 262,144 tokenów i brak ogłoszonej ceny hostowanej. Ta kombinacja łamie zwykłe porównanie. Każdy model zamknięty podaje liczbę za milion tokenów; wydanie z otwartymi wagami daje punkt kontrolny i zostawia liczbę tobie.
Ta liczba nie jest trudna do obliczenia. Problem w tym, że większość zespołów jej nie liczy, tylko porównuje pobieranie za $0 z API za $3.00/MTok i wnioskuje, że pobieranie jest tańsze. Być może tak jest. Decyduje arytmetyka, a arytmetyka ma dokładnie jeden składnik, o którym ludzie zapominają.
Wzór
Koszt za milion tokenów to godzinowa cena instancji podzielona przez liczbę tokenów, jaką ta instancja wytwarza w ciągu godziny:
cost per MTok = hourly_price / (tokens_per_second * 3600) * 1,000,000Przy $2.00 za godzinę i zmierzonych 1,500 tokenach na sekundę wychodzi 2.00 / 5,400,000 * 1,000,000 = $0.37 za milion tokenów. W porównaniu z modelem hostowanym za $3.00/MTok wyjścia self-hosting wygląda na ośmiokrotną oszczędność. Ta liczba też jest błędna, bo zakłada, że GPU jest zajęte w każdej sekundzie, za którą płacisz.
Składnik, o którym wszyscy zapominają: wykorzystanie
Wynajmujesz godzinę, a używasz jej ułamka. Podziel przez ten ułamek:
| Wykorzystanie | Efektywny koszt za MTok |
|---|---|
| 100% | $0.37 |
| 60% | $0.62 |
| 30% | $1.23 |
| 10% | $3.70 |
Przy 10% wykorzystania model self-hostowany kosztuje więcej niż hostowane API, które miał zastąpić. Większość pierwszych wdrożeń mieści się między 10% a 30%, bo ruch jest nierówny, a instancja jest dobierana pod szczyt. Oszczędność jest realna, ale dotyczy wykorzystania, a nie wag.
Co jeszcze powinno wejść do tej liczby
Przechowywanie i ruch wychodzący dla punktu kontrolnego. Czas bezczynności między uruchomieniem instancji a rozgrzaniem modelu: przy modelu o dużym kontekście ładowanie trwa minuty, a płacisz za każdą z nich. Redundancja, jeśli obciążenie wymaga więcej niż jednej instancji, by przetrwać awarię węzła. I czas inżynierów, który nie jest rozliczany godzinowo, ale w pierwszym roku to największa pozycja.
Nic z tego nie przemawia przeciwko self-hostingowi. Przemawia przeciwko porównywaniu darmowego pobrania ze stawką za token bez wykonania dzielenia.
Mierz, zanim się zobowiążesz
Uruchom model na instancji, którą faktycznie wynajmiesz, z własnymi kształtami promptów i własnymi długościami kontekstu, i zapisz tokeny na sekundę przy współbieżności, a nie liczbę dla pojedynczego strumienia z karty modelu. Następnie weź swój rzeczywisty profil ruchu godzinowego i policz wykorzystanie. Dwie liczby, jedno dzielenie, a decyzja podejmuje się sama.
Długi kontekst uderza najmocniej. Kontekst 262K tokenów to najpierw zużycie pamięci, dopiero potem funkcja: determinuje klasę instancji, a klasa instancji determinuje godzinową cenę na górze wzoru. Wyceniaj kontekst, który faktycznie wysyłasz, a nie ten, który model obsługuje.
Powiązane
Powiązane
Chcesz zastosować to w swoim stosie? Przynieś faktury dostawców, logi bramy i najważniejsze przepływy pracy; wskażemy czynniki kosztów i ścieżkę oszczędności. Umów bezpłatny audyt →