Przejdź do treści

Wycena modelu o otwartych wagach

Zaktualizowano September 1, 2026 · pierwsza publikacja September 1, 2026

Krótka odpowiedź: Qwen3.8-Flash-Next pojawił się 26 sierpnia 2026 jako podgląd z otwartymi wagami architektury Qwen4: około 6B aktywnych parametrów, natywny kontekst 262,144 tokenów i brak ogłoszonej ceny hostowanej....

Qwen3.8-Flash-Next pojawił się 26 sierpnia 2026 jako podgląd z otwartymi wagami architektury Qwen4: około 6B aktywnych parametrów, natywny kontekst 262,144 tokenów i brak ogłoszonej ceny hostowanej. Ta kombinacja łamie zwykłe porównanie. Każdy model zamknięty podaje liczbę za milion tokenów; wydanie z otwartymi wagami daje punkt kontrolny i zostawia liczbę tobie.

Ta liczba nie jest trudna do obliczenia. Problem w tym, że większość zespołów jej nie liczy, tylko porównuje pobieranie za $0 z API za $3.00/MTok i wnioskuje, że pobieranie jest tańsze. Być może tak jest. Decyduje arytmetyka, a arytmetyka ma dokładnie jeden składnik, o którym ludzie zapominają.

Wzór

Koszt za milion tokenów to godzinowa cena instancji podzielona przez liczbę tokenów, jaką ta instancja wytwarza w ciągu godziny:

cost per MTok = hourly_price / (tokens_per_second * 3600) * 1,000,000

Przy $2.00 za godzinę i zmierzonych 1,500 tokenach na sekundę wychodzi 2.00 / 5,400,000 * 1,000,000 = $0.37 za milion tokenów. W porównaniu z modelem hostowanym za $3.00/MTok wyjścia self-hosting wygląda na ośmiokrotną oszczędność. Ta liczba też jest błędna, bo zakłada, że GPU jest zajęte w każdej sekundzie, za którą płacisz.

Składnik, o którym wszyscy zapominają: wykorzystanie

Wynajmujesz godzinę, a używasz jej ułamka. Podziel przez ten ułamek:

WykorzystanieEfektywny koszt za MTok
100%$0.37
60%$0.62
30%$1.23
10%$3.70

Przy 10% wykorzystania model self-hostowany kosztuje więcej niż hostowane API, które miał zastąpić. Większość pierwszych wdrożeń mieści się między 10% a 30%, bo ruch jest nierówny, a instancja jest dobierana pod szczyt. Oszczędność jest realna, ale dotyczy wykorzystania, a nie wag.

Co jeszcze powinno wejść do tej liczby

Przechowywanie i ruch wychodzący dla punktu kontrolnego. Czas bezczynności między uruchomieniem instancji a rozgrzaniem modelu: przy modelu o dużym kontekście ładowanie trwa minuty, a płacisz za każdą z nich. Redundancja, jeśli obciążenie wymaga więcej niż jednej instancji, by przetrwać awarię węzła. I czas inżynierów, który nie jest rozliczany godzinowo, ale w pierwszym roku to największa pozycja.

Nic z tego nie przemawia przeciwko self-hostingowi. Przemawia przeciwko porównywaniu darmowego pobrania ze stawką za token bez wykonania dzielenia.

Mierz, zanim się zobowiążesz

Uruchom model na instancji, którą faktycznie wynajmiesz, z własnymi kształtami promptów i własnymi długościami kontekstu, i zapisz tokeny na sekundę przy współbieżności, a nie liczbę dla pojedynczego strumienia z karty modelu. Następnie weź swój rzeczywisty profil ruchu godzinowego i policz wykorzystanie. Dwie liczby, jedno dzielenie, a decyzja podejmuje się sama.

Długi kontekst uderza najmocniej. Kontekst 262K tokenów to najpierw zużycie pamięci, dopiero potem funkcja: determinuje klasę instancji, a klasa instancji determinuje godzinową cenę na górze wzoru. Wyceniaj kontekst, który faktycznie wysyłasz, a nie ten, który model obsługuje.

Powiązane

Powiązane


Chcesz zastosować to w swoim stosie? Przynieś faktury dostawców, logi bramy i najważniejsze przepływy pracy; wskażemy czynniki kosztów i ścieżkę oszczędności. Umów bezpłatny audyt →

Wróć do finopsllm.com