Przejdź do treści

Rzeczywisty koszt zadania w czołowych modelach

Zaktualizowano September 22, 2026 · pierwsza publikacja September 22, 2026

Ceny z cennika mówią, ile kosztuje token. Nie mówią, ile kosztuje gotowe zadanie, bo modele zużywają bardzo różne liczby tokenów, żeby wykonać tę samą pracę. Ta strona zestawia obok siebie zmierzony koszt zadania i wynik jakości dla Claude Opus 5.5, Claude Opus 5, Claude Fable 5.1, GPT-6 Astra i GPT-6 Sol na każdym poziomie wysiłku. Każda liczba ma źródło, nic nie jest szacowane.

Krótka odpowiedź: GPT-6 Sol to najtańszy sposób, by osiągnąć dowolny wynik do 47.5. Powyżej 47.5 Opus 5.5 jest najtańszy na każdym poziomie. Żadne ustawienie GPT-6 Astra powyżej niskiego, Opus 5 ani Fable 5.1 nie jest opłacalne: każde z nich jest przewyższone zarówno wynikiem, jak i ceną przez jakieś ustawienie Sol lub Opus 5.5.

Metoda

Wszystkie wyniki i koszty pochodzą z Artificial Analysis Intelligence Index v4.3.2, odczytanego 22 września 2026. Indeks uruchamia dziesięć ewaluacji: AA-Briefcase, GDPval-AA, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience i AA-LCR. Artificial Analysis uruchamia każdy model na każdym poziomie wysiłku przez API dostawcy i zapisuje, ile to kosztuje według cen z cennika. Koszt zadania to ten wydatek na zadanie, podzielony na wejście i wyjście. Ten sam zestaw testów działa dla każdego wiersza, więc wiersze można porównywać bezpośrednio.

Zanim przeczytasz liczby, warto znać dwa ograniczenia. Po pierwsze, indeks opiera się na jednym zestawie zadań. Twój zestaw zmieni koszty, dlatego ostatnia sekcja wyjaśnia, jak zmierzyć własne. Po drugie, wyniki z różnych wersji indeksu nie są porównywalne, więc nie mieszaj tych liczb ze starszymi publikowanymi wartościami.

Pełna drabina: 26 ustawień

Tokeny wyjściowe na zadanie to tokeny, które model zapisuje, łącznie z rozumowaniem. Artificial Analysis nie publikuje podziału na wejście i wyjście dla czterech środkowych ustawień GPT-6 Sol, więc te komórki mają n/a.

ModelWysiłekIntelligence IndexKoszt zadaniaKoszt wejściaKoszt wyjściaTokeny wyjściowe na zadanieNa froncie
GPT-6 Solbrak28.1$0.33$0.28$0.054,900Nie
GPT-6 Solniski33.9$0.13n/an/a3,400Tak
GPT-6 Solśredni (domyślny)39.8$0.25n/an/a6,500Tak
GPT-6 Solwysoki42.8$0.37n/an/a10,200Tak
GPT-6 Solxhigh44.1$0.53n/an/a16,000Tak
GPT-6 Solmax47.5$1.06$0.74$0.3131,200Tak
GPT-6 Astraniski45.8$0.82$0.60$0.224,400Tak
GPT-6 Astraśredni49.6$1.54$1.06$0.489,600Nie
GPT-6 Astrawysoki50.9$1.73$1.13$0.5911,800Nie
GPT-6 Astraxhigh52.4$2.31$1.46$0.8516,900Nie
GPT-6 Astramax52.7$3.26$1.90$1.3627,200Nie
Claude Opus 5niski39.4$1.10$0.73$0.3714,700Nie
Claude Opus 5średni44.8$2.19$1.47$0.7229,000Nie
Claude Opus 5wysoki (domyślny)48.1$3.61$2.46$1.1646,200Nie
Claude Opus 5xhigh49.7$4.88$3.36$1.5260,700Nie
Claude Opus 5max50.8$5.86$4.05$1.8172,500Nie
Claude Opus 5.5niski42.3$0.55$0.35$0.2010,200Nie
Claude Opus 5.5średni (domyślny)51.2$1.34$0.82$0.5125,700Tak
Claude Opus 5.5wysoki53.6$1.82$1.11$0.7135,600Tak
Claude Opus 5.5xhigh56.0$3.46$2.15$1.3165,700Tak
Claude Opus 5.5max57.6$5.98$3.60$2.38119,200Tak
Claude Fable 5.1niski46.8$2.37$1.30$1.0821,600Nie
Claude Fable 5.1średni48.9$2.98$1.59$1.3927,900Nie
Claude Fable 5.1wysoki51.2$3.91$2.01$1.9038,100Nie
Claude Fable 5.1xhigh53.2$5.98$2.96$3.0260,500Nie
Claude Fable 5.1max53.4$7.63$3.73$3.9078,100Nie

Na froncie oznacza, że żadne inne ustawienie w tej tabeli nie daje wyższego wyniku za mniej pieniędzy.

Granica kosztowa

Dziesięć z 26 ustawień leży na granicy. Posortowane według kosztu są jedynymi, które warto rozważać wyłącznie ze względu na cenę. Wszystkie pozostałe płacą więcej za ten sam wynik albo osiągają mniej za tę samą cenę.

UstawienieIntelligence IndexKoszt zadaniaNa 10,000 zadań
GPT-6 Sol · niski33.9$0.13$1,300
GPT-6 Sol · średni39.8$0.25$2,500
GPT-6 Sol · wysoki42.8$0.37$3,700
GPT-6 Sol · xhigh44.1$0.53$5,300
GPT-6 Astra · niski45.8$0.82$8,200
GPT-6 Sol · max47.5$1.06$10,600
Claude Opus 5.5 · średni51.2$1.34$13,400
Claude Opus 5.5 · wysoki53.6$1.82$18,200
Claude Opus 5.5 · xhigh56.0$3.46$34,600
Claude Opus 5.5 · max57.6$5.98$59,800

Granica ma dwie strefy. Od $0.13 do $1.06 to prawie wyłącznie GPT-6 Sol, z GPT-6 Astra na poziomie niskim jako jednym wyjątkiem za $0.82. Od $1.34 w górę to wyłącznie Opus 5.5. Przejście między strefami jest małe: Opus 5.5 na poziomie średnim zdobywa o 3.7 punktu więcej niż Sol max, za $0.28 więcej za zadanie.

Bezpośrednie porównania przy równym lub lepszym wyniku

Te pary zestawiają tańsze ustawienie z droższym, które daje ten sam lub niższy wynik.

Tańsze ustawienieDroższe ustawienieRóżnica wynikuZaoszczędzony koszt
Opus 5.5 średni: 51.2, $1.34Opus 5 wysoki: 48.1, $3.61+3.1 dla Opus 5.563%
Opus 5.5 średni: 51.2, $1.34Opus 5 max: 50.8, $5.86+0.4 dla Opus 5.577%
Opus 5.5 średni: 51.2, $1.34Fable 5.1 wysoki: 51.2, $3.91remis66%
Opus 5.5 wysoki: 53.6, $1.82GPT-6 Astra max: 52.7, $3.26+0.9 dla Opus 5.544%
Opus 5.5 wysoki: 53.6, $1.82Fable 5.1 max: 53.4, $7.63+0.2 dla Opus 5.576%
GPT-6 Sol max: 47.5, $1.06Opus 5 wysoki: 48.1, $3.61+0.6 dla Opus 571%

Wiersz z Opus 5 ma znaczenie dla zespołów, które jeszcze nie przeszły na nowszy model. Opus 5 domyślnie działał na wysokim wysiłku. Opus 5.5 działa domyślnie na średnim i przy tym ustawieniu zdobywa o 3.1 punktu więcej, przy 63% niższym koszcie za zadanie. Anthropic twierdzi, że Opus 5.5 jest o 40% tańszy od Opus 5; zmierzona różnica w tym indeksie jest większa niż ta deklaracja.

Gdzie idą pieniądze: wejście, a nie wyjście

We wszystkich modelach wejście stanowi od mniej więcej połowy do trzech czwartych kosztu zadania. Dla Opus 5.5 na poziomie średnim $0.82 z $1.34 to wejście, czyli 61%. Dla GPT-6 Astra na max jest to 58%, dla GPT-6 Sol na max 70%, a dla Fable 5.1 na max 49%. Zadania agentowe za każdym krokiem ponownie wysyłają rosnący kontekst, więc wydatki na wejście rosną wraz z liczbą kroków, a nie tylko z długością odpowiedzi.

Dlatego GPT-6 Sol bez rozumowania kosztuje więcej niż na poziomie niskim: $0.33 wobec $0.13, mimo że zapisuje tylko 4,900 tokenów wyjściowych. $0.28 z $0.33 to wejście. Prawdopodobną przyczyną jest większa liczba kroków, z których każdy ponownie wysyła kontekst. Wyłączenie rozumowania nie czyni agenta tańszym, jeśli potem potrzebuje więcej tur.

Dla rachunku oznacza to, że cache ma tyle samo znaczenia co wybór modelu. Opus 5.5 i GPT-6 Sol pobierają $0.20 za milion tokenów wejściowych z cache. GPT-6 Astra pobiera $1.00, a Opus 5 $0.50.

Liczba tokenów a cena z cennika

GPT-6 Astra jest tutaj najbardziej oszczędny w tokenach. Na max zapisuje 27,200 tokenów wyjściowych na zadanie, wobec 119,200 dla Opus 5.5 na max. Ale Astra kosztuje $10 i $50 za milion, czyli 2.5× stawkę Opus 5.5. Wygrywa cena z cennika: Opus 5.5 na wysokim kosztuje $1.82 za zadanie i zdobywa 53.6, a Astra na max kosztuje $3.26 i zdobywa 52.7.

Opus 5.5 na max to jedno miejsce, gdzie rozwlekłość boli. Jego 119,200 tokenów wyjściowych kosztuje $2.38 jeszcze przed wejściem, a całe zadanie kosztuje $5.98. To kupuje najwyższy wynik w tabeli, 57.6, ale kosztuje 4.5× więcej niż poziom średni.

Malejące zyski według wysiłku

Każdy wiersz pokazuje, co daje jeden krok wyżej w wysiłku, w punktach indeksu względem dodatkowego kosztu za zadanie.

Modelśredni → wysokixhigh → max
GPT-6 Sol+3.0 punktu za +48%+3.4 punktu za +100%
GPT-6 Astra+1.3 punktu za +12%+0.3 punktu za +41%
Claude Opus 5+3.3 punktu za +65%+1.1 punktu za +20%
Claude Opus 5.5+2.4 punktu za +36%+1.6 punktu za +73%
Claude Fable 5.1+2.3 punktu za +31%+0.2 punktu za +28%

Dla Fable 5.1 i GPT-6 Astra wysiłek max prawie nic nie daje: 0.2 i 0.3 punktu za 28% i 41% więcej. Dla Opus 5.5 krok do max nadal daje 1.6 punktu, ale kosztuje o 73% więcej. Używaj max tylko przy zadaniach, w których zmierzyłeś, że dodatkowe punkty zmieniają wynik.

Kiedy wystarczy GPT-6 Sol max

Indeks jest średnią, a różnica między Sol max a Opus 5.5 na poziomie średnim nie rozkłada się równomiernie. Wyniki poszczególnych ewaluacji z Artificial Analysis:

EwaluacjaOpus 5.5 średni ($1.34)GPT-6 Sol max ($1.06)
Terminal-Bench 4.052.543.9
AutomationBench-AA61.261.6
GDPval-AA (Elo)15761487
AA-Briefcase (Elo)16421483
Humanity's Last Exam54.747.9
SciCode59.357.6
CritPt27.730.9
AA-LCR84.383.7

W AutomationBench i CritPt GPT-6 Sol dorównuje Opus 5.5 na poziomie średnim albo go przewyższa, za $1.06 za zadanie wobec $1.34. W Terminal-Bench, ewaluacjach pracy biurowej i Humanity's Last Exam Opus 5.5 prowadzi wyraźnie. Automatyzację przepływów pracy można oprzeć na Sol. Agenci terminalowi i kodujący oraz praca wiedzowa z dużą ilością dokumentów to miejsca, w których Opus 5.5 uzasadnia swoją cenę.

Deklaracje producentów a niezależne liczby

Liczby podawane przez dostawców i liczby niezależne często się różnią, bo używają innych środowisk i ustawień. Anthropic podaje 66.4% w Terminal-Bench 4.0 dla Opus 5.5 na xhigh. Artificial Analysis mierzy 59.6% przy tym samym wysiłku.

WysiłekOpus 5.5Fable 5.1
niski31.3%40.4%
średni52.5%44.9%
wysoki56.6%52.0%
xhigh59.6%55.1%
max59.6%52.0%

Ranking może też zmienić się w zależności od indeksu. W Vals AI Index Fable 5.1 jest pierwszy z wynikiem 68.83%, GPT-6 Astra trzeci z 66.61%, a Opus 5.5 czwarty z 66.16%. Koszt zadania nie jest tam publikowany na tej samej podstawie, więc nie przesuwa granicy powyżej. To przypomnienie, że jeden indeks to jeden punkt widzenia.

Ceny z cennika a zadanie z dużym udziałem cache

Digital Applied wycenił jedno zadanie agentowe z dużym udziałem cache na każdym modelu: 8M tokenów odczytu z cache, 400K wejścia bez cache, 600K zapisów do cache i 300K wyjścia. Wynik idzie za granicą, z jedną dodatkową karą dla GPT-6 Astra.

ModelWejście $/MTokWyjście $/MTokOdczyt z cache $/MTokZadanie z dużym cache (Digital Applied)
GPT-6 Sol$2.00$10.00$0.20$6.90
Claude Opus 5.5$4.00$20.00$0.20$12.20
Claude Opus 5$5.00$25.00$0.50$17.25
Claude Fable 5.1$10.00$50.00$0.25$28.50
GPT-6 Astra (≤272K)$10.00$50.00$1.00$34.50
GPT-6 Astra (>272K)$20.00$75.00n/a$61.50

GPT-6 Astra rozlicza całe żądanie po $20 i $75 za milion, gdy wejście przekracza 272K tokenów. Opus 5.5 zachowuje jedną cenę w całym oknie 1M tokenów. Zapisy do cache Opus 5.5 kosztują $5 za milion dla cache 5-minutowego i $8 dla cache 1-godzinnego, zadania wsadowe są rozliczane w 50%, a tryb szybki podwaja cenę. Szczegóły znajdziesz w modelu kosztów Claude Opus 5.5 oraz w ekonomii trybu szybkiego Opus 5.5.

Jak zmierzyć własny koszt zadania

  1. Zapisuj tokeny na zadanie, a nie na żądanie: wejście bez cache, wejście z cache, zapisy do cache i wyjście, zsumowane we wszystkich krokach zadania.
  2. Weź próbkę kilkuset prawdziwych zadań i odtwórz ją na dwóch lub trzech kandydackich ustawieniach, na przykład Sol max, Opus 5.5 średni i Opus 5.5 wysoki.
  3. Oceń każdy wynik tą samą kontrolą, której używasz na produkcji, i policz zadania, które przeszły.
  4. Podziel całkowite wydatki przez liczbę zadań zaliczonych. Koszt zadania zakończonego sukcesem to liczba, którą należy porównywać, bo tanie ustawienie, które częściej zawodzi, nie jest tanie.
  5. Wybierz najtańsze ustawienie, które spełnia Twój próg jakości, a do wyższego ustawienia kieruj tylko zadania, które się nie powiodły.
  6. Powtarzaj odtwarzanie, gdy zmieni się cena albo domyślny wysiłek.

Jak poziomy wysiłku zmieniają rachunek dla jednego modelu, zobacz w artykule Poziomy wysiłku Opus 5.5 to rzeczywista cena.

Zastrzeżenia

Źródła

Powiązane


Chcesz zastosować to w swoim stosie? Przynieś faktury dostawców, logi bramy i najważniejsze przepływy pracy; wskażemy czynniki kosztów i ścieżkę oszczędności. Umów bezpłatny audyt →

Wróć do finopsllm.com