Rzeczywisty koszt zadania w czołowych modelach
Zaktualizowano September 22, 2026 · pierwsza publikacja September 22, 2026
Ceny z cennika mówią, ile kosztuje token. Nie mówią, ile kosztuje gotowe zadanie, bo modele zużywają bardzo różne liczby tokenów, żeby wykonać tę samą pracę. Ta strona zestawia obok siebie zmierzony koszt zadania i wynik jakości dla Claude Opus 5.5, Claude Opus 5, Claude Fable 5.1, GPT-6 Astra i GPT-6 Sol na każdym poziomie wysiłku. Każda liczba ma źródło, nic nie jest szacowane.
Krótka odpowiedź: GPT-6 Sol to najtańszy sposób, by osiągnąć dowolny wynik do 47.5. Powyżej 47.5 Opus 5.5 jest najtańszy na każdym poziomie. Żadne ustawienie GPT-6 Astra powyżej niskiego, Opus 5 ani Fable 5.1 nie jest opłacalne: każde z nich jest przewyższone zarówno wynikiem, jak i ceną przez jakieś ustawienie Sol lub Opus 5.5.
Metoda
Wszystkie wyniki i koszty pochodzą z Artificial Analysis Intelligence Index v4.3.2, odczytanego 22 września 2026. Indeks uruchamia dziesięć ewaluacji: AA-Briefcase, GDPval-AA, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience i AA-LCR. Artificial Analysis uruchamia każdy model na każdym poziomie wysiłku przez API dostawcy i zapisuje, ile to kosztuje według cen z cennika. Koszt zadania to ten wydatek na zadanie, podzielony na wejście i wyjście. Ten sam zestaw testów działa dla każdego wiersza, więc wiersze można porównywać bezpośrednio.
Zanim przeczytasz liczby, warto znać dwa ograniczenia. Po pierwsze, indeks opiera się na jednym zestawie zadań. Twój zestaw zmieni koszty, dlatego ostatnia sekcja wyjaśnia, jak zmierzyć własne. Po drugie, wyniki z różnych wersji indeksu nie są porównywalne, więc nie mieszaj tych liczb ze starszymi publikowanymi wartościami.
Pełna drabina: 26 ustawień
Tokeny wyjściowe na zadanie to tokeny, które model zapisuje, łącznie z rozumowaniem. Artificial Analysis nie publikuje podziału na wejście i wyjście dla czterech środkowych ustawień GPT-6 Sol, więc te komórki mają n/a.
| Model | Wysiłek | Intelligence Index | Koszt zadania | Koszt wejścia | Koszt wyjścia | Tokeny wyjściowe na zadanie | Na froncie |
|---|---|---|---|---|---|---|---|
| GPT-6 Sol | brak | 28.1 | $0.33 | $0.28 | $0.05 | 4,900 | Nie |
| GPT-6 Sol | niski | 33.9 | $0.13 | n/a | n/a | 3,400 | Tak |
| GPT-6 Sol | średni (domyślny) | 39.8 | $0.25 | n/a | n/a | 6,500 | Tak |
| GPT-6 Sol | wysoki | 42.8 | $0.37 | n/a | n/a | 10,200 | Tak |
| GPT-6 Sol | xhigh | 44.1 | $0.53 | n/a | n/a | 16,000 | Tak |
| GPT-6 Sol | max | 47.5 | $1.06 | $0.74 | $0.31 | 31,200 | Tak |
| GPT-6 Astra | niski | 45.8 | $0.82 | $0.60 | $0.22 | 4,400 | Tak |
| GPT-6 Astra | średni | 49.6 | $1.54 | $1.06 | $0.48 | 9,600 | Nie |
| GPT-6 Astra | wysoki | 50.9 | $1.73 | $1.13 | $0.59 | 11,800 | Nie |
| GPT-6 Astra | xhigh | 52.4 | $2.31 | $1.46 | $0.85 | 16,900 | Nie |
| GPT-6 Astra | max | 52.7 | $3.26 | $1.90 | $1.36 | 27,200 | Nie |
| Claude Opus 5 | niski | 39.4 | $1.10 | $0.73 | $0.37 | 14,700 | Nie |
| Claude Opus 5 | średni | 44.8 | $2.19 | $1.47 | $0.72 | 29,000 | Nie |
| Claude Opus 5 | wysoki (domyślny) | 48.1 | $3.61 | $2.46 | $1.16 | 46,200 | Nie |
| Claude Opus 5 | xhigh | 49.7 | $4.88 | $3.36 | $1.52 | 60,700 | Nie |
| Claude Opus 5 | max | 50.8 | $5.86 | $4.05 | $1.81 | 72,500 | Nie |
| Claude Opus 5.5 | niski | 42.3 | $0.55 | $0.35 | $0.20 | 10,200 | Nie |
| Claude Opus 5.5 | średni (domyślny) | 51.2 | $1.34 | $0.82 | $0.51 | 25,700 | Tak |
| Claude Opus 5.5 | wysoki | 53.6 | $1.82 | $1.11 | $0.71 | 35,600 | Tak |
| Claude Opus 5.5 | xhigh | 56.0 | $3.46 | $2.15 | $1.31 | 65,700 | Tak |
| Claude Opus 5.5 | max | 57.6 | $5.98 | $3.60 | $2.38 | 119,200 | Tak |
| Claude Fable 5.1 | niski | 46.8 | $2.37 | $1.30 | $1.08 | 21,600 | Nie |
| Claude Fable 5.1 | średni | 48.9 | $2.98 | $1.59 | $1.39 | 27,900 | Nie |
| Claude Fable 5.1 | wysoki | 51.2 | $3.91 | $2.01 | $1.90 | 38,100 | Nie |
| Claude Fable 5.1 | xhigh | 53.2 | $5.98 | $2.96 | $3.02 | 60,500 | Nie |
| Claude Fable 5.1 | max | 53.4 | $7.63 | $3.73 | $3.90 | 78,100 | Nie |
Na froncie oznacza, że żadne inne ustawienie w tej tabeli nie daje wyższego wyniku za mniej pieniędzy.
Granica kosztowa
Dziesięć z 26 ustawień leży na granicy. Posortowane według kosztu są jedynymi, które warto rozważać wyłącznie ze względu na cenę. Wszystkie pozostałe płacą więcej za ten sam wynik albo osiągają mniej za tę samą cenę.
| Ustawienie | Intelligence Index | Koszt zadania | Na 10,000 zadań |
|---|---|---|---|
| GPT-6 Sol · niski | 33.9 | $0.13 | $1,300 |
| GPT-6 Sol · średni | 39.8 | $0.25 | $2,500 |
| GPT-6 Sol · wysoki | 42.8 | $0.37 | $3,700 |
| GPT-6 Sol · xhigh | 44.1 | $0.53 | $5,300 |
| GPT-6 Astra · niski | 45.8 | $0.82 | $8,200 |
| GPT-6 Sol · max | 47.5 | $1.06 | $10,600 |
| Claude Opus 5.5 · średni | 51.2 | $1.34 | $13,400 |
| Claude Opus 5.5 · wysoki | 53.6 | $1.82 | $18,200 |
| Claude Opus 5.5 · xhigh | 56.0 | $3.46 | $34,600 |
| Claude Opus 5.5 · max | 57.6 | $5.98 | $59,800 |
Granica ma dwie strefy. Od $0.13 do $1.06 to prawie wyłącznie GPT-6 Sol, z GPT-6 Astra na poziomie niskim jako jednym wyjątkiem za $0.82. Od $1.34 w górę to wyłącznie Opus 5.5. Przejście między strefami jest małe: Opus 5.5 na poziomie średnim zdobywa o 3.7 punktu więcej niż Sol max, za $0.28 więcej za zadanie.
Bezpośrednie porównania przy równym lub lepszym wyniku
Te pary zestawiają tańsze ustawienie z droższym, które daje ten sam lub niższy wynik.
| Tańsze ustawienie | Droższe ustawienie | Różnica wyniku | Zaoszczędzony koszt |
|---|---|---|---|
| Opus 5.5 średni: 51.2, $1.34 | Opus 5 wysoki: 48.1, $3.61 | +3.1 dla Opus 5.5 | 63% |
| Opus 5.5 średni: 51.2, $1.34 | Opus 5 max: 50.8, $5.86 | +0.4 dla Opus 5.5 | 77% |
| Opus 5.5 średni: 51.2, $1.34 | Fable 5.1 wysoki: 51.2, $3.91 | remis | 66% |
| Opus 5.5 wysoki: 53.6, $1.82 | GPT-6 Astra max: 52.7, $3.26 | +0.9 dla Opus 5.5 | 44% |
| Opus 5.5 wysoki: 53.6, $1.82 | Fable 5.1 max: 53.4, $7.63 | +0.2 dla Opus 5.5 | 76% |
| GPT-6 Sol max: 47.5, $1.06 | Opus 5 wysoki: 48.1, $3.61 | +0.6 dla Opus 5 | 71% |
Wiersz z Opus 5 ma znaczenie dla zespołów, które jeszcze nie przeszły na nowszy model. Opus 5 domyślnie działał na wysokim wysiłku. Opus 5.5 działa domyślnie na średnim i przy tym ustawieniu zdobywa o 3.1 punktu więcej, przy 63% niższym koszcie za zadanie. Anthropic twierdzi, że Opus 5.5 jest o 40% tańszy od Opus 5; zmierzona różnica w tym indeksie jest większa niż ta deklaracja.
Gdzie idą pieniądze: wejście, a nie wyjście
We wszystkich modelach wejście stanowi od mniej więcej połowy do trzech czwartych kosztu zadania. Dla Opus 5.5 na poziomie średnim $0.82 z $1.34 to wejście, czyli 61%. Dla GPT-6 Astra na max jest to 58%, dla GPT-6 Sol na max 70%, a dla Fable 5.1 na max 49%. Zadania agentowe za każdym krokiem ponownie wysyłają rosnący kontekst, więc wydatki na wejście rosną wraz z liczbą kroków, a nie tylko z długością odpowiedzi.
Dlatego GPT-6 Sol bez rozumowania kosztuje więcej niż na poziomie niskim: $0.33 wobec $0.13, mimo że zapisuje tylko 4,900 tokenów wyjściowych. $0.28 z $0.33 to wejście. Prawdopodobną przyczyną jest większa liczba kroków, z których każdy ponownie wysyła kontekst. Wyłączenie rozumowania nie czyni agenta tańszym, jeśli potem potrzebuje więcej tur.
Dla rachunku oznacza to, że cache ma tyle samo znaczenia co wybór modelu. Opus 5.5 i GPT-6 Sol pobierają $0.20 za milion tokenów wejściowych z cache. GPT-6 Astra pobiera $1.00, a Opus 5 $0.50.
Liczba tokenów a cena z cennika
GPT-6 Astra jest tutaj najbardziej oszczędny w tokenach. Na max zapisuje 27,200 tokenów wyjściowych na zadanie, wobec 119,200 dla Opus 5.5 na max. Ale Astra kosztuje $10 i $50 za milion, czyli 2.5× stawkę Opus 5.5. Wygrywa cena z cennika: Opus 5.5 na wysokim kosztuje $1.82 za zadanie i zdobywa 53.6, a Astra na max kosztuje $3.26 i zdobywa 52.7.
Opus 5.5 na max to jedno miejsce, gdzie rozwlekłość boli. Jego 119,200 tokenów wyjściowych kosztuje $2.38 jeszcze przed wejściem, a całe zadanie kosztuje $5.98. To kupuje najwyższy wynik w tabeli, 57.6, ale kosztuje 4.5× więcej niż poziom średni.
Malejące zyski według wysiłku
Każdy wiersz pokazuje, co daje jeden krok wyżej w wysiłku, w punktach indeksu względem dodatkowego kosztu za zadanie.
| Model | średni → wysoki | xhigh → max |
|---|---|---|
| GPT-6 Sol | +3.0 punktu za +48% | +3.4 punktu za +100% |
| GPT-6 Astra | +1.3 punktu za +12% | +0.3 punktu za +41% |
| Claude Opus 5 | +3.3 punktu za +65% | +1.1 punktu za +20% |
| Claude Opus 5.5 | +2.4 punktu za +36% | +1.6 punktu za +73% |
| Claude Fable 5.1 | +2.3 punktu za +31% | +0.2 punktu za +28% |
Dla Fable 5.1 i GPT-6 Astra wysiłek max prawie nic nie daje: 0.2 i 0.3 punktu za 28% i 41% więcej. Dla Opus 5.5 krok do max nadal daje 1.6 punktu, ale kosztuje o 73% więcej. Używaj max tylko przy zadaniach, w których zmierzyłeś, że dodatkowe punkty zmieniają wynik.
Kiedy wystarczy GPT-6 Sol max
Indeks jest średnią, a różnica między Sol max a Opus 5.5 na poziomie średnim nie rozkłada się równomiernie. Wyniki poszczególnych ewaluacji z Artificial Analysis:
| Ewaluacja | Opus 5.5 średni ($1.34) | GPT-6 Sol max ($1.06) |
|---|---|---|
| Terminal-Bench 4.0 | 52.5 | 43.9 |
| AutomationBench-AA | 61.2 | 61.6 |
| GDPval-AA (Elo) | 1576 | 1487 |
| AA-Briefcase (Elo) | 1642 | 1483 |
| Humanity's Last Exam | 54.7 | 47.9 |
| SciCode | 59.3 | 57.6 |
| CritPt | 27.7 | 30.9 |
| AA-LCR | 84.3 | 83.7 |
W AutomationBench i CritPt GPT-6 Sol dorównuje Opus 5.5 na poziomie średnim albo go przewyższa, za $1.06 za zadanie wobec $1.34. W Terminal-Bench, ewaluacjach pracy biurowej i Humanity's Last Exam Opus 5.5 prowadzi wyraźnie. Automatyzację przepływów pracy można oprzeć na Sol. Agenci terminalowi i kodujący oraz praca wiedzowa z dużą ilością dokumentów to miejsca, w których Opus 5.5 uzasadnia swoją cenę.
Deklaracje producentów a niezależne liczby
Liczby podawane przez dostawców i liczby niezależne często się różnią, bo używają innych środowisk i ustawień. Anthropic podaje 66.4% w Terminal-Bench 4.0 dla Opus 5.5 na xhigh. Artificial Analysis mierzy 59.6% przy tym samym wysiłku.
| Wysiłek | Opus 5.5 | Fable 5.1 |
|---|---|---|
| niski | 31.3% | 40.4% |
| średni | 52.5% | 44.9% |
| wysoki | 56.6% | 52.0% |
| xhigh | 59.6% | 55.1% |
| max | 59.6% | 52.0% |
Ranking może też zmienić się w zależności od indeksu. W Vals AI Index Fable 5.1 jest pierwszy z wynikiem 68.83%, GPT-6 Astra trzeci z 66.61%, a Opus 5.5 czwarty z 66.16%. Koszt zadania nie jest tam publikowany na tej samej podstawie, więc nie przesuwa granicy powyżej. To przypomnienie, że jeden indeks to jeden punkt widzenia.
Ceny z cennika a zadanie z dużym udziałem cache
Digital Applied wycenił jedno zadanie agentowe z dużym udziałem cache na każdym modelu: 8M tokenów odczytu z cache, 400K wejścia bez cache, 600K zapisów do cache i 300K wyjścia. Wynik idzie za granicą, z jedną dodatkową karą dla GPT-6 Astra.
| Model | Wejście $/MTok | Wyjście $/MTok | Odczyt z cache $/MTok | Zadanie z dużym cache (Digital Applied) |
|---|---|---|---|---|
| GPT-6 Sol | $2.00 | $10.00 | $0.20 | $6.90 |
| Claude Opus 5.5 | $4.00 | $20.00 | $0.20 | $12.20 |
| Claude Opus 5 | $5.00 | $25.00 | $0.50 | $17.25 |
| Claude Fable 5.1 | $10.00 | $50.00 | $0.25 | $28.50 |
| GPT-6 Astra (≤272K) | $10.00 | $50.00 | $1.00 | $34.50 |
| GPT-6 Astra (>272K) | $20.00 | $75.00 | n/a | $61.50 |
GPT-6 Astra rozlicza całe żądanie po $20 i $75 za milion, gdy wejście przekracza 272K tokenów. Opus 5.5 zachowuje jedną cenę w całym oknie 1M tokenów. Zapisy do cache Opus 5.5 kosztują $5 za milion dla cache 5-minutowego i $8 dla cache 1-godzinnego, zadania wsadowe są rozliczane w 50%, a tryb szybki podwaja cenę. Szczegóły znajdziesz w modelu kosztów Claude Opus 5.5 oraz w ekonomii trybu szybkiego Opus 5.5.
Jak zmierzyć własny koszt zadania
- Zapisuj tokeny na zadanie, a nie na żądanie: wejście bez cache, wejście z cache, zapisy do cache i wyjście, zsumowane we wszystkich krokach zadania.
- Weź próbkę kilkuset prawdziwych zadań i odtwórz ją na dwóch lub trzech kandydackich ustawieniach, na przykład Sol max, Opus 5.5 średni i Opus 5.5 wysoki.
- Oceń każdy wynik tą samą kontrolą, której używasz na produkcji, i policz zadania, które przeszły.
- Podziel całkowite wydatki przez liczbę zadań zaliczonych. Koszt zadania zakończonego sukcesem to liczba, którą należy porównywać, bo tanie ustawienie, które częściej zawodzi, nie jest tanie.
- Wybierz najtańsze ustawienie, które spełnia Twój próg jakości, a do wyższego ustawienia kieruj tylko zadania, które się nie powiodły.
- Powtarzaj odtwarzanie, gdy zmieni się cena albo domyślny wysiłek.
Jak poziomy wysiłku zmieniają rachunek dla jednego modelu, zobacz w artykule Poziomy wysiłku Opus 5.5 to rzeczywista cena.
Zastrzeżenia
- Wszystkie koszty są według cen API z cennika na zestawie zadań Artificial Analysis. Rabaty, ceny wsadowe i własny cache je zmieniają.
- Artificial Analysis oznacza wpisy Opus 5.5 i Fable 5.1 jako Default Fallback. Przed traktowaniem każdego wiersza jako tej samej konfiguracji API sprawdź ich uwagi metodologiczne.
- Wyniki pochodzą wyłącznie z indeksu w wersji v4.3.2. Wcześniejsze wersje używały innych ewaluacji i nie są porównywalne.
- Zadanie z dużym cache od Digital Applied to jeden poglądowy scenariusz, a nie pomiar.
- Liczby zmieniają się, gdy dostawcy zmieniają ceny albo ustawienia domyślne. Data odczytu to 22 września 2026.
Źródła
- Artificial Analysis Intelligence Index
- Artificial Analysis: Claude Opus 5.5
- Artificial Analysis: Claude Opus 5
- Artificial Analysis: Claude Fable 5.1
- Artificial Analysis: GPT-6 Astra
- Artificial Analysis: GPT-6 Sol
- Digital Applied: GPT-6 Sol vs Claude Opus 5.5 cost benchmarks
- Digital Applied: Claude Opus 5.5 vs GPT-6 Astra
- Digital Applied: Is Claude Fable 5.1 still worth it?
- Digital Applied: Claude Opus 5.5 launch pricing and benchmarks
- Digital Applied: Opus 5.5 vs Grok 4.7 vs Muse Spark 1.3 cost per task
Powiązane
- Model kosztów Claude Opus 5.5
- Poziomy wysiłku Opus 5.5 to rzeczywista cena
- Ekonomia trybu szybkiego Opus 5.5
Chcesz zastosować to w swoim stosie? Przynieś faktury dostawców, logi bramy i najważniejsze przepływy pracy; wskażemy czynniki kosztów i ścieżkę oszczędności. Umów bezpłatny audyt →