Ciche obniżenia modeli a modele kosztów
Zaktualizowano September 27, 2026 · pierwsza publikacja September 27, 2026
23 września 2026 r. wątek na r/GroundTruthAINews zwrócił uwagę na przypis ukryty w notatkach do premiery Opus 5.5 od Anthropic: żądanie do Opus 5.5 może zostać obsłużone przez Opus 4.8. Anthropic i OpenAI ogłosiły obniżki cen tego samego popołudnia. Oba laboratoria sprzedawały tę samą ideę: zachować możliwości i wydać znacznie mniej. Dla FinOps liczy się właśnie ten przypis.
Co się faktycznie wydarzyło
Claude Opus 5.5 wystartował po $4/$20 za milion tokenów, czyli około 20% taniej niż Opus 5, a odczyty z cache stanieły o 60% do $0.20. Anthropic twierdzi, że mniejsza liczba tokenów na zadanie i 30% szybsze generowanie wyników sprawiają, że typowe obciążenia są około 40% tańsze. Mniej więcej 90 minut później OpenAI wypuściło GPT-6 Sol po $2/$10 oraz Lunę po $0.10/$0.50, obie w cenie o połowę niższej niż GPT-5.6.
Każdy wpis o premierze z tego okresu zawiera ten sam rodzaj przypisu: endpoint, który wywołujesz, to alias, a alias jest rozdzielany między wersje modelu w trakcie okna przejściowego. To normalna praktyka zarządzania pojemnością. Jest też problemem dla modelowania kosztów.
Dlaczego to psuje liczby
- Koszt na zadanie się przesuwa. Prognoza zakładała cenę wyjścia Opus 5.5. Jeśli część wywołań trafia do 4.8, zmienia się zarówno cena jednostkowa, jak i liczba tokenów, i to w przeciwnych kierunkach.
- Ewaluacje mierzą mieszankę. Zestaw ewaluacji uruchomiony w oknie przejściowym ocenia zbiór różnych wersji. Wynik nie da się później odtworzyć.
- Obniżki cen są przypisywane błędnie. Jeśli oszczędność 40% wychodzi jako 15%, różnica zwykle wynika z mieszania wersji, a nie z zepsutej optymalizacji.
- Bazowe wartości opóźnień się starzeją. 4.8 nie jest tak szybki jak 5.5. Każdy p50 zmierzony w połowie przejścia nie jest Twoim p50 w stanie ustalonym.
Jak wykryć podmianę
Każdy większy dostawca zwraca rozpoznany model w treści odpowiedzi. Zapisuj go w logach. Jedno pole, cztery linie kodu:
resolved = response.model # e.g. "claude-opus-4-8-20260115"
assert resolved.startswith(EXPECTED_PREFIX) or resolved in ALLOWED_FALLBACKSNastępnie rozbijaj każdą metrykę kosztów według rozpoznanego modelu, a nie według modelu, o który prosiłeś. Gdy jeden koszyk zacznie się przesuwać, masz odpowiedź: alias miesza wersje, a Twój koszt na zadanie jest średnią ważoną dwóch różnych produktów.
Implikacja dla budżetu
W okresie przejściowym planuj na podstawie mieszanego kosztu, a nie nagłówkowej ceny. Jeśli 20% wywołań trafi na starszy model, Twoja efektywna stawka za wejście nie wynosi $4.00 za milion, lecz tyle, ile wyjdzie z mieszanki. Ta sama logika dotyczy ogłoszonej oszczędności: twierdzenie „40% taniej” to średnia dla typowego obciążenia, która już zakłada redukcję liczby tokenów. Ta redukcja może się nie utrzymać, jeśli tańszy, ale starszy model generuje dłuższe odpowiedzi.
Zasady do przestrzegania
- Nigdy nie modeluj na aliasie. Przypnij datowany identyfikator modelu do wszystkiego, co budżetujesz lub oceniasz.
- Zapisuj rozpoznany model przy każdym żądaniu. To konieczność, jeśli kiedykolwiek ponownie uruchomisz ewaluację.
- Ustaw bazę od nowa po oknie przejściowym. Zwykle trwa to tygodnie, nie kwartały, ale sprawdź to.
- Wyceniaj przejście jako mieszankę. Zapytaj dostawcę o oczekiwany podział albo go zmierz.
Podsumowanie
Obniżka ceny i ciche downgrade mogą przyjść tego samego popołudnia. Obniżka to nagłówek; downgrade to przypis, który po cichu unieważnia zeszłomiesięczną prognozę. Zapisuj rozpoznany model, przypinaj datowane identyfikatory i wyceniaj mieszankę.
Powiązane
- Model kosztów Claude Opus 5.5
- Ceny GPT-6: Sol, Luna, Astra
- Obniżki cen modeli a budżety routingu
- Ceny dostawców nie są porównywalne
- Kontrola kosztów ewaluacji
Chcesz zastosować to w swoim stosie? Przynieś faktury dostawców, logi bramy i najważniejsze przepływy pracy; wskażemy czynniki kosztów i ścieżkę oszczędności. Umów bezpłatny audyt →