Przejdź do treści

Ciche obniżenia modeli a modele kosztów

Zaktualizowano September 27, 2026 · pierwsza publikacja September 27, 2026

23 września 2026 r. wątek na r/GroundTruthAINews zwrócił uwagę na przypis ukryty w notatkach do premiery Opus 5.5 od Anthropic: żądanie do Opus 5.5 może zostać obsłużone przez Opus 4.8. Anthropic i OpenAI ogłosiły obniżki cen tego samego popołudnia. Oba laboratoria sprzedawały tę samą ideę: zachować możliwości i wydać znacznie mniej. Dla FinOps liczy się właśnie ten przypis.

Co się faktycznie wydarzyło

Claude Opus 5.5 wystartował po $4/$20 za milion tokenów, czyli około 20% taniej niż Opus 5, a odczyty z cache stanieły o 60% do $0.20. Anthropic twierdzi, że mniejsza liczba tokenów na zadanie i 30% szybsze generowanie wyników sprawiają, że typowe obciążenia są około 40% tańsze. Mniej więcej 90 minut później OpenAI wypuściło GPT-6 Sol po $2/$10 oraz Lunę po $0.10/$0.50, obie w cenie o połowę niższej niż GPT-5.6.

Każdy wpis o premierze z tego okresu zawiera ten sam rodzaj przypisu: endpoint, który wywołujesz, to alias, a alias jest rozdzielany między wersje modelu w trakcie okna przejściowego. To normalna praktyka zarządzania pojemnością. Jest też problemem dla modelowania kosztów.

Dlaczego to psuje liczby

Jak wykryć podmianę

Każdy większy dostawca zwraca rozpoznany model w treści odpowiedzi. Zapisuj go w logach. Jedno pole, cztery linie kodu:

resolved = response.model  # e.g. "claude-opus-4-8-20260115"
assert resolved.startswith(EXPECTED_PREFIX) or resolved in ALLOWED_FALLBACKS

Następnie rozbijaj każdą metrykę kosztów według rozpoznanego modelu, a nie według modelu, o który prosiłeś. Gdy jeden koszyk zacznie się przesuwać, masz odpowiedź: alias miesza wersje, a Twój koszt na zadanie jest średnią ważoną dwóch różnych produktów.

Implikacja dla budżetu

W okresie przejściowym planuj na podstawie mieszanego kosztu, a nie nagłówkowej ceny. Jeśli 20% wywołań trafi na starszy model, Twoja efektywna stawka za wejście nie wynosi $4.00 za milion, lecz tyle, ile wyjdzie z mieszanki. Ta sama logika dotyczy ogłoszonej oszczędności: twierdzenie „40% taniej” to średnia dla typowego obciążenia, która już zakłada redukcję liczby tokenów. Ta redukcja może się nie utrzymać, jeśli tańszy, ale starszy model generuje dłuższe odpowiedzi.

Zasady do przestrzegania

  1. Nigdy nie modeluj na aliasie. Przypnij datowany identyfikator modelu do wszystkiego, co budżetujesz lub oceniasz.
  2. Zapisuj rozpoznany model przy każdym żądaniu. To konieczność, jeśli kiedykolwiek ponownie uruchomisz ewaluację.
  3. Ustaw bazę od nowa po oknie przejściowym. Zwykle trwa to tygodnie, nie kwartały, ale sprawdź to.
  4. Wyceniaj przejście jako mieszankę. Zapytaj dostawcę o oczekiwany podział albo go zmierz.

Podsumowanie

Obniżka ceny i ciche downgrade mogą przyjść tego samego popołudnia. Obniżka to nagłówek; downgrade to przypis, który po cichu unieważnia zeszłomiesięczną prognozę. Zapisuj rozpoznany model, przypinaj datowane identyfikatory i wyceniaj mieszankę.

Powiązane


Chcesz zastosować to w swoim stosie? Przynieś faktury dostawców, logi bramy i najważniejsze przepływy pracy; wskażemy czynniki kosztów i ścieżkę oszczędności. Umów bezpłatny audyt →

Wróć do finopsllm.com