Langsung ke konten

Downgrade model diam-diam dan model biaya

Diperbarui September 27, 2026 · pertama terbit September 27, 2026

Pada 23 September 2026, sebuah thread di r/GroundTruthAINews menunjuk catatan kaki yang terselip di catatan rilis Opus 5.5 dari Anthropic: permintaan Opus 5.5 bisa dilayani oleh Opus 4.8. Anthropic dan OpenAI sama-sama merilis pemotongan harga di sore hari yang sama. Kedua lab menjual gagasan yang sama: pertahankan kemampuan, belanjakan jauh lebih sedikit. Catatan kaki itulah yang penting bagi FinOps.

Apa yang sebenarnya terjadi

Claude Opus 5.5 diluncurkan dengan harga $4/$20 per juta token, sekitar 20% di bawah Opus 5, dengan pembacaan cache dipotong 60% menjadi $0.20. Anthropic menyatakan bahwa token yang lebih sedikit per tugas dan keluaran 30% lebih cepat membuat beban kerja tipikal sekitar 40% lebih murah. Sekitar 90 menit kemudian, OpenAI merilis GPT-6 Sol di $2/$10 dan Luna di $0.10/$0.50, keduanya setengah dari harga GPT-5.6.

Setiap pengumuman rilis dari periode ini memuat jenis catatan kaki yang sama: endpoint yang Anda panggil adalah sebuah alias, dan alias itu diseimbangkan bebannya ke beberapa versi model selama jendela transisi. Itu praktik kapasitas yang normal. Namun itu juga masalah untuk pemodelan biaya.

Mengapa ini merusak angka

Cara mendeteksi pergantian

Setiap penyedia besar mengembalikan model yang sudah di-resolve di badan respons. Catat. Satu field, empat baris kode:

resolved = response.model  # e.g. "claude-opus-4-8-20260115"
assert resolved.startswith(EXPECTED_PREFIX) or resolved in ALLOWED_FALLBACKS

Lalu pecah setiap metrik biaya berdasarkan model yang di-resolve, bukan model yang Anda minta. Begitu satu kelompok mulai bergeser, Anda sudah punya jawabannya: alias mencampur versi dan biaya per tugas Anda adalah rata-rata berbobot dari dua produk yang berbeda.

Implikasi untuk anggaran

Selama transisi, rencanakan berdasarkan biaya gabungan, bukan angka utama. Jika 20% panggilan turun ke model yang lebih lama, tarif input efektif Anda bukan $4.00 per juta — melainkan angka yang dihasilkan oleh campuran tersebut. Logika yang sama berlaku untuk klaim penghematan: "40% lebih murah" adalah rata-rata beban kerja tipikal yang sudah mengasumsikan pengurangan jumlah token, dan asumsi itu bisa tidak berlaku jika model yang lebih murah tapi lebih lama justru yang menghasilkan jawaban lebih panjang.

Aturan yang perlu dipegang

  1. Jangan pernah memodelkan berdasarkan alias. Kunci ID model bertanggal untuk apa pun yang Anda anggarkan atau evaluasi.
  2. Catat model yang di-resolve pada setiap permintaan. Wajib jika Anda pernah menjalankan ulang evaluasi.
  3. Susun ulang baseline setelah jendela transisi. Durasinya biasanya minggu, bukan kuartal, tetapi pastikan.
  4. Hitung transisi sebagai campuran. Minta penyedia Anda rasio yang diharapkan, atau ukur sendiri.

Kesimpulan

Pemotongan harga dan downgrade diam-diam bisa datang di sore hari yang sama. Pemotongan adalah judulnya; downgrade adalah catatan kaki yang diam-diam membatalkan prakiraan bulan lalu. Catat model yang di-resolve, kunci ID bertanggal, dan hitung campurannya.

Terkait


Ingin menerapkannya pada stack Anda? Bawa tagihan penyedia, log gateway, dan alur kerja utama; kami akan memetakan pendorong biaya dan jalur penghematan. Pesan audit gratis →

Kembali ke finopsllm.com