Langsung ke konten

Model biaya API Decisions OpenAI: harga input saja dan keluaran bertipe yang cepat

Diperbarui October 7, 2026 · pertama terbit October 7, 2026

Jawaban singkat: Decisions API dari OpenAI adalah endpoint beta yang mengubah bukti teks atau gambar bersama menjadi klasifikasi, pilihan, atau skor bertipe. Dengan GPT-6 Luna, biayanya $0.10 per juta token input dan...

Decisions API dari OpenAI adalah endpoint beta yang mengubah bukti teks atau gambar bersama menjadi klasifikasi, pilihan, atau skor bertipe. Dengan GPT-6 Luna, biayanya $0.10 per juta token input dan tidak ada biaya cache maupun token output. Anggap klaim “10x lebih cepat” sebagai sinyal latensi, lalu uji kualitas dan total biaya tugas pada beban kerja Anda sendiri.

Apa yang dirilis OpenAI pada 6 Oktober 2026?

OpenAI menambahkan Decisions API dalam beta publik pada 6 Oktober 2026. Panduan Decisions menyebutkan bahwa endpoint ini mengembalikan jawaban bertipe sekitar 10 kali lebih cepat dibanding Responses API. Saat peluncuran, GPT-6 Luna adalah satu-satunya model yang didukung dan permintaan menggunakan POST /v1/decisions. Perbandingan kecepatan ini adalah klaim yang dipublikasikan OpenAI, bukan jaminan bahwa setiap aplikasi akan mengalami peningkatan end-to-end yang sama.

Satu permintaan membawa satu input bersama dan satu atau beberapa pertanyaan. Setiap pertanyaan dapat meminta predikat (probabilitas bahwa suatu kondisi benar), pilihan dari sekumpulan opsi yang disediakan, atau skor terhadap tingkatan yang terurut. Endpoint mengembalikan jawaban tersebut dalam bentuk bertipe, disertai probabilitas atau informasi tingkat keyakinan. Karena itu, endpoint ini cocok untuk keputusan yang terbatas, seperti merutekan tiket dukungan, menandai kemungkinan kerusakan pada foto produk, atau menilai tingkat keparahan insiden.

Bagaimana penagihan Decisions API bekerja?

Untuk endpoint Decisions, OpenAI mencantumkan $0.10 per juta token input dengan GPT-6 Luna. Panduan tersebut menyatakan bahwa hanya token input yang ditagih: biaya cache-read, cache-write, dan token output tidak berlaku. Hal ini berbeda dengan permintaan Responses GPT-6 Luna biasa, yang tarif konteks pendeknya adalah $0.10 per juta token input tanpa cache, $0.01 untuk input yang di-cache, $0.125 untuk penulisan cache, dan $0.50 untuk token output. Gunakan ketentuan harga khusus Decisions untuk endpoint ini, bukan daftar harga model secara umum.

Berikut estimasi hipotetis, sebelum penyesuaian regional atau konteks panjang yang mungkin berlaku: jika rata-rata permintaan memakai 1.200 token input, biaya tokennya adalah 1.200 ÷ 1.000.000 × $0.10 = $0.00012. Satu juta permintaan seperti itu akan memakai 1,2 miliar token input dan biayanya sekitar $120. Ini adalah contoh perencanaan, bukan penawaran; ukur penggunaan token yang sebenarnya dan konfirmasi tarif terkini sebelum menetapkan anggaran.

Karena token output bukan kategori yang ditagih di sini, hitung seluruh input dengan cermat: bukti, konteks sistem yang disertakan dalam permintaan, serta instruksi dan pilihan dari setiap pertanyaan. Ajukan pertanyaan independen tentang input yang sama dalam satu permintaan jika masuk akal. OpenAI mendokumentasikan bahwa pertanyaan independen dapat berbagi bukti; pertanyaan yang bergantung pada jawaban sebelumnya sebaiknya dikirim dalam panggilan terpisah. Jaga agar pertanyaan singkat dan dapat diamati, supaya permintaan tidak menghabiskan token untuk rubrik yang ambigu.

Kapan tim sebaiknya memakai Decisions alih-alih Responses?

Gunakan Decisions ketika hasilnya memang terbatas: “Apakah gambar ini menunjukkan kerusakan yang terlihat?”, “Antrean mana dari ketiga ini yang menangani tiket ini?”, atau “Seberapa parah insiden ini menurut tingkatan eksplisit berikut?”. Endpoint ini mengembalikan jawaban yang dapat langsung dirutekan atau dihitung oleh aplikasi, tanpa meminta model serba guna menulis satu paragraf lalu mengurai prosa tersebut.

Tetap gunakan Responses untuk tugas yang membutuhkan penjelasan, skema JSON arbitrer, teks yang dihasilkan, pemanggilan tool, atau keputusan yang memerlukan percakapan dengan model. Panduan OpenAI secara eksplisit mengarahkan pengembang ke Structured Outputs ketika mereka membutuhkan objek JSON kustom, dan ke function calling ketika model perlu meminta pemanggilan tool. Pilihan bertipe bukan pengganti penjelasan yang beralasan maupun tindakan yang dapat dieksekusi.

Perbandingan yang tepat adalah biaya per hasil bisnis yang benar, bukan token atau latensi secara terpisah. Pengklasifikasi cepat yang menghasilkan positif palsu yang mahal dapat menambah beban tinjauan. Endpoint berharga murah pun bisa tetap merugi jika tim menutupinya dengan prompt berulang, tinjauan manual, atau koreksi di hilir. Lacak field penggunaan dan jawaban dari respons Decisions, cocokkan sampel hasil dengan contoh berlabel, dan masukkan tinjauan manusia serta penanganan di hilir ke dalam biaya per kasus yang berhasil dirutekan.

Bagaimana FinOps dapat memvalidasi klaim penghematan?

  1. Pilih satu beban kerja yang terbatas. Pilih langkah klasifikasi atau penilaian bervolume tinggi dengan kumpulan jawaban yang jelas dan biaya kesalahan yang dapat diukur.
  2. Susun set uji berlabel. Ukur akurasi per kategori dan periksa kalibrasi keyakinan atau probabilitas. Tetapkan ambang tinjauan manusia berdasarkan biaya positif palsu dan negatif palsu, sebagaimana direkomendasikan OpenAI.
  3. Jalankan pilot yang sebanding. Bandingkan jalur produksi saat ini dengan Decisions menggunakan input yang setara. Catat latensi endpoint, token, percobaan ulang, tingkat tinjauan, dan biaya kesalahan yang diperbaiki.
  4. Anggarkan seluruh rute. Tambahkan penyimpanan, komputasi aplikasi, waktu peninjau, serta panggilan Responses atau tool berikutnya. Harga token Decisions tidak membuat sisa alur kerjanya menjadi gratis.
  5. Sediakan jalur keluar. Endpoint ini masih beta publik. Kunci endpoint dan model di konfigurasi, pantau changelog, dan uji ulang sebelum rollout luas jika perilaku atau ketersediaannya berubah.

OpenAI mendokumentasikan dukungan Zero Data Retention dan penggunaan HIPAA untuk pelanggan yang memenuhi syarat, serta opsi residensi data di Amerika Serikat dan Eropa (EEA dan Swiss), dengan persyaratan kelayakan dan perjanjian. Pastikan kontrol tersebut sesuai dengan konfigurasi organisasi Anda yang sebenarnya sebelum memasukkan data yang diatur regulasi ke dalam pilot.

Apa yang perlu diingat pembeli tentang harga Decisions API?

Decisions API menawarkan bentuk harga dan latensi baru untuk keputusan bertipe yang ringkas: pada tarif GPT-6 Luna yang dipublikasikan, input dihargai $0.10 per juta token dan token output yang dihasilkan tidak dikenai biaya. Kandidat beban kerja terbaiknya memiliki bukti yang dapat digunakan kembali, tipe jawaban yang jelas, serta cara murah untuk menangkap hasil yang tidak pasti. Ukur kualitas tugas dan total biaya operasional sebelum memindahkan volume produksi.

Riset terkait apa yang sebaiknya dibaca tim?

Terkait


Ingin menerapkannya pada stack Anda? Bawa tagihan penyedia, log gateway, dan alur kerja utama; kami akan memetakan pendorong biaya dan jalur penghematan. Pesan audit gratis →

Kembali ke finopsllm.com