Harga dan kecepatan OpenAI Ultrafast API
Diperbarui October 7, 2026 · pertama terbit September 27, 2026
OpenAI Ultrafast mempercepat pembuatan output GPT-6 Astra dengan harga enam kali lipat dari token Standard. Panduan terkini menyebut pembuatan hingga delapan kali lebih cepat; pengumuman DevDay menyebut hingga enam kali. Keduanya tidak menjamin latensi end-to-end. Bandingkan tambahan biaya inferensi dengan waktu penyelesaian yang terukur dan nilai bisnisnya sebelum mengarahkan trafik produksi ke tier ini.
Apa yang diubah Ultrafast?
Ultrafast memperpendek jeda antara token output yang dihasilkan. Ia tidak membuat setiap bagian permintaan menjadi delapan kali lebih cepat: pemrosesan input, pembentukan koneksi jaringan, tool, kode aplikasi, dan menunggu layanan eksternal tetap memengaruhi total latensi. OpenAI merekomendasikan WebSockets, terutama untuk agen yang melakukan beberapa pemanggilan tool dalam waktu singkat, karena overhead koneksi bisa menghapus sebagian keuntungan.
Berapa biaya GPT-6 Astra Ultrafast?
Tabel harga OpenAI mencantumkan hal berikut per satu juta token teks untuk permintaan GPT-6 Astra dengan konteks pendek:
| Tier | Input | Input ter-cache | Penulisan cache | Output |
|---|---|---|---|---|
| Standard | $10 | $1 | $12.50 | $50 |
| Ultrafast | $60 | $6 | $75 | $300 |
Ultrafast adalah 6× tarif Standard yang tercantum untuk setiap kategori token. Periksa halaman harga langsung sebelum menyusun anggaran, karena tarif dan kelayakan bisa berubah. Ultrafast mendukung pemrosesan global dan residensi data di AS; ia tidak mendukung endpoint pemrosesan regional di UE atau wilayah non-AS lainnya. Penyesuaian harga regional dan FedRAMP dapat berlaku jika didukung.
Apa arti premium per tugas?
Berikut contoh permintaan hipotetis tanpa cache dengan 8,000 token input dan 2,000 token output. Pada tarif Standard biayanya $0.18: $0.08 untuk input dan $0.10 untuk output. Pada tarif Ultrafast biayanya $1.08: $0.48 untuk input dan $0.60 untuk output. Premiumnya $0.90 per tugas. Contoh ini memakai harga token yang dipublikasikan dan jumlah token yang diasumsikan; ia tidak memprediksi latensi atau nilai bisnis dari beban kerja nyata.
Untuk beban kerja nyata, kalikan jumlah token bulanan untuk input, input ter-cache, penulisan cache, dan output dengan tarif terkini untuk setiap tier. Pertahankan model, prompt, pengaturan reasoning, dan campuran tugas yang sama saat membandingkan tier.
Kapan Ultrafast sepadan dengan premiumnya?
Uji pada pekerjaan ketika waktu generasi model memengaruhi hasil yang bisa diukur: asisten interaktif dengan target latensi, alur kerja langsung yang menunggu tindakan berikutnya, atau agen yang giliran lebih cepatnya mengurangi waktu idle yang dibayar. Bandingkan waktu penyelesaian end-to-end pada p50 dan p95, tingkat keberhasilan, dan biaya per tugas yang berhasil. Gunakan premium hanya jika waktu yang dihemat dan terukur bernilai lebih daripada biaya tambahannya.
Untuk pengayaan offline, ringkasan terjadwal, dan pekerjaan lain yang bisa menunggu, Standard atau opsi pemrosesan diskon mungkin lebih cocok. Pertahankan rute cadangan untuk permintaan yang melampaui batas laju Ultrafast.
Siapa yang bisa memakai, dan batas apa yang berlaku?
Panduan Ultrafast OpenAI saat ini menyatakan bahwa akses GPT-6 Astra tersedia bagi pelanggan API dengan batas laju default. Batas default token per menit yang terdokumentasi adalah 500,000 untuk Build, 1,000,000 untuk Launch, dan 5,000,000 untuk Grow. Batas yang lebih tinggi mungkin memerlukan permintaan ke tim akun OpenAI.
Sumber mana yang mendokumentasikan klaim harga dan kecepatan?
Sumber utama: panduan mode Ultrafast OpenAI, harga API OpenAI, dan rangkuman DevDay 2026 OpenAI. Lihat juga perutean model dan benchmark biaya LLM per pengguna.
Terkait
- Perutean model
- Benchmark biaya LLM per pengguna
- ChatGPT Pro Max: ekonomi paket $500
- Cara membatasi biaya inferensi
Ingin menerapkannya pada stack Anda? Bawa tagihan penyedia, log gateway, dan alur kerja utama; kami akan memetakan pendorong biaya dan jalur penghematan. Pesan audit gratis →