Langsung ke konten

Model biaya agen selalu aktif OpenAI O / AON

Diperbarui September 27, 2026 · pertama terbit September 27, 2026

Referensi yang bocor mengungkap “O” dari OpenAI (nama sandi AON), yaitu asisten selalu aktif yang dirancang untuk tugas berhorizon panjang. Berbeda dengan model chat yang menjawab lalu berhenti, O mendapatkan lingkungan cloud sendiri, dapat menyiapkan konteks eksekusi, menulis kode, meneliti, dan beroperasi terus-menerus selama berjam-jam, berhari-hari, atau berpotensi berminggu-minggu. Ini bisa melibatkan beberapa agen yang saling berkomunikasi dalam satu tugas. Pengumuman yang diharapkan: OpenAI Dev Day, 29 September 2026.

Apa yang berubah untuk pemodelan biaya

Biaya LLM tradisional: token per permintaan × tarif. Biaya O/AON: waktu × komputasi yang dialokasikan + throughput token.

DimensiAPI Chat/CompletionO / AON (proyeksi)
Satuan penagihanPer 1M tokenPer jam (komputasi) + per 1M token
Biaya saat diam$0>$0 (pemesanan lingkungan)
Durasi maksimumMenit (timeout)Hari/minggu
ParalelismePermintaan berurutanKawanan multi-agen
StatusDikirim dalam konteksLingkungan persisten

Model biaya proyeksi (spekulatif, berdasarkan pola kebocoran)

OpenAI belum menerbitkan harga. Ada dua struktur yang mungkin:

Opsi A: jam komputasi + token (seperti Codespaces)

Satu eksekusi agen 24 jam dengan 5M token input / 2M token output:

KomponenBiaya (rendah)Biaya (tinggi)
Lingkungan 24 jam ($1/jam)$24$48
5M input @ $5/MTok$25$25
2M output @ $15/MTok$30$30
Total$79$103

Opsi B: langganan tetap (paket Pro Max)

Strategi optimasi biaya untuk agen selalu aktif

  1. Hibernasi, jangan hentikan. Jika lingkungan tetap ada, jeda loop agen selama periode diam alih-alih mematikannya. Biaya cold start lebih mahal daripada biaya pemesanan saat diam.
  2. Kelompokkan token subtugas. Kumpulkan hasil subtugas dan tulis konteks dalam potongan yang lebih besar untuk meningkatkan rasio cache hit pada lingkungan persisten.
  3. Arahkan subtugas ke model yang lebih murah. O/AON mengatur orkestrasi; delegasikan coding ke Sonnet 5.5, riset ke model Flash, dan naik ke model premium hanya untuk keputusan kritis.
  4. Tetapkan anggaran waktu dan uang yang ketat per tujuan. “Selesaikan bug ini, maks $10 / 2 jam” dan terapkan melalui orkestrator, bukan berharap saja.

Kapan memakai O/AON dan kapan Opus 5.5 berjalan lama

Bacaan terkait

Lihat ekonomi ChatGPT Pro Max, harga API Ultra Fast OpenAI, biaya agen 25 jam Opus 5.5, dan ekonomi agen.

Terkait


Ingin menerapkannya pada stack Anda? Bawa tagihan penyedia, log gateway, dan alur kerja utama; kami akan memetakan pendorong biaya dan jalur penghematan. Pesan audit gratis →

Kembali ke finopsllm.com