Langsung ke konten

Biaya nyata per tugas di seluruh model frontier

Diperbarui September 22, 2026 · pertama terbit September 22, 2026

Harga daftar memberi tahu Anda berapa biaya sebuah token. Harga daftar tidak memberi tahu berapa biaya sebuah tugas yang selesai, karena model menghabiskan jumlah token yang sangat berbeda untuk menyelesaikan pekerjaan yang sama. Halaman ini menempatkan biaya per tugas yang terukur dan skor kualitas secara berdampingan untuk Claude Opus 5.5, Claude Opus 5, Claude Fable 5.1, GPT-6 Astra, dan GPT-6 Sol di setiap level effort. Setiap angka punya sumber, dan tidak ada yang diperkirakan.

Jawaban singkatnya: GPT-6 Sol adalah cara termurah untuk mencapai skor apa pun hingga 47,5. Di atas 47,5, Opus 5.5 adalah yang termurah di setiap level. Tidak ada pengaturan GPT-6 Astra di atas low, Opus 5, atau Fable 5.1 yang efisien biaya: masing-masing dikalahkan baik dari sisi skor maupun harga oleh pengaturan Sol atau Opus 5.5 tertentu.

Metode

Semua skor dan biaya berasal dari Artificial Analysis Intelligence Index v4.3.2, dibaca pada 22 September 2026. Indeks ini menjalankan sepuluh evaluasi: AA-Briefcase, GDPval-AA, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, dan AA-LCR. Artificial Analysis menjalankan tiap model pada tiap pengaturan effort melalui API penyedia dan mencatat apa yang dibayar pada harga daftar. Biaya per tugas adalah pengeluaran per tugas itu, dipecah menjadi input dan output. Rangkaian uji yang sama dijalankan untuk setiap baris, sehingga barisnya bisa langsung dibandingkan.

Ada dua batasan sebelum Anda membaca angkanya. Pertama, indeks ini hanya satu campuran tugas. Campuran Anda akan menggeser biaya, itulah sebabnya bagian terakhir menjelaskan cara mengukur milik Anda sendiri. Kedua, skor dari versi indeks yang berbeda tidak bisa dibandingkan, jadi jangan campur angka ini dengan angka terbitan lama.

Tangga lengkap: 26 pengaturan

Token output per tugas adalah token yang ditulis model, termasuk penalaran. Artificial Analysis tidak mempublikasikan pembagian input dan output untuk empat pengaturan GPT-6 Sol di tengah, jadi sel-sel itu bertuliskan n/a.

ModelEffortIntelligence IndexBiaya per tugasBiaya inputBiaya outputToken output per tugasDi frontier
GPT-6 Solnone28.1$0.33$0.28$0.054,900Tidak
GPT-6 Sollow33.9$0.13n/an/a3,400Ya
GPT-6 Solmedium (bawaan)39.8$0.25n/an/a6,500Ya
GPT-6 Solhigh42.8$0.37n/an/a10,200Ya
GPT-6 Solxhigh44.1$0.53n/an/a16,000Ya
GPT-6 Solmax47.5$1.06$0.74$0.3131,200Ya
GPT-6 Astralow45.8$0.82$0.60$0.224,400Ya
GPT-6 Astramedium49.6$1.54$1.06$0.489,600Tidak
GPT-6 Astrahigh50.9$1.73$1.13$0.5911,800Tidak
GPT-6 Astraxhigh52.4$2.31$1.46$0.8516,900Tidak
GPT-6 Astramax52.7$3.26$1.90$1.3627,200Tidak
Claude Opus 5low39.4$1.10$0.73$0.3714,700Tidak
Claude Opus 5medium44.8$2.19$1.47$0.7229,000Tidak
Claude Opus 5high (bawaan)48.1$3.61$2.46$1.1646,200Tidak
Claude Opus 5xhigh49.7$4.88$3.36$1.5260,700Tidak
Claude Opus 5max50.8$5.86$4.05$1.8172,500Tidak
Claude Opus 5.5low42.3$0.55$0.35$0.2010,200Tidak
Claude Opus 5.5medium (bawaan)51.2$1.34$0.82$0.5125,700Ya
Claude Opus 5.5high53.6$1.82$1.11$0.7135,600Ya
Claude Opus 5.5xhigh56.0$3.46$2.15$1.3165,700Ya
Claude Opus 5.5max57.6$5.98$3.60$2.38119,200Ya
Claude Fable 5.1low46.8$2.37$1.30$1.0821,600Tidak
Claude Fable 5.1medium48.9$2.98$1.59$1.3927,900Tidak
Claude Fable 5.1high51.2$3.91$2.01$1.9038,100Tidak
Claude Fable 5.1xhigh53.2$5.98$2.96$3.0260,500Tidak
Claude Fable 5.1max53.4$7.63$3.73$3.9078,100Tidak

Di frontier berarti tidak ada pengaturan lain di tabel ini yang skornya lebih tinggi dengan biaya lebih rendah.

Frontier biaya

Sepuluh dari 26 pengaturan berada di frontier. Diurutkan menurut biaya, hanya itulah pengaturan yang layak dipertimbangkan semata berdasarkan harga. Sisanya membayar lebih untuk skor yang sama atau mendapat skor lebih rendah.

PengaturanIntelligence IndexBiaya per tugasPer 10.000 tugas
GPT-6 Sol · low33.9$0.13$1,300
GPT-6 Sol · medium39.8$0.25$2,500
GPT-6 Sol · high42.8$0.37$3,700
GPT-6 Sol · xhigh44.1$0.53$5,300
GPT-6 Astra · low45.8$0.82$8,200
GPT-6 Sol · max47.5$1.06$10,600
Claude Opus 5.5 · medium51.2$1.34$13,400
Claude Opus 5.5 · high53.6$1.82$18,200
Claude Opus 5.5 · xhigh56.0$3.46$34,600
Claude Opus 5.5 · max57.6$5.98$59,800

Frontier punya dua wilayah. Dari $0,13 sampai $1,06 hampir seluruhnya GPT-6 Sol, dengan GPT-6 Astra low sebagai satu-satunya pengecualian di $0,82. Dari $1,34 ke atas hanya Opus 5.5. Lompatan di antara kedua wilayah itu kecil: Opus 5.5 medium mencetak 3,7 poin lebih tinggi daripada Sol max dengan tambahan $0,28 per tugas.

Head to head pada skor sama atau lebih baik

Pasangan ini membandingkan pengaturan yang lebih murah dengan pengaturan yang lebih mahal yang skornya sama atau lebih rendah.

Pengaturan lebih murahPengaturan lebih mahalSelisih skorBiaya yang dihemat
Opus 5.5 medium: 51.2, $1.34Opus 5 high: 48.1, $3.61+3.1 untuk Opus 5.563%
Opus 5.5 medium: 51.2, $1.34Opus 5 max: 50.8, $5.86+0.4 untuk Opus 5.577%
Opus 5.5 medium: 51.2, $1.34Fable 5.1 high: 51.2, $3.91seri66%
Opus 5.5 high: 53.6, $1.82GPT-6 Astra max: 52.7, $3.26+0.9 untuk Opus 5.544%
Opus 5.5 high: 53.6, $1.82Fable 5.1 max: 53.4, $7.63+0.2 untuk Opus 5.576%
GPT-6 Sol max: 47.5, $1.06Opus 5 high: 48.1, $3.61+0.6 untuk Opus 571%

Baris Opus 5 penting bagi tim yang belum bermigrasi. Opus 5 berjalan pada effort high secara bawaan. Opus 5.5 berjalan pada medium secara bawaan, dan dengan pengaturan bawaan itu ia mencetak 3,1 poin lebih tinggi dengan biaya per tugas 63% lebih rendah. Anthropic menyebut Opus 5.5 40% lebih murah daripada Opus 5; selisih terukur pada indeks ini lebih besar daripada klaim tersebut.

Uang habis di mana: input, bukan output

Di setiap model, input berada di antara sekitar separuh hingga tiga perempat dari biaya per tugas. Untuk Opus 5.5 pada medium, $0,82 dari $1,34 adalah input, yaitu 61%. Untuk GPT-6 Astra pada max angkanya 58%, untuk GPT-6 Sol pada max 70%, dan untuk Fable 5.1 pada max 49%. Tugas agen mengirim ulang konteks yang terus membesar pada setiap langkah, sehingga pengeluaran input tumbuh seiring jumlah langkah, bukan hanya seiring panjang jawaban.

Inilah sebabnya GPT-6 Sol tanpa penalaran lebih mahal daripada pada low: $0,33 dibanding $0,13, padahal ia hanya menulis 4.900 token output. $0,28 dari $0,33 adalah input. Penyebab yang paling mungkin adalah langkah yang lebih banyak, masing-masing mengirim ulang konteks. Mematikan penalaran tidak membuat agen lebih murah jika agen itu kemudian membutuhkan lebih banyak giliran.

Untuk tagihan Anda, ini berarti caching sama pentingnya dengan pilihan model. Opus 5.5 dan GPT-6 Sol sama-sama menagih $0,20 per juta token input yang di-cache. GPT-6 Astra menagih $1,00 dan Opus 5 menagih $0,50.

Volume token melawan harga daftar

GPT-6 Astra adalah model paling hemat token di sini. Pada effort max ia menulis 27.200 token output per tugas, dibanding 119.200 untuk Opus 5.5 pada max. Namun Astra menagih $10 dan $50 per juta, 2,5× tarif Opus 5.5. Harga daftar yang menang: Opus 5.5 high berbiaya $1,82 per tugas dan mencetak 53,6, sedangkan Astra max berbiaya $3,26 dan mencetak 52,7.

Opus 5.5 pada max adalah satu-satunya tempat di mana kebanyakan kata terasa mahal. 119.200 token output-nya berbiaya $2,38 sebelum input apa pun, dan tugas penuhnya berbiaya $5,98. Itu membeli skor tertinggi di tabel, 57,6, tetapi biayanya 4,5× lipat medium.

Hasil yang makin menurun menurut effort

Setiap baris menunjukkan apa yang dibeli satu langkah naik effort, dalam poin indeks melawan tambahan biaya per tugas.

Modelmedium → highxhigh → max
GPT-6 Sol+3.0 poin untuk +48%+3.4 poin untuk +100%
GPT-6 Astra+1.3 poin untuk +12%+0.3 poin untuk +41%
Claude Opus 5+3.3 poin untuk +65%+1.1 poin untuk +20%
Claude Opus 5.5+2.4 poin untuk +36%+1.6 poin untuk +73%
Claude Fable 5.1+2.3 poin untuk +31%+0.2 poin untuk +28%

Untuk Fable 5.1 dan GPT-6 Astra, effort max hampir tidak membeli apa-apa: 0,2 dan 0,3 poin untuk tambahan 28% dan 41%. Untuk Opus 5.5, langkah ke max masih membeli 1,6 poin, tetapi dengan biaya 73% lebih banyak. Gunakan max hanya pada tugas yang sudah Anda ukur bahwa poin tambahannya mengubah hasil.

Kapan GPT-6 Sol max sudah cukup

Indeks adalah rata-rata, dan selisih antara Sol max dan Opus 5.5 medium tidak merata di seluruhnya. Skor per evaluasi dari Artificial Analysis:

EvaluasiOpus 5.5 medium ($1.34)GPT-6 Sol max ($1.06)
Terminal-Bench 4.052.543.9
AutomationBench-AA61.261.6
GDPval-AA (Elo)15761487
AA-Briefcase (Elo)16421483
Humanity's Last Exam54.747.9
SciCode59.357.6
CritPt27.730.9
AA-LCR84.383.7

Pada AutomationBench dan CritPt, GPT-6 Sol setara atau mengungguli Opus 5.5 medium dengan $1,06 per tugas dibanding $1,34. Pada Terminal-Bench, evaluasi pekerjaan pengetahuan, dan Humanity's Last Exam, Opus 5.5 unggul jauh. Otomatisasi alur kerja bisa berjalan di Sol. Agen terminal dan kode serta pekerjaan pengetahuan yang banyak dokumen adalah tempat Opus 5.5 membenarkan harganya.

Klaim vendor dibandingkan angka independen

Angka vendor dan angka independen sering berbeda, karena keduanya memakai harness dan pengaturan yang berbeda. Anthropic melaporkan 66,4% pada Terminal-Bench 4.0 untuk Opus 5.5 di xhigh. Artificial Analysis mengukur 59,6% pada effort yang sama.

EffortOpus 5.5Fable 5.1
low31.3%40.4%
medium52.5%44.9%
high56.6%52.0%
xhigh59.6%55.1%
max59.6%52.0%

Peringkat juga bisa berubah tergantung indeksnya. Pada Vals AI Index, Fable 5.1 berada di posisi pertama dengan 68,83%, GPT-6 Astra di posisi ketiga dengan 66,61%, dan Opus 5.5 di posisi keempat dengan 66,16%. Biaya per tugas tidak dipublikasikan di sana dengan dasar yang sama, sehingga tidak menggeser frontier di atas. Ini pengingat bahwa satu indeks hanyalah satu sudut pandang.

Harga daftar dan tugas yang banyak caching

Digital Applied menghitung harga satu tugas agen yang banyak caching di setiap model: 8M token baca cache, 400K input tanpa cache, 600K token tulis cache, dan 300K output. Hasilnya mengikuti frontier, dengan tambahan penalti untuk GPT-6 Astra.

ModelInput $/MTokOutput $/MTokBaca cache $/MTokTugas banyak cache (Digital Applied)
GPT-6 Sol$2.00$10.00$0.20$6.90
Claude Opus 5.5$4.00$20.00$0.20$12.20
Claude Opus 5$5.00$25.00$0.50$17.25
Claude Fable 5.1$10.00$50.00$0.25$28.50
GPT-6 Astra (≤272K)$10.00$50.00$1.00$34.50
GPT-6 Astra (>272K)$20.00$75.00n/a$61.50

GPT-6 Astra menagih seluruh permintaan dengan $20 dan $75 per juta begitu input melewati 272K token. Opus 5.5 mempertahankan satu harga di seluruh jendela 1M token-nya. Tulis cache Opus 5.5 berbiaya $5 per juta untuk cache 5 menit dan $8 untuk cache 1 jam, tugas batch ditagih 50%, dan mode cepat menggandakan harga. Untuk detailnya, lihat model biaya Claude Opus 5.5 dan ekonomi mode cepat Opus 5.5.

Cara mengukur biaya per tugas Anda sendiri

  1. Catat token per tugas, bukan per permintaan: input tanpa cache, input cache, tulis cache, dan output, dijumlahkan di setiap langkah tugas.
  2. Ambil sampel beberapa ratus tugas nyata dan putar ulang pada dua atau tiga pengaturan kandidat, misalnya Sol max, Opus 5.5 medium, dan Opus 5.5 high.
  3. Nilai setiap hasil dengan pemeriksaan yang sama seperti yang Anda pakai di produksi, lalu hitung tugas yang lolos.
  4. Bagi total pengeluaran dengan jumlah tugas yang lolos. Biaya per tugas yang berhasil adalah angka yang dibandingkan, karena pengaturan murah yang lebih sering gagal bukanlah pengaturan yang murah.
  5. Pilih pengaturan termurah yang memenuhi standar kualitas Anda, lalu arahkan hanya tugas yang gagal ke pengaturan yang lebih tinggi.
  6. Jalankan ulang pemutaran ketika harga atau effort bawaan berubah.

Untuk melihat bagaimana level effort mengubah tagihan pada satu model, lihat Level effort Opus 5.5 adalah harga yang sebenarnya.

Catatan batasan

Sumber

Terkait


Ingin menerapkannya pada stack Anda? Bawa tagihan penyedia, log gateway, dan alur kerja utama; kami akan memetakan pendorong biaya dan jalur penghematan. Pesan audit gratis →

Kembali ke finopsllm.com