Biaya nyata per tugas di seluruh model frontier
Diperbarui September 22, 2026 · pertama terbit September 22, 2026
Harga daftar memberi tahu Anda berapa biaya sebuah token. Harga daftar tidak memberi tahu berapa biaya sebuah tugas yang selesai, karena model menghabiskan jumlah token yang sangat berbeda untuk menyelesaikan pekerjaan yang sama. Halaman ini menempatkan biaya per tugas yang terukur dan skor kualitas secara berdampingan untuk Claude Opus 5.5, Claude Opus 5, Claude Fable 5.1, GPT-6 Astra, dan GPT-6 Sol di setiap level effort. Setiap angka punya sumber, dan tidak ada yang diperkirakan.
Jawaban singkatnya: GPT-6 Sol adalah cara termurah untuk mencapai skor apa pun hingga 47,5. Di atas 47,5, Opus 5.5 adalah yang termurah di setiap level. Tidak ada pengaturan GPT-6 Astra di atas low, Opus 5, atau Fable 5.1 yang efisien biaya: masing-masing dikalahkan baik dari sisi skor maupun harga oleh pengaturan Sol atau Opus 5.5 tertentu.
Metode
Semua skor dan biaya berasal dari Artificial Analysis Intelligence Index v4.3.2, dibaca pada 22 September 2026. Indeks ini menjalankan sepuluh evaluasi: AA-Briefcase, GDPval-AA, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, dan AA-LCR. Artificial Analysis menjalankan tiap model pada tiap pengaturan effort melalui API penyedia dan mencatat apa yang dibayar pada harga daftar. Biaya per tugas adalah pengeluaran per tugas itu, dipecah menjadi input dan output. Rangkaian uji yang sama dijalankan untuk setiap baris, sehingga barisnya bisa langsung dibandingkan.
Ada dua batasan sebelum Anda membaca angkanya. Pertama, indeks ini hanya satu campuran tugas. Campuran Anda akan menggeser biaya, itulah sebabnya bagian terakhir menjelaskan cara mengukur milik Anda sendiri. Kedua, skor dari versi indeks yang berbeda tidak bisa dibandingkan, jadi jangan campur angka ini dengan angka terbitan lama.
Tangga lengkap: 26 pengaturan
Token output per tugas adalah token yang ditulis model, termasuk penalaran. Artificial Analysis tidak mempublikasikan pembagian input dan output untuk empat pengaturan GPT-6 Sol di tengah, jadi sel-sel itu bertuliskan n/a.
| Model | Effort | Intelligence Index | Biaya per tugas | Biaya input | Biaya output | Token output per tugas | Di frontier |
|---|---|---|---|---|---|---|---|
| GPT-6 Sol | none | 28.1 | $0.33 | $0.28 | $0.05 | 4,900 | Tidak |
| GPT-6 Sol | low | 33.9 | $0.13 | n/a | n/a | 3,400 | Ya |
| GPT-6 Sol | medium (bawaan) | 39.8 | $0.25 | n/a | n/a | 6,500 | Ya |
| GPT-6 Sol | high | 42.8 | $0.37 | n/a | n/a | 10,200 | Ya |
| GPT-6 Sol | xhigh | 44.1 | $0.53 | n/a | n/a | 16,000 | Ya |
| GPT-6 Sol | max | 47.5 | $1.06 | $0.74 | $0.31 | 31,200 | Ya |
| GPT-6 Astra | low | 45.8 | $0.82 | $0.60 | $0.22 | 4,400 | Ya |
| GPT-6 Astra | medium | 49.6 | $1.54 | $1.06 | $0.48 | 9,600 | Tidak |
| GPT-6 Astra | high | 50.9 | $1.73 | $1.13 | $0.59 | 11,800 | Tidak |
| GPT-6 Astra | xhigh | 52.4 | $2.31 | $1.46 | $0.85 | 16,900 | Tidak |
| GPT-6 Astra | max | 52.7 | $3.26 | $1.90 | $1.36 | 27,200 | Tidak |
| Claude Opus 5 | low | 39.4 | $1.10 | $0.73 | $0.37 | 14,700 | Tidak |
| Claude Opus 5 | medium | 44.8 | $2.19 | $1.47 | $0.72 | 29,000 | Tidak |
| Claude Opus 5 | high (bawaan) | 48.1 | $3.61 | $2.46 | $1.16 | 46,200 | Tidak |
| Claude Opus 5 | xhigh | 49.7 | $4.88 | $3.36 | $1.52 | 60,700 | Tidak |
| Claude Opus 5 | max | 50.8 | $5.86 | $4.05 | $1.81 | 72,500 | Tidak |
| Claude Opus 5.5 | low | 42.3 | $0.55 | $0.35 | $0.20 | 10,200 | Tidak |
| Claude Opus 5.5 | medium (bawaan) | 51.2 | $1.34 | $0.82 | $0.51 | 25,700 | Ya |
| Claude Opus 5.5 | high | 53.6 | $1.82 | $1.11 | $0.71 | 35,600 | Ya |
| Claude Opus 5.5 | xhigh | 56.0 | $3.46 | $2.15 | $1.31 | 65,700 | Ya |
| Claude Opus 5.5 | max | 57.6 | $5.98 | $3.60 | $2.38 | 119,200 | Ya |
| Claude Fable 5.1 | low | 46.8 | $2.37 | $1.30 | $1.08 | 21,600 | Tidak |
| Claude Fable 5.1 | medium | 48.9 | $2.98 | $1.59 | $1.39 | 27,900 | Tidak |
| Claude Fable 5.1 | high | 51.2 | $3.91 | $2.01 | $1.90 | 38,100 | Tidak |
| Claude Fable 5.1 | xhigh | 53.2 | $5.98 | $2.96 | $3.02 | 60,500 | Tidak |
| Claude Fable 5.1 | max | 53.4 | $7.63 | $3.73 | $3.90 | 78,100 | Tidak |
Di frontier berarti tidak ada pengaturan lain di tabel ini yang skornya lebih tinggi dengan biaya lebih rendah.
Frontier biaya
Sepuluh dari 26 pengaturan berada di frontier. Diurutkan menurut biaya, hanya itulah pengaturan yang layak dipertimbangkan semata berdasarkan harga. Sisanya membayar lebih untuk skor yang sama atau mendapat skor lebih rendah.
| Pengaturan | Intelligence Index | Biaya per tugas | Per 10.000 tugas |
|---|---|---|---|
| GPT-6 Sol · low | 33.9 | $0.13 | $1,300 |
| GPT-6 Sol · medium | 39.8 | $0.25 | $2,500 |
| GPT-6 Sol · high | 42.8 | $0.37 | $3,700 |
| GPT-6 Sol · xhigh | 44.1 | $0.53 | $5,300 |
| GPT-6 Astra · low | 45.8 | $0.82 | $8,200 |
| GPT-6 Sol · max | 47.5 | $1.06 | $10,600 |
| Claude Opus 5.5 · medium | 51.2 | $1.34 | $13,400 |
| Claude Opus 5.5 · high | 53.6 | $1.82 | $18,200 |
| Claude Opus 5.5 · xhigh | 56.0 | $3.46 | $34,600 |
| Claude Opus 5.5 · max | 57.6 | $5.98 | $59,800 |
Frontier punya dua wilayah. Dari $0,13 sampai $1,06 hampir seluruhnya GPT-6 Sol, dengan GPT-6 Astra low sebagai satu-satunya pengecualian di $0,82. Dari $1,34 ke atas hanya Opus 5.5. Lompatan di antara kedua wilayah itu kecil: Opus 5.5 medium mencetak 3,7 poin lebih tinggi daripada Sol max dengan tambahan $0,28 per tugas.
Head to head pada skor sama atau lebih baik
Pasangan ini membandingkan pengaturan yang lebih murah dengan pengaturan yang lebih mahal yang skornya sama atau lebih rendah.
| Pengaturan lebih murah | Pengaturan lebih mahal | Selisih skor | Biaya yang dihemat |
|---|---|---|---|
| Opus 5.5 medium: 51.2, $1.34 | Opus 5 high: 48.1, $3.61 | +3.1 untuk Opus 5.5 | 63% |
| Opus 5.5 medium: 51.2, $1.34 | Opus 5 max: 50.8, $5.86 | +0.4 untuk Opus 5.5 | 77% |
| Opus 5.5 medium: 51.2, $1.34 | Fable 5.1 high: 51.2, $3.91 | seri | 66% |
| Opus 5.5 high: 53.6, $1.82 | GPT-6 Astra max: 52.7, $3.26 | +0.9 untuk Opus 5.5 | 44% |
| Opus 5.5 high: 53.6, $1.82 | Fable 5.1 max: 53.4, $7.63 | +0.2 untuk Opus 5.5 | 76% |
| GPT-6 Sol max: 47.5, $1.06 | Opus 5 high: 48.1, $3.61 | +0.6 untuk Opus 5 | 71% |
Baris Opus 5 penting bagi tim yang belum bermigrasi. Opus 5 berjalan pada effort high secara bawaan. Opus 5.5 berjalan pada medium secara bawaan, dan dengan pengaturan bawaan itu ia mencetak 3,1 poin lebih tinggi dengan biaya per tugas 63% lebih rendah. Anthropic menyebut Opus 5.5 40% lebih murah daripada Opus 5; selisih terukur pada indeks ini lebih besar daripada klaim tersebut.
Uang habis di mana: input, bukan output
Di setiap model, input berada di antara sekitar separuh hingga tiga perempat dari biaya per tugas. Untuk Opus 5.5 pada medium, $0,82 dari $1,34 adalah input, yaitu 61%. Untuk GPT-6 Astra pada max angkanya 58%, untuk GPT-6 Sol pada max 70%, dan untuk Fable 5.1 pada max 49%. Tugas agen mengirim ulang konteks yang terus membesar pada setiap langkah, sehingga pengeluaran input tumbuh seiring jumlah langkah, bukan hanya seiring panjang jawaban.
Inilah sebabnya GPT-6 Sol tanpa penalaran lebih mahal daripada pada low: $0,33 dibanding $0,13, padahal ia hanya menulis 4.900 token output. $0,28 dari $0,33 adalah input. Penyebab yang paling mungkin adalah langkah yang lebih banyak, masing-masing mengirim ulang konteks. Mematikan penalaran tidak membuat agen lebih murah jika agen itu kemudian membutuhkan lebih banyak giliran.
Untuk tagihan Anda, ini berarti caching sama pentingnya dengan pilihan model. Opus 5.5 dan GPT-6 Sol sama-sama menagih $0,20 per juta token input yang di-cache. GPT-6 Astra menagih $1,00 dan Opus 5 menagih $0,50.
Volume token melawan harga daftar
GPT-6 Astra adalah model paling hemat token di sini. Pada effort max ia menulis 27.200 token output per tugas, dibanding 119.200 untuk Opus 5.5 pada max. Namun Astra menagih $10 dan $50 per juta, 2,5× tarif Opus 5.5. Harga daftar yang menang: Opus 5.5 high berbiaya $1,82 per tugas dan mencetak 53,6, sedangkan Astra max berbiaya $3,26 dan mencetak 52,7.
Opus 5.5 pada max adalah satu-satunya tempat di mana kebanyakan kata terasa mahal. 119.200 token output-nya berbiaya $2,38 sebelum input apa pun, dan tugas penuhnya berbiaya $5,98. Itu membeli skor tertinggi di tabel, 57,6, tetapi biayanya 4,5× lipat medium.
Hasil yang makin menurun menurut effort
Setiap baris menunjukkan apa yang dibeli satu langkah naik effort, dalam poin indeks melawan tambahan biaya per tugas.
| Model | medium → high | xhigh → max |
|---|---|---|
| GPT-6 Sol | +3.0 poin untuk +48% | +3.4 poin untuk +100% |
| GPT-6 Astra | +1.3 poin untuk +12% | +0.3 poin untuk +41% |
| Claude Opus 5 | +3.3 poin untuk +65% | +1.1 poin untuk +20% |
| Claude Opus 5.5 | +2.4 poin untuk +36% | +1.6 poin untuk +73% |
| Claude Fable 5.1 | +2.3 poin untuk +31% | +0.2 poin untuk +28% |
Untuk Fable 5.1 dan GPT-6 Astra, effort max hampir tidak membeli apa-apa: 0,2 dan 0,3 poin untuk tambahan 28% dan 41%. Untuk Opus 5.5, langkah ke max masih membeli 1,6 poin, tetapi dengan biaya 73% lebih banyak. Gunakan max hanya pada tugas yang sudah Anda ukur bahwa poin tambahannya mengubah hasil.
Kapan GPT-6 Sol max sudah cukup
Indeks adalah rata-rata, dan selisih antara Sol max dan Opus 5.5 medium tidak merata di seluruhnya. Skor per evaluasi dari Artificial Analysis:
| Evaluasi | Opus 5.5 medium ($1.34) | GPT-6 Sol max ($1.06) |
|---|---|---|
| Terminal-Bench 4.0 | 52.5 | 43.9 |
| AutomationBench-AA | 61.2 | 61.6 |
| GDPval-AA (Elo) | 1576 | 1487 |
| AA-Briefcase (Elo) | 1642 | 1483 |
| Humanity's Last Exam | 54.7 | 47.9 |
| SciCode | 59.3 | 57.6 |
| CritPt | 27.7 | 30.9 |
| AA-LCR | 84.3 | 83.7 |
Pada AutomationBench dan CritPt, GPT-6 Sol setara atau mengungguli Opus 5.5 medium dengan $1,06 per tugas dibanding $1,34. Pada Terminal-Bench, evaluasi pekerjaan pengetahuan, dan Humanity's Last Exam, Opus 5.5 unggul jauh. Otomatisasi alur kerja bisa berjalan di Sol. Agen terminal dan kode serta pekerjaan pengetahuan yang banyak dokumen adalah tempat Opus 5.5 membenarkan harganya.
Klaim vendor dibandingkan angka independen
Angka vendor dan angka independen sering berbeda, karena keduanya memakai harness dan pengaturan yang berbeda. Anthropic melaporkan 66,4% pada Terminal-Bench 4.0 untuk Opus 5.5 di xhigh. Artificial Analysis mengukur 59,6% pada effort yang sama.
| Effort | Opus 5.5 | Fable 5.1 |
|---|---|---|
| low | 31.3% | 40.4% |
| medium | 52.5% | 44.9% |
| high | 56.6% | 52.0% |
| xhigh | 59.6% | 55.1% |
| max | 59.6% | 52.0% |
Peringkat juga bisa berubah tergantung indeksnya. Pada Vals AI Index, Fable 5.1 berada di posisi pertama dengan 68,83%, GPT-6 Astra di posisi ketiga dengan 66,61%, dan Opus 5.5 di posisi keempat dengan 66,16%. Biaya per tugas tidak dipublikasikan di sana dengan dasar yang sama, sehingga tidak menggeser frontier di atas. Ini pengingat bahwa satu indeks hanyalah satu sudut pandang.
Harga daftar dan tugas yang banyak caching
Digital Applied menghitung harga satu tugas agen yang banyak caching di setiap model: 8M token baca cache, 400K input tanpa cache, 600K token tulis cache, dan 300K output. Hasilnya mengikuti frontier, dengan tambahan penalti untuk GPT-6 Astra.
| Model | Input $/MTok | Output $/MTok | Baca cache $/MTok | Tugas banyak cache (Digital Applied) |
|---|---|---|---|---|
| GPT-6 Sol | $2.00 | $10.00 | $0.20 | $6.90 |
| Claude Opus 5.5 | $4.00 | $20.00 | $0.20 | $12.20 |
| Claude Opus 5 | $5.00 | $25.00 | $0.50 | $17.25 |
| Claude Fable 5.1 | $10.00 | $50.00 | $0.25 | $28.50 |
| GPT-6 Astra (≤272K) | $10.00 | $50.00 | $1.00 | $34.50 |
| GPT-6 Astra (>272K) | $20.00 | $75.00 | n/a | $61.50 |
GPT-6 Astra menagih seluruh permintaan dengan $20 dan $75 per juta begitu input melewati 272K token. Opus 5.5 mempertahankan satu harga di seluruh jendela 1M token-nya. Tulis cache Opus 5.5 berbiaya $5 per juta untuk cache 5 menit dan $8 untuk cache 1 jam, tugas batch ditagih 50%, dan mode cepat menggandakan harga. Untuk detailnya, lihat model biaya Claude Opus 5.5 dan ekonomi mode cepat Opus 5.5.
Cara mengukur biaya per tugas Anda sendiri
- Catat token per tugas, bukan per permintaan: input tanpa cache, input cache, tulis cache, dan output, dijumlahkan di setiap langkah tugas.
- Ambil sampel beberapa ratus tugas nyata dan putar ulang pada dua atau tiga pengaturan kandidat, misalnya Sol max, Opus 5.5 medium, dan Opus 5.5 high.
- Nilai setiap hasil dengan pemeriksaan yang sama seperti yang Anda pakai di produksi, lalu hitung tugas yang lolos.
- Bagi total pengeluaran dengan jumlah tugas yang lolos. Biaya per tugas yang berhasil adalah angka yang dibandingkan, karena pengaturan murah yang lebih sering gagal bukanlah pengaturan yang murah.
- Pilih pengaturan termurah yang memenuhi standar kualitas Anda, lalu arahkan hanya tugas yang gagal ke pengaturan yang lebih tinggi.
- Jalankan ulang pemutaran ketika harga atau effort bawaan berubah.
Untuk melihat bagaimana level effort mengubah tagihan pada satu model, lihat Level effort Opus 5.5 adalah harga yang sebenarnya.
Catatan batasan
- Semua biaya menggunakan harga daftar API pada campuran tugas Artificial Analysis. Diskon, harga batch, dan caching Anda sendiri akan mengubahnya.
- Artificial Analysis memberi label pada entri Opus 5.5 dan Fable 5.1 sebagai Default Fallback. Periksa catatan metodologinya sebelum menganggap setiap baris sebagai konfigurasi API yang sama.
- Skor hanya berasal dari indeks v4.3.2. Versi sebelumnya memakai evaluasi yang berbeda dan tidak bisa dibandingkan.
- Tugas banyak cache dari Digital Applied adalah satu beban kerja ilustratif, bukan pengukuran.
- Angka berubah ketika penyedia mengubah harga atau bawaan. Tanggal pembacaan adalah 22 September 2026.
Sumber
- Artificial Analysis Intelligence Index
- Artificial Analysis: Claude Opus 5.5
- Artificial Analysis: Claude Opus 5
- Artificial Analysis: Claude Fable 5.1
- Artificial Analysis: GPT-6 Astra
- Artificial Analysis: GPT-6 Sol
- Digital Applied: GPT-6 Sol vs Claude Opus 5.5 cost benchmarks
- Digital Applied: Claude Opus 5.5 vs GPT-6 Astra
- Digital Applied: Is Claude Fable 5.1 still worth it?
- Digital Applied: Claude Opus 5.5 launch pricing and benchmarks
- Digital Applied: Opus 5.5 vs Grok 4.7 vs Muse Spark 1.3 cost per task
Terkait
- Model biaya Claude Opus 5.5
- Level effort Opus 5.5 adalah harga yang sebenarnya
- Ekonomi mode cepat Opus 5.5
Ingin menerapkannya pada stack Anda? Bawa tagihan penyedia, log gateway, dan alur kerja utama; kami akan memetakan pendorong biaya dan jalur penghematan. Pesan audit gratis →