Langsung ke konten

Tolok ukur konteks panjang GPT-6 Sol: apa yang benar-benar diukur, dan apa itu GPT-5.6 Sol

Diperbarui September 27, 2026 · pertama terbit September 27, 2026

Jawaban singkat: Per 27 September 2026, GPT-6 Sol hanya punya satu skor konteks panjang independen: 84% di Artificial Analysis AA-LCR v1.1, setara GPT-5.6 Sol. Dokumen dalam tes ini rata-rata sekitar 100K token. Belum...

Per 27 September 2026, GPT-6 Sol hanya punya satu skor konteks panjang independen: 84% di Artificial Analysis AA-LCR v1.1, setara GPT-5.6 Sol. Dokumen dalam tes ini rata-rata sekitar 100K token. Belum ada yang mempublikasikan bagaimana GPT-6 Sol bertahan di 256K, 512K, atau 1M token. Sebagian besar angka konteks panjang “Sol” di internet, termasuk skor MRCR 91,5%, adalah milik GPT-5.6 Sol. GPT-6 Sol dirilis pada 22 September.

Ini penting untuk biaya karena konteks panjang adalah titik lonjakan harga GPT-6. Di atas 272K token input, seluruh permintaan ditagih dengan tarif konteks panjang. Menentukan seberapa banyak konteks yang dipertahankan agen berarti menimbang harga itu terhadap data kualitas yang belum ada.

Skor konteks panjang apa yang dimiliki GPT-6 Sol?

Satu skor agregat, di sekitar 100K token.

ModelAA-LCR v1.1Peringkat
GPT-6 Sol (max)84.0%7
GPT-5.6 Sol (max)84.0%7
GPT-6 Astra80.7%27
Kimi K3 (pemimpin, 24 Sep 2026)88.7%1

AA-LCR berisi 100 pertanyaan buatan tangan atas kumpulan dokumen yang rata-rata 99.325 token. Jawabannya harus disusun dari beberapa bagian, bukan ditemukan di satu tempat. Tes ini mengukur penalaran atas input panjang. Tes ini tidak menunjukkan bagaimana akurasi berubah seiring input bertambah, karena semua pertanyaannya memiliki panjang yang kurang lebih sama.

Angka konteks panjang mana yang milik GPT-5.6 Sol, bukan GPT-6 Sol?

Skor MRCR. Pemberitaan peluncuran GPT-6 Astra membandingkannya dengan “Sol” pada tes MRCR v2 8-needle dari OpenAI. Sol itu adalah GPT-5.6 Sol, dan tulisan Vellum mengonfirmasinya.

MRCR v2, 8-needle256K–512K512K–1M
GPT-6 Astra100%96.3%
GPT-5.6 Sol91.5%73.8%
GPT-6 Solbelum dipublikasikan

Ulasan GPT-6 Sol dari OrcaRouter menyampaikan poin yang sama: GPT-5.6 Sol punya hasil retrieval konteks panjang yang dipublikasikan, sedangkan GPT-6 Sol belum punya yang setara.

Di mana kami sudah memeriksa?

Tempat-tempat yang seharusnya mempublikasikannya, semuanya diperiksa pada 27 September 2026:

Apa yang sebaiknya dilakukan tim sampai ada data menurut panjang?

Jaga permintaan GPT-6 Sol di bawah 272K token input dan lakukan kompaksi lebih awal. Bukti sejauh ini menunjukkan GPT-6 Sol setara GPT-5.6 Sol di sekitar 100K. GPT-5.6 Sol mempertahankan 91,5% sampai 512K pada MRCR, tetapi turun ke 73,8% di atas itu. Wajar jika memperkirakan GPT-6 Sol masih bisa dipakai hingga sekitar 250K, tetapi itu inferensi, bukan pengukuran. Di atas 272K Anda membayar dua kali lipat untuk input demi kualitas yang belum pernah diukur siapa pun.

Di Codex, ini sudah menjadi default. Codex memberi GPT-6 Sol jendela 272K dan melakukan kompaksi pada 244.800 token. Untuk agen Anda sendiri, pasang alarm untuk permintaan yang melewati 272K dan perlakukan setiap kenaikan sebagai sesuatu yang harus diuji. Jalankan pemeriksaan retrieval Anda sendiri pada dokumen Anda sebelum mengandalkan konteks di atas 256K.

Kami akan memperbarui halaman ini ketika Context Arena atau evaluator independen lain mempublikasikan hasil GPT-6 Sol menurut panjang konteks.

Sumber

Terkait


Ingin menerapkannya pada stack Anda? Bawa tagihan penyedia, log gateway, dan alur kerja utama; kami akan memetakan pendorong biaya dan jalur penghematan. Pesan audit gratis →

Kembali ke finopsllm.com