GPT-6 Sol uzun bağlam benchmark'ları: gerçekte ölçülenler ve GPT-5.6 Sol'un sonuçları
Güncellendi September 27, 2026 · ilk yayın September 27, 2026
27 Eylül 2026 itibarıyla GPT-6 Sol'un tam olarak bir bağımsız uzun bağlam puanı var: Artificial Analysis AA-LCR v1.1'de %84, GPT-5.6 Sol ile aynı. Testin belgeleri ortalama yaklaşık 100K token. Henüz kimse GPT-6 Sol'un 256K, 512K ya da 1M tokenda nasıl performans gösterdiğini yayımlamadı. Çevrimiçi dolaşan “Sol” uzun bağlam sayılarının çoğu, %91.5 MRCR puanı dahil, GPT-5.6 Sol'a ait. GPT-6 Sol 22 Eylül'de çıktı.
Maliyet açısından bu önemli, çünkü GPT-6 fiyatları en çok uzun bağlamda sıçrıyor. 272K girdi tokenının üzerinde tüm istek uzun bağlam tarifesiyle faturalanır. Bir ajanın ne kadar bağlam tutacağına karar vermek, bu fiyatı henüz var olmayan kalite verisiyle tartmak demektir.
GPT-6 Sol'un hangi uzun bağlam puanları var?
Yaklaşık 100K tokenda tek bir toplam puan.
| Model | AA-LCR v1.1 | Sıra |
|---|---|---|
| GPT-6 Sol (max) | 84.0% | 7 |
| GPT-5.6 Sol (max) | 84.0% | 7 |
| GPT-6 Astra | 80.7% | 27 |
| Kimi K3 (lider, 24 Eyl 2026) | 88.7% | 1 |
AA-LCR, ortalama 99.325 tokenlık belge setleri üzerinde elle yazılmış 100 soru içerir. Cevaplar tek bir pasajda bulunmaz, birkaç pasajdan bir araya getirilmelidir. Test, uzun bir girdi üzerinde akıl yürütmeyi ölçer. Girdi büyüdükçe doğruluğun nasıl değiştiğini göstermez, çünkü her soru yaklaşık aynı uzunlukta.
Hangi uzun bağlam sayıları GPT-5.6 Sol'a ait, GPT-6 Sol'a değil?
MRCR puanları. GPT-6 Astra'nın lansman haberleri, onu OpenAI'nin MRCR v2 8-needle testinde “Sol” ile karşılaştırdı. O Sol, GPT-5.6 Sol'du; Vellum'un yazısı bunu doğruluyor.
| MRCR v2, 8-needle | 256K–512K | 512K–1M |
|---|---|---|
| GPT-6 Astra | 100% | 96.3% |
| GPT-5.6 Sol | 91.5% | 73.8% |
| GPT-6 Sol | yayımlanmadı | |
OrcaRouter'ın GPT-6 Sol incelemesi aynı noktayı söylüyor: GPT-5.6 Sol'un yayımlanmış bir uzun bağlam erişim sonucu var, GPT-6 Sol'un buna denk bir şeyi yok.
Nerelere baktık?
Bunu yayımlayabilecek yerler, hepsi 27 Eylül 2026'da kontrol edildi:
- Context Arena, MRCR sıralaması. Model listesi ve 8-needle sonuçlarında hiçbir GPT-6 kaydı yok. En yeni OpenAI modelleri GPT-5.6 Sol, Terra ve Luna.
- OpenAI: GPT-6 lansman yazısı ve Sol ile Luna için system card eki. İkisi de Sol sonuçlarını bağlam uzunluğuna göre vermiyor.
- Artificial Analysis: yalnızca AA-LCR, yukarıdaki gibi.
- Vals, Vellum, DataCamp, emergent.sh, llm-stats ve OrcaRouter: GPT-6 Sol için uzunluğa göre uzun bağlam sonucu yok.
Uzunluğa göre veri olana kadar ekipler ne yapmalı?
GPT-6 Sol isteklerini 272K girdi tokenının altında tutun ve erken sıkıştırın. Şimdiye kadarki kanıt, GPT-6 Sol'un yaklaşık 100K'da GPT-5.6 Sol ile eşit olduğunu gösteriyor. GPT-5.6 Sol, MRCR'da 512K'ya kadar %91.5 tuttu ama bunun ötesinde %73.8'e düştü. GPT-6 Sol'un yaklaşık 250K'ya kadar kullanılabilir olmasını beklemek makul, ama bu bir çıkarım, bir ölçüm değil. 272K'nın üzerinde, kimsenin ölçmediği bir kalite için girdiye iki kat ödersiniz.
Codex'te bu zaten varsayılan. GPT-6 Sol'a 272K pencere veriyor ve 244.800 tokenda sıkıştırıyor. Kendi ajanlarınız için 272K'yı aşan istekler için uyarı kurun ve her artışı test edilmesi gereken bir şey olarak görün. 256K'nın ötesindeki bağlama güvenmeden önce kendi belgelerinizle kendi erişim testinizi çalıştırın.
Context Arena ya da başka bir bağımsız değerlendirici GPT-6 Sol sonuçlarını bağlam uzunluğuna göre yayımladığında bu sayfayı güncelleyeceğiz.
Kaynaklar
- Artificial Analysis: GPT-6 Sol vs GPT-5.6 Sol
- Artificial Analysis: AA-LCR'nin duyurusu
- BenchLM: AA-LCR sıralaması
- Vellum: GPT-6 Astra benchmark'ları açıklandı
- OrcaRouter: GPT-6 Sol vs GPT-5.6 Sol
- Context Arena: MRCR sıralaması
İlgili
- GPT-6 Sol'da Codex otomatik sıkıştırma: gerçek varsayılanlar
- GPT-6 Sol fiyatlandırması ve maliyet modeli
- GPT-6 fiyatları ve 272K uzun bağlam fiyat sıçraması
Bunu kendi altyapınıza uygulamak mı istiyorsunuz? Sağlayıcı faturalarını, ağ geçidi kayıtlarını ve ana iş akışlarını getirin; maliyet etkenlerini ve tasarruf yolunu çıkaralım. Ücretsiz denetim planlayın →