Бенчмарки длинного контекста GPT-6 Sol: что измерено и что относится к GPT-5.6 Sol
Обновлено September 27, 2026 · впервые опубликовано September 27, 2026
По состоянию на 27 сентября 2026 года у GPT-6 Sol ровно один независимый результат по длинному контексту: 84% в Artificial Analysis AA-LCR v1.1, наравне с GPT-5.6 Sol. Документы в тесте в среднем содержат около 100K токенов. Пока никто не опубликовал, как GPT-6 Sol держится на 256K, 512K или 1M токенов. Большинство цифр «Sol» по длинному контексту в сети, включая 91.5% MRCR, относятся к GPT-5.6 Sol. GPT-6 Sol вышла 22 сентября.
Это важно для стоимости, потому что именно на длинном контексте цены GPT-6 растут. Свыше 272K входных токенов весь запрос тарифицируется по ценам длинного контекста. Решая, сколько контекста хранить в агенте, приходится сравнивать эту цену с данными о качестве, которых пока нет.
Какие результаты по длинному контексту есть у GPT-6 Sol?
Один агрегированный результат, примерно на 100K токенов.
| Модель | AA-LCR v1.1 | Место |
|---|---|---|
| GPT-6 Sol (max) | 84.0% | 7 |
| GPT-5.6 Sol (max) | 84.0% | 7 |
| GPT-6 Astra | 80.7% | 27 |
| Kimi K3 (лидер, 24 сентября 2026) | 88.7% | 1 |
В AA-LCR 100 вручную написанных вопросов по наборам документов, которые в среднем содержат 99,325 токенов. Ответы нужно собирать из нескольких фрагментов, а не находить в одном месте. Тест проверяет рассуждения над длинным входом. Он не показывает, как меняется точность при росте входа, потому что все вопросы примерно одной длины.
Какие цифры по длинному контексту относятся к GPT-5.6 Sol, а не к GPT-6 Sol?
Результаты MRCR. В материалах о запуске GPT-6 Astra её сравнивали с «Sol» по тесту OpenAI MRCR v2 8-needle. Этой Sol была GPT-5.6 Sol, что подтверждает разбор от Vellum.
| MRCR v2, 8-needle | 256K–512K | 512K–1M |
|---|---|---|
| GPT-6 Astra | 100% | 96.3% |
| GPT-5.6 Sol | 91.5% | 73.8% |
| GPT-6 Sol | не опубликовано | |
Обзор GPT-6 Sol от OrcaRouter говорит то же самое: у GPT-5.6 Sol есть опубликованный результат поиска на длинном контексте, а у GPT-6 Sol аналога нет.
Где уже искали?
Места, где это могли бы опубликовать, все проверены 27 сентября 2026 года:
- Context Arena, таблица лидеров MRCR. В её списке моделей и результатах 8-needle нет записей GPT-6. Её самые новые модели OpenAI — GPT-5.6 Sol, Terra и Luna.
- OpenAI: пост о запуске GPT-6 и приложение к системной карте для Sol и Luna. Ни в одном из них нет результатов Sol по длине контекста.
- Artificial Analysis: только AA-LCR, как выше.
- Vals, Vellum, DataCamp, emergent.sh, llm-stats и OrcaRouter: результатов GPT-6 Sol по длине контекста нет.
Что делать командам, пока нет данных по длине?
Держите запросы GPT-6 Sol до 272K входных токенов и сжимайте историю заранее. Пока данные показывают, что GPT-6 Sol на уровне около 100K не уступает GPT-5.6 Sol. GPT-5.6 Sol держала 91.5% до 512K на MRCR, но за этой отметкой упала до 73.8%. Разумно ожидать, что GPT-6 Sol пригодна примерно до 250K, но это вывод, а не измерение. Свыше 272K вы платите вдвое больше за вход ради качества, которое никто не измерял.
В Codex это уже поведение по умолчанию: там GPT-6 Sol получает окно 272K и сжимает контекст на 244,800 токенах. Для собственных агентов ставьте алерт на запросы, которые переходят 272K, и проверяйте любой рост. Прежде чем полагаться на контекст больше 256K, прогоните собственную проверку поиска по своим документам.
Мы обновим эту страницу, когда Context Arena или другой независимый оценщик опубликует результаты GPT-6 Sol по длине контекста.
Источники
- Artificial Analysis: GPT-6 Sol против GPT-5.6 Sol
- Artificial Analysis: анонс AA-LCR
- BenchLM: таблица лидеров AA-LCR
- Vellum: разбор бенчмарков GPT-6 Astra
- OrcaRouter: GPT-6 Sol против GPT-5.6 Sol
- Context Arena: таблица лидеров MRCR
По теме
- Автокомпактирование Codex на GPT-6 Sol: реальные значения по умолчанию
- Цены и модель затрат GPT-6 Sol
- Цены GPT-6 и скачок цены за контекст 272K
Хотите применить это к своему стеку? Принесите счета провайдеров, логи шлюза и ключевые рабочие процессы — мы определим драйверы затрат и пути экономии. Заказать бесплатный аудит →