Перейти к содержанию

Бенчмарки длинного контекста GPT-6 Sol: что измерено и что относится к GPT-5.6 Sol

Обновлено September 27, 2026 · впервые опубликовано September 27, 2026

Краткий ответ: По состоянию на 27 сентября 2026 года у GPT-6 Sol ровно один независимый результат по длинному контексту: 84% в Artificial Analysis AA-LCR v1.1, наравне с GPT-5.6 Sol. Документы в тесте в среднем...

По состоянию на 27 сентября 2026 года у GPT-6 Sol ровно один независимый результат по длинному контексту: 84% в Artificial Analysis AA-LCR v1.1, наравне с GPT-5.6 Sol. Документы в тесте в среднем содержат около 100K токенов. Пока никто не опубликовал, как GPT-6 Sol держится на 256K, 512K или 1M токенов. Большинство цифр «Sol» по длинному контексту в сети, включая 91.5% MRCR, относятся к GPT-5.6 Sol. GPT-6 Sol вышла 22 сентября.

Это важно для стоимости, потому что именно на длинном контексте цены GPT-6 растут. Свыше 272K входных токенов весь запрос тарифицируется по ценам длинного контекста. Решая, сколько контекста хранить в агенте, приходится сравнивать эту цену с данными о качестве, которых пока нет.

Какие результаты по длинному контексту есть у GPT-6 Sol?

Один агрегированный результат, примерно на 100K токенов.

МодельAA-LCR v1.1Место
GPT-6 Sol (max)84.0%7
GPT-5.6 Sol (max)84.0%7
GPT-6 Astra80.7%27
Kimi K3 (лидер, 24 сентября 2026)88.7%1

В AA-LCR 100 вручную написанных вопросов по наборам документов, которые в среднем содержат 99,325 токенов. Ответы нужно собирать из нескольких фрагментов, а не находить в одном месте. Тест проверяет рассуждения над длинным входом. Он не показывает, как меняется точность при росте входа, потому что все вопросы примерно одной длины.

Какие цифры по длинному контексту относятся к GPT-5.6 Sol, а не к GPT-6 Sol?

Результаты MRCR. В материалах о запуске GPT-6 Astra её сравнивали с «Sol» по тесту OpenAI MRCR v2 8-needle. Этой Sol была GPT-5.6 Sol, что подтверждает разбор от Vellum.

MRCR v2, 8-needle256K–512K512K–1M
GPT-6 Astra100%96.3%
GPT-5.6 Sol91.5%73.8%
GPT-6 Solне опубликовано

Обзор GPT-6 Sol от OrcaRouter говорит то же самое: у GPT-5.6 Sol есть опубликованный результат поиска на длинном контексте, а у GPT-6 Sol аналога нет.

Где уже искали?

Места, где это могли бы опубликовать, все проверены 27 сентября 2026 года:

Что делать командам, пока нет данных по длине?

Держите запросы GPT-6 Sol до 272K входных токенов и сжимайте историю заранее. Пока данные показывают, что GPT-6 Sol на уровне около 100K не уступает GPT-5.6 Sol. GPT-5.6 Sol держала 91.5% до 512K на MRCR, но за этой отметкой упала до 73.8%. Разумно ожидать, что GPT-6 Sol пригодна примерно до 250K, но это вывод, а не измерение. Свыше 272K вы платите вдвое больше за вход ради качества, которое никто не измерял.

В Codex это уже поведение по умолчанию: там GPT-6 Sol получает окно 272K и сжимает контекст на 244,800 токенах. Для собственных агентов ставьте алерт на запросы, которые переходят 272K, и проверяйте любой рост. Прежде чем полагаться на контекст больше 256K, прогоните собственную проверку поиска по своим документам.

Мы обновим эту страницу, когда Context Arena или другой независимый оценщик опубликует результаты GPT-6 Sol по длине контекста.

Источники

По теме


Хотите применить это к своему стеку? Принесите счета провайдеров, логи шлюза и ключевые рабочие процессы — мы определим драйверы затрат и пути экономии. Заказать бесплатный аудит →

Вернуться на finopsllm.com