Перейти к содержанию

Реальная стоимость задачи для передовых моделей

Обновлено September 22, 2026 · впервые опубликовано September 22, 2026

Списочные цены говорят, сколько стоит токен. Они не говорят, сколько стоит готовая задача, потому что модели тратят на одну и ту же работу очень разное количество токенов. Эта страница ставит рядом измеренную стоимость задачи и оценку качества для Claude Opus 5.5, Claude Opus 5, Claude Fable 5.1, GPT-6 Astra и GPT-6 Sol на каждом уровне усилий. У каждой цифры есть источник, ничего не оценено на глаз.

Короткий ответ: GPT-6 Sol — самый дешевый способ достичь любой оценки до 47.5. Выше 47.5 Opus 5.5 — самый дешевый на каждом уровне. Ни одна настройка GPT-6 Astra выше low, Opus 5 или Fable 5.1 не эффективна по стоимости: каждую обгоняет по оценке и по цене какая-то настройка Sol или Opus 5.5.

Методика

Все оценки и стоимости взяты из Artificial Analysis Intelligence Index v4.3.2, данные на 22 сентября 2026. Индекс включает десять оценок: AA-Briefcase, GDPval-AA, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience и AA-LCR. Artificial Analysis запускает каждую модель на каждом уровне усилий через API провайдера и фиксирует, сколько это стоит по списочным ценам. Стоимость задачи — это расход на одну задачу, разбитый на вход и выход. Один и тот же набор применяется во всех строках, поэтому строки сравнимы напрямую.

Перед чтением цифр есть два ограничения. Во-первых, индекс — это один микс задач. Ваш микс сдвинет стоимости, поэтому последний раздел объясняет, как измерить свой. Во-вторых, оценки разных версий индекса не сравнимы, поэтому не смешивайте эти цифры со старыми опубликованными.

Полная лестница: 26 настроек

Выходные токены на задачу — это токены, которые пишет модель, включая рассуждения. Artificial Analysis не публикует разбивку на вход и выход для четырех средних настроек GPT-6 Sol, поэтому в этих ячейках стоит n/a.

МодельУсилияIntelligence IndexСтоимость задачиСтоимость входаСтоимость выходаВыходные токены на задачуНа границе
GPT-6 Solnone28.1$0.33$0.28$0.054,900Нет
GPT-6 Sollow33.9$0.13n/an/a3,400Да
GPT-6 Solmedium (по умолчанию)39.8$0.25n/an/a6,500Да
GPT-6 Solhigh42.8$0.37n/an/a10,200Да
GPT-6 Solxhigh44.1$0.53n/an/a16,000Да
GPT-6 Solmax47.5$1.06$0.74$0.3131,200Да
GPT-6 Astralow45.8$0.82$0.60$0.224,400Да
GPT-6 Astramedium49.6$1.54$1.06$0.489,600Нет
GPT-6 Astrahigh50.9$1.73$1.13$0.5911,800Нет
GPT-6 Astraxhigh52.4$2.31$1.46$0.8516,900Нет
GPT-6 Astramax52.7$3.26$1.90$1.3627,200Нет
Claude Opus 5low39.4$1.10$0.73$0.3714,700Нет
Claude Opus 5medium44.8$2.19$1.47$0.7229,000Нет
Claude Opus 5high (по умолчанию)48.1$3.61$2.46$1.1646,200Нет
Claude Opus 5xhigh49.7$4.88$3.36$1.5260,700Нет
Claude Opus 5max50.8$5.86$4.05$1.8172,500Нет
Claude Opus 5.5low42.3$0.55$0.35$0.2010,200Нет
Claude Opus 5.5medium (по умолчанию)51.2$1.34$0.82$0.5125,700Да
Claude Opus 5.5high53.6$1.82$1.11$0.7135,600Да
Claude Opus 5.5xhigh56.0$3.46$2.15$1.3165,700Да
Claude Opus 5.5max57.6$5.98$3.60$2.38119,200Да
Claude Fable 5.1low46.8$2.37$1.30$1.0821,600Нет
Claude Fable 5.1medium48.9$2.98$1.59$1.3927,900Нет
Claude Fable 5.1high51.2$3.91$2.01$1.9038,100Нет
Claude Fable 5.1xhigh53.2$5.98$2.96$3.0260,500Нет
Claude Fable 5.1max53.4$7.63$3.73$3.9078,100Нет

На границе означает, что ни одна другая настройка в этой таблице не набирает больше оценки за меньшие деньги.

Граница стоимости

Десять из 26 настроек находятся на границе. Отсортированные по стоимости, это единственные, которые стоит рассматривать только по цене. Все остальные стоят больше при той же оценке или дают меньше за те же деньги.

НастройкаIntelligence IndexСтоимость задачиНа 10,000 задач
GPT-6 Sol · low33.9$0.13$1,300
GPT-6 Sol · medium39.8$0.25$2,500
GPT-6 Sol · high42.8$0.37$3,700
GPT-6 Sol · xhigh44.1$0.53$5,300
GPT-6 Astra · low45.8$0.82$8,200
GPT-6 Sol · max47.5$1.06$10,600
Claude Opus 5.5 · medium51.2$1.34$13,400
Claude Opus 5.5 · high53.6$1.82$18,200
Claude Opus 5.5 · xhigh56.0$3.46$34,600
Claude Opus 5.5 · max57.6$5.98$59,800

Граница состоит из двух зон. От $0.13 до $1.06 почти весь диапазон занимает GPT-6 Sol, а единственное исключение — GPT-6 Astra low за $0.82. От $1.34 и выше остается только Opus 5.5. Переход между зонами небольшой: Opus 5.5 medium набирает на 3.7 балла больше, чем Sol max, за $0.28 дополнительно на задачу.

Прямое сравнение при равной или лучшей оценке

Эти пары сравнивают более дешевую настройку с более дорогой, которая набирает такую же или меньшую оценку.

Более дешевая настройкаБолее дорогая настройкаРазница в оценкеЭкономия
Opus 5.5 medium: 51.2, $1.34Opus 5 high: 48.1, $3.61+3.1 у Opus 5.563%
Opus 5.5 medium: 51.2, $1.34Opus 5 max: 50.8, $5.86+0.4 у Opus 5.577%
Opus 5.5 medium: 51.2, $1.34Fable 5.1 high: 51.2, $3.91ничья66%
Opus 5.5 high: 53.6, $1.82GPT-6 Astra max: 52.7, $3.26+0.9 у Opus 5.544%
Opus 5.5 high: 53.6, $1.82Fable 5.1 max: 53.4, $7.63+0.2 у Opus 5.576%
GPT-6 Sol max: 47.5, $1.06Opus 5 high: 48.1, $3.61+0.6 у Opus 571%

Строка с Opus 5 важна для команд, которые еще не перешли. Opus 5 по умолчанию работал на high. Opus 5.5 по умолчанию работает на medium, и на этом значении набирает на 3.1 балла больше при на 63% меньших расходах на задачу. Anthropic заявляет, что Opus 5.5 на 40% дешевле Opus 5; измеренный разрыв на этом индексе больше заявленного.

Куда уходят деньги: на вход, а не на выход

Для всех моделей вход составляет примерно от половины до трех четвертей стоимости задачи. Для Opus 5.5 на medium из $1.34 приходится $0.82 на вход, то есть 61%. Для GPT-6 Astra на max — 58%, для GPT-6 Sol на max — 70%, для Fable 5.1 на max — 49%. Агентные задачи повторно отправляют растущий контекст на каждом шаге, поэтому расход на вход растет с числом шагов, а не только с длиной ответа.

Поэтому GPT-6 Sol без рассуждений стоит дороже, чем на low: $0.33 против $0.13, хотя пишет всего 4,900 выходных токенов. $0.28 из $0.33 — это вход. Вероятная причина — больше шагов, каждый из которых повторно отправляет контекст. Отключение рассуждений не делает агента дешевле, если ему затем нужно больше ходов.

Для вашего счета это значит, что кэширование важно не меньше выбора модели. Opus 5.5 и GPT-6 Sol берут $0.20 за миллион закэшированных входных токенов. GPT-6 Astra берет $1.00, а Opus 5 — $0.50.

Объем токенов против списочной цены

GPT-6 Astra — самая экономная по токенам модель в этом списке. На max она пишет 27,200 выходных токенов на задачу против 119,200 у Opus 5.5 на max. Но Astra берет $10 и $50 за миллион, то есть в 2.5× больше тарифа Opus 5.5. Побеждает списочная цена: Opus 5.5 на high стоит $1.82 за задачу и набирает 53.6, а Astra на max стоит $3.26 и набирает 52.7.

Opus 5.5 на max — единственное место, где многословность бьет по карману. Его 119,200 выходных токенов стоят $2.38 еще до входа, а вся задача — $5.98. Это покупает самую высокую оценку в таблице, 57.6, но стоит в 4.5× дороже medium.

Убывающая отдача по усилиям

Каждая строка показывает, что дает один шаг вверх по усилиям: пункты индекса против дополнительной стоимости задачи.

Модельmedium → highxhigh → max
GPT-6 Sol+3.0 пункта за +48%+3.4 пункта за +100%
GPT-6 Astra+1.3 пункта за +12%+0.3 пункта за +41%
Claude Opus 5+3.3 пункта за +65%+1.1 пункта за +20%
Claude Opus 5.5+2.4 пункта за +36%+1.6 пункта за +73%
Claude Fable 5.1+2.3 пункта за +31%+0.2 пункта за +28%

Для Fable 5.1 и GPT-6 Astra максимальные усилия почти ничего не дают: 0.2 и 0.3 пункта за 28% и 41% больше. Для Opus 5.5 переход на max все еще дает 1.6 пункта, но стоит на 73% больше. Используйте max только для задач, где вы измерили, что дополнительные пункты меняют результат.

Когда достаточно GPT-6 Sol max

Индекс — это среднее значение, и разрыв между Sol max и Opus 5.5 medium распределен по оценкам неравномерно. Оценки Artificial Analysis по отдельным тестам:

ОценкаOpus 5.5 medium ($1.34)GPT-6 Sol max ($1.06)
Terminal-Bench 4.052.543.9
AutomationBench-AA61.261.6
GDPval-AA (Elo)15761487
AA-Briefcase (Elo)16421483
Humanity's Last Exam54.747.9
SciCode59.357.6
CritPt27.730.9
AA-LCR84.383.7

На AutomationBench и CritPt GPT-6 Sol не уступает или превосходит Opus 5.5 на medium за $1.06 за задачу против $1.34. На Terminal-Bench, оценках работы со знаниями и Humanity's Last Exam Opus 5.5 значительно впереди. Автоматизацию рабочих процессов можно вести на Sol. Терминальные и кодовые агенты и работа со знаниями, опирающаяся на большие документы, — там Opus 5.5 оправдывает свою цену.

Заявления вендоров и независимые цифры

Цифры вендоров и независимые цифры часто расходятся, потому что используют разные обвязки и настройки. Anthropic сообщает 66.4% на Terminal-Bench 4.0 для Opus 5.5 на xhigh. Artificial Analysis измеряет 59.6% при том же уровне усилий.

УсилияOpus 5.5Fable 5.1
low31.3%40.4%
medium52.5%44.9%
high56.6%52.0%
xhigh59.6%55.1%
max59.6%52.0%

Ранжирование тоже может меняться в зависимости от индекса. В Vals AI Index Fable 5.1 на первом месте с 68.83%, GPT-6 Astra на третьем с 66.61%, Opus 5.5 на четвертом с 66.16%. Стоимость задачи там публикуется не на той же основе, поэтому она не сдвигает границу выше. Это напоминание, что один индекс — это один взгляд.

Списочные цены и задача с большим кэшем

Digital Applied оценил одну агентную задачу с большим кэшем на каждой модели: 8M токенов чтения кэша, 400K входа без кэша, 600K записи в кэш и 300K выхода. Результат следует границе, с одним дополнительным штрафом для GPT-6 Astra.

МодельВход $/MTokВыход $/MTokЧтение кэша $/MTokЗадача с большим кэшем (Digital Applied)
GPT-6 Sol$2.00$10.00$0.20$6.90
Claude Opus 5.5$4.00$20.00$0.20$12.20
Claude Opus 5$5.00$25.00$0.50$17.25
Claude Fable 5.1$10.00$50.00$0.25$28.50
GPT-6 Astra (≤272K)$10.00$50.00$1.00$34.50
GPT-6 Astra (>272K)$20.00$75.00n/a$61.50

GPT-6 Astra начисляет всему запросу $20 и $75 за миллион, когда вход превышает 272K токенов. Opus 5.5 держит одну цену во всем окне в 1M токенов. Запись в кэш у Opus 5.5 стоит $5 за миллион для 5-минутного кэша и $8 для 1-часового, пакетные задачи оплачиваются с 50% скидкой, а быстрый режим удваивает цену. Подробности — в модели стоимости Claude Opus 5.5 и экономике быстрого режима Opus 5.5.

Как измерить собственную стоимость задачи

  1. Записывайте токены на задачу, а не на запрос: вход без кэша, вход из кэша, записи в кэш и выход, суммированные по всем шагам задачи.
  2. Возьмите выборку из нескольких сотен реальных задач и прогоните ее на двух-трех кандидатных настройках, например Sol max, Opus 5.5 medium и Opus 5.5 high.
  3. Оцените каждый результат той же проверкой, что используете в продакшене, и посчитайте задачи, которые прошли.
  4. Разделите общие расходы на число пройденных задач. Стоимость успешной задачи — вот число для сравнения, потому что дешевая настройка, которая чаще падает, не является дешевой.
  5. Выберите самую дешевую настройку, которая проходит вашу планку качества, и направляйте на более высокую настройку только задачи, которые она не прошла.
  6. Повторяйте прогон, когда меняются цена или усилие по умолчанию.

Чтобы увидеть, как усилия меняют счет одной модели, см. Уровни усилий Opus 5.5 — это реальная цена.

Оговорки

Источники

По теме


Хотите применить это к своему стеку? Принесите счета провайдеров, логи шлюза и ключевые рабочие процессы — мы определим драйверы затрат и пути экономии. Заказать бесплатный аудит →

Вернуться на finopsllm.com