Цена модели с открытыми весами
Обновлено September 1, 2026 · впервые опубликовано September 1, 2026
Qwen3.8-Flash-Next появилась 26 августа 2026 года как превью с открытыми весами архитектуры Qwen4: примерно 6B активных параметров, нативный контекст 262,144 токена и без объявленной облачной цены. Это ломает обычное сравнение. Закрытая модель дает одно число за миллион токенов, а релиз с открытыми весами дает чекпоинт и оставляет число вам.
Число посчитать несложно. Просто большинство команд его не считают: сравнивают загрузку за $0 с API по $3.00/MTok и делают вывод, что загрузка дешевле. Возможно, так и есть. Решает арифметика, а в ней есть ровно один член, который люди забывают.
Формула
Стоимость за миллион токенов — это почасовая цена инстанса, деленная на количество токенов, которое инстанс выдает за час:
cost per MTok = hourly_price / (tokens_per_second * 3600) * 1,000,000При $2.00 в час и измеренных 1,500 токенах в секунду получается 2.00 / 5,400,000 * 1,000,000 = $0.37 за миллион токенов. По сравнению с облачной моделью по $3.00/MTok на выходе самостоятельное развертывание выглядит как восьмикратная экономия. Но и эта цифра неверна, потому что предполагает, что GPU занят каждую секунду, за которую вы платите.
Член, который все забывают: загрузка
Вы арендуете час, а используете его часть. Делите на эту долю:
| Загрузка | Эффективная стоимость за MTok |
|---|---|
| 100% | $0.37 |
| 60% | $0.62 |
| 30% | $1.23 |
| 10% | $3.70 |
При загрузке 10% собственная модель стоит дороже облачного API, которое она должна была заменить. Большинство первых развертываний попадают в диапазон от 10% до 30%, потому что трафик неравномерен, а инстанс рассчитан на пик. Экономия реальна, но это экономия на загрузке, а не на весах.
Что еще входит в расчет
Хранение и исходящий трафик для чекпоинта. Простой между запуском инстанса и моментом, когда модель прогрета: для модели с большим контекстом загрузка занимает минуты, и за все эти минуты вы платите. Резервирование, если нагрузке нужно больше одного инстанса, чтобы пережить сбой узла. И время инженеров, которое не тарифицируется почасово, но в первый год оно самая большая статья.
Ничто из этого не говорит против самостоятельного развертывания. Оно говорит против сравнения бесплатной загрузки с тарифом за токен без выполнения деления.
Измерьте, прежде чем обязываться
Запустите модель на инстансе, который вы реально арендуете, с вашими формами промптов и вашими длинами контекста, и записывайте токены в секунду при параллельной нагрузке, а не одиночный поток из карточки модели. Затем возьмите реальный почасовой профиль трафика и посчитайте загрузку. Два числа, одно деление, и решение принимается само.
Длинный контекст бьет сильнее всего. Контекст 262K токенов сначала становится расходом памяти, и только потом функцией: он задает класс инстанса, а класс инстанса задает почасовую цену в верхней части формулы. Считайте стоимость того контекста, который вы реально отправляете, а не того, который поддерживает модель.
Связанное
По теме
Хотите применить это к своему стеку? Принесите счета провайдеров, логи шлюза и ключевые рабочие процессы — мы определим драйверы затрат и пути экономии. Заказать бесплатный аудит →