Перейти к содержанию

Цена модели с открытыми весами

Обновлено September 1, 2026 · впервые опубликовано September 1, 2026

Краткий ответ: Qwen3.8-Flash-Next появилась 26 августа 2026 года как превью с открытыми весами архитектуры Qwen4: примерно 6B активных параметров, нативный контекст 262,144 токена и без объявленной облачной цены....

Qwen3.8-Flash-Next появилась 26 августа 2026 года как превью с открытыми весами архитектуры Qwen4: примерно 6B активных параметров, нативный контекст 262,144 токена и без объявленной облачной цены. Это ломает обычное сравнение. Закрытая модель дает одно число за миллион токенов, а релиз с открытыми весами дает чекпоинт и оставляет число вам.

Число посчитать несложно. Просто большинство команд его не считают: сравнивают загрузку за $0 с API по $3.00/MTok и делают вывод, что загрузка дешевле. Возможно, так и есть. Решает арифметика, а в ней есть ровно один член, который люди забывают.

Формула

Стоимость за миллион токенов — это почасовая цена инстанса, деленная на количество токенов, которое инстанс выдает за час:

cost per MTok = hourly_price / (tokens_per_second * 3600) * 1,000,000

При $2.00 в час и измеренных 1,500 токенах в секунду получается 2.00 / 5,400,000 * 1,000,000 = $0.37 за миллион токенов. По сравнению с облачной моделью по $3.00/MTok на выходе самостоятельное развертывание выглядит как восьмикратная экономия. Но и эта цифра неверна, потому что предполагает, что GPU занят каждую секунду, за которую вы платите.

Член, который все забывают: загрузка

Вы арендуете час, а используете его часть. Делите на эту долю:

ЗагрузкаЭффективная стоимость за MTok
100%$0.37
60%$0.62
30%$1.23
10%$3.70

При загрузке 10% собственная модель стоит дороже облачного API, которое она должна была заменить. Большинство первых развертываний попадают в диапазон от 10% до 30%, потому что трафик неравномерен, а инстанс рассчитан на пик. Экономия реальна, но это экономия на загрузке, а не на весах.

Что еще входит в расчет

Хранение и исходящий трафик для чекпоинта. Простой между запуском инстанса и моментом, когда модель прогрета: для модели с большим контекстом загрузка занимает минуты, и за все эти минуты вы платите. Резервирование, если нагрузке нужно больше одного инстанса, чтобы пережить сбой узла. И время инженеров, которое не тарифицируется почасово, но в первый год оно самая большая статья.

Ничто из этого не говорит против самостоятельного развертывания. Оно говорит против сравнения бесплатной загрузки с тарифом за токен без выполнения деления.

Измерьте, прежде чем обязываться

Запустите модель на инстансе, который вы реально арендуете, с вашими формами промптов и вашими длинами контекста, и записывайте токены в секунду при параллельной нагрузке, а не одиночный поток из карточки модели. Затем возьмите реальный почасовой профиль трафика и посчитайте загрузку. Два числа, одно деление, и решение принимается само.

Длинный контекст бьет сильнее всего. Контекст 262K токенов сначала становится расходом памяти, и только потом функцией: он задает класс инстанса, а класс инстанса задает почасовую цену в верхней части формулы. Считайте стоимость того контекста, который вы реально отправляете, а не того, который поддерживает модель.

Связанное

По теме


Хотите применить это к своему стеку? Принесите счета провайдеров, логи шлюза и ключевые рабочие процессы — мы определим драйверы затрат и пути экономии. Заказать бесплатный аудит →

Вернуться на finopsllm.com