Перейти к содержанию

Расходы на LLM вне продакшена

Обновлено September 1, 2026 · впервые опубликовано September 1, 2026

Краткий ответ: Любой FinOps-обзор расходов на LLM начинается с продакшен-трафика, потому что у него есть дашборд. Потом кто-то разбивает цифры по окружениям и обнаруживает, что заметная часть счёта — нередко...

Любой FinOps-обзор расходов на LLM начинается с продакшен-трафика, потому что у него есть дашборд. Потом кто-то разбивает цифры по окружениям и обнаруживает, что заметная часть счёта — нередко двузначный процент — никогда не касалась клиента.

Она берётся из четырёх мест, и они накладываются друг на друга.

Откуда берутся расходы вне продакшена

CI. Каждый pull request, который запускает набор оценок, вызывает модель. Набор из двухсот кейсов в активном репозитории — это тысячи вызовов в день, на самой мощной модели, потому что тот, кто писал набор, вполне разумно хотел, чтобы он отражал продакшен.

Локальная разработка. Инженеры, которые итерируют промпт, обращаются к API десятки раз в час, обычно с общим ключом и обычно без тегов, по которым видно, чей это цикл.

Staging и демо-инстансы. Долгоживущие, с низкой нагрузкой и настроенные так же, как продакшен — то есть с дорогой моделью и без кэширования, обслуживающие горстку запросов, за которыми никто не следит.

Повторы и разгулявшиеся циклы в тестах. Агентный цикл, который безопасно падает в продакшене, всё равно сжигает токены, когда ведёт себя неправильно в какой-то ветке, а в тестовом окружении ничего не настроено на то, чтобы это заметить.

Сначала исправьте атрибуцию, потом стоимость

Единственное изменение, которое окупается сразу, — отдельный API-ключ для каждого окружения. На это уходит полдня, и одна необъяснённая строка счёта превращается в четыре подписанные. Помечайте каждый запрос окружением, а для CI — репозиторием и workflow. Без этого все предложения ниже — гадание.

Когда вы это видите, обычно сразу следуют три вещи. Вне продакшена почти всегда достаточно модели поменьше: наборам оценок нужна стабильность, а не возможности фронтирной модели, и большинство из них может закрепить более дешёвую модель без потери сигнала. Вне продакшена кэширование окупается лучше всего, потому что CI весь день повторяет почти одинаковые промпты. И вне продакшена жёсткие лимиты расходов действительно безопасны: тестовое окружение с лимитом падает на сборке, а продакшен с лимитом подводит клиента.

Правило

Дайте каждому непродакшен-окружению свой ключ, свой бюджет и свой лимит. Тогда разрыв между окружениями становится числом, которым вы управляете осознанно, а не тем, что обнаруживаете на квартальном обзоре.

Связанное

По теме


Хотите применить это к своему стеку? Принесите счета провайдеров, логи шлюза и ключевые рабочие процессы — мы определим драйверы затрат и пути экономии. Заказать бесплатный аудит →

Вернуться на finopsllm.com