Расходы на LLM вне продакшена
Обновлено September 1, 2026 · впервые опубликовано September 1, 2026
Любой FinOps-обзор расходов на LLM начинается с продакшен-трафика, потому что у него есть дашборд. Потом кто-то разбивает цифры по окружениям и обнаруживает, что заметная часть счёта — нередко двузначный процент — никогда не касалась клиента.
Она берётся из четырёх мест, и они накладываются друг на друга.
Откуда берутся расходы вне продакшена
CI. Каждый pull request, который запускает набор оценок, вызывает модель. Набор из двухсот кейсов в активном репозитории — это тысячи вызовов в день, на самой мощной модели, потому что тот, кто писал набор, вполне разумно хотел, чтобы он отражал продакшен.
Локальная разработка. Инженеры, которые итерируют промпт, обращаются к API десятки раз в час, обычно с общим ключом и обычно без тегов, по которым видно, чей это цикл.
Staging и демо-инстансы. Долгоживущие, с низкой нагрузкой и настроенные так же, как продакшен — то есть с дорогой моделью и без кэширования, обслуживающие горстку запросов, за которыми никто не следит.
Повторы и разгулявшиеся циклы в тестах. Агентный цикл, который безопасно падает в продакшене, всё равно сжигает токены, когда ведёт себя неправильно в какой-то ветке, а в тестовом окружении ничего не настроено на то, чтобы это заметить.
Сначала исправьте атрибуцию, потом стоимость
Единственное изменение, которое окупается сразу, — отдельный API-ключ для каждого окружения. На это уходит полдня, и одна необъяснённая строка счёта превращается в четыре подписанные. Помечайте каждый запрос окружением, а для CI — репозиторием и workflow. Без этого все предложения ниже — гадание.
Когда вы это видите, обычно сразу следуют три вещи. Вне продакшена почти всегда достаточно модели поменьше: наборам оценок нужна стабильность, а не возможности фронтирной модели, и большинство из них может закрепить более дешёвую модель без потери сигнала. Вне продакшена кэширование окупается лучше всего, потому что CI весь день повторяет почти одинаковые промпты. И вне продакшена жёсткие лимиты расходов действительно безопасны: тестовое окружение с лимитом падает на сборке, а продакшен с лимитом подводит клиента.
Правило
Дайте каждому непродакшен-окружению свой ключ, свой бюджет и свой лимит. Тогда разрыв между окружениями становится числом, которым вы управляете осознанно, а не тем, что обнаруживаете на квартальном обзоре.
Связанное
По теме
Хотите применить это к своему стеку? Принесите счета провайдеров, логи шлюза и ключевые рабочие процессы — мы определим драйверы затрат и пути экономии. Заказать бесплатный аудит →